跳转到内容

Agent 前沿技术与学习地图:从模型能力到可靠系统

2023 年,人们用 AutoGPT、BabyAGI 演示“模型可以自己分解任务、调用工具、继续循环”。到 2026 年,问题已经发生变化:不是 Agent 能不能跑起来,而是它能不能在有权限、有状态、有失败的真实环境里长期运行。

这三年最重要的迁移,是讨论中心从 Prompt 和角色扮演,逐渐移向 Context、Harness、Durable Execution、Eval、协议、安全和运营。

最后一讲不做“十大趋势”式预测,而是按证据强弱回答:技术从哪里来,今天的主战场是什么,未来三类方向如何区分,以及怎样用 12 周建立系统知识。

一、来龙去脉:Agent 技术经历了四次重心迁移

Section titled “一、来龙去脉:Agent 技术经历了四次重心迁移”

ReAct 把推理与行动交替组织起来,奠定了“模型观察:决定:调用工具:继续”的基本形态。[1] 这个 Loop 让语言模型从一次性回答变成与环境互动的决策者。

第二阶段:自治演示与角色社会

Section titled “第二阶段:自治演示与角色社会”

AutoGPT、BabyAGI、MetaGPT 等项目把目标分解、任务列表、角色协作和自主循环带入大众视野。它们证明了想象空间,也暴露出循环失控、上下文膨胀、错误累积和不可验证等问题。

第三阶段:状态、记忆与工作流

Section titled “第三阶段:状态、记忆与工作流”

Reflexion 探索语言反馈,Generative Agents 组织观察、反思和规划,MemGPT 研究分层记忆,StateFlow 强调显式状态。[2][3][4][5]

与此同时,LangGraph、AutoGen、CrewAI、CAMEL 等框架将状态图、多 Agent 和编排工程化。行业开始意识到:Agent 不是一个 Prompt,而是模型嵌入控制系统。

第四阶段:生产基础设施与互操作

Section titled “第四阶段:生产基础设施与互操作”

当前重点进一步移向工具协议、长时运行、沙箱、评测、可观测性、身份与安全。MCP、A2A、ACP、AG-UI 分别尝试标准化不同连接边界;OpenAI Agents SDK、PydanticAI、Google ADK、Microsoft Agent Framework 等把 Trace、Session、Eval、Approval 和 Durable 能力纳入框架。

这不是 Prompt 消失了,而是 Prompt 被放回更大的系统中。

二、未来 Agent 系统需要的十二项技术

Section titled “二、未来 Agent 系统需要的十二项技术”

模型能力越强,越需要准确选择当前任务所需的指令、事实、工具、历史和预算。Context 不再是“把所有资料放进长窗口”,而是一个有来源、权限、新鲜度和压缩策略的运行时输入系统。

工具需要清楚 Schema、错误、幂等和权限。模型负责提出动作,Harness 和业务系统负责校验。未来工具生态会更标准化,但 Tool Contract 仍是领域设计。

长任务必须有机器可读状态、状态迁移、重试预算和终态。Loop Engineering 会越来越像普通分布式 Workflow 工程:模型是一个动态决策节点,而不是全部控制面。

检查点、队列、幂等、恢复、取消和补偿会成为生产 Agent 基础能力。一个任务运行数小时或等待人工几天,不能依靠单个进程和聊天历史存活。

未来 Memory 的关键不是“记得更多”,而是写入、管理、读取的生命周期:谁写的、属于哪个租户、何时过期、能否删除、与当前事实是否冲突。时序图谱、分层记忆和后台整理会在不同任务中共存。

多 Agent 会从角色聊天走向专业工具、上下文隔离、并行 Worker、最小权限和独立验证。价值来自边界,不来自角色数量。

MCP 连接应用与工具,A2A 连接自治 Agent,ACP 连接 Coding Client,AG-UI 连接用户界面。接下来真正困难的是跨层身份委派、状态对齐和协议版本治理。

Agent Eval 会同时检查业务终态、轨迹和安全,并从离线 Case 延伸到 Shadow、Canary 和线上回流。环境证据将比模型自评更重要。

Trace、Span、Artifact、成本和状态事件会形成统一运行证据。重点从“记录每次模型调用”转向“解释每个用户任务为何成功或失败”。

Prompt Injection 很难靠 Prompt 消除。最小 Capability、短期凭据、数据流政策、沙箱、批准和供应链治理会成为 Agent 能否进入高风险业务的前提。

Agent 将操作浏览器、终端、桌面和更多真实环境。DOM、视觉、可访问性树、隔离 Runtime 与终态验证要共同工作。能力增长越快,环境责任越重。

DSPy 把 LM 程序与评测驱动优化连接起来,Agent Lightning 等项目探索对现有 Agent 的训练与信用分配。[6][7] 未来优化对象不只是 Prompt,还包括路由、Tool Policy、Memory、轨迹和模型组合。

三、25 个核心项目:不是榜单,而是设计课

Section titled “三、25 个核心项目:不是榜单,而是设计课”

以下项目来自 2026-07-19 GitHub 动态快照。推荐按“它把复杂度放在哪里”阅读。

项目 快照 Stars 最值得看的设计
OpenAI Agents SDK 28,017 最小 Runner、Tool、Handoff、Tracing
LangGraph 37,611 State Graph、Checkpoint、HITL
PydanticAI 18,649 类型化依赖/输出、Toolset、Eval
Google ADK 20,689 Agent 生命周期、Event、Session、Deploy
Microsoft Agent Framework 12,222 Agent + Workflow、Durable、多种编排
smolagents 28,436 Code Agent 与简洁 Agency 抽象
CrewAI 55,776 Crew 自治角色与 Flow 确定控制的双层
CAMEL 17,423 RolePlaying、Societies、Workforce
项目 快照 Stars 最值得看的设计
Mem0 61,173 通用 Memory Layer 与跨应用接入
Letta 23,865 Stateful Agent 与分层上下文/记忆
Graphiti 28,909 动态时序知识图谱与事实演进
项目 快照 Stars 最值得看的设计
Model Context Protocol 8,630 Host/Client/Server 与三类能力
FastMCP 26,282 Python MCP Client/Server 开发体验
A2A 24,872 独立 Agent 的发现、任务和工件
ACP 3,693 Editor/Client 与 Coding Agent 会话
AG-UI 14,808 Agent 后端与前端的类型化事件
项目 快照 Stars 最值得看的设计
Browser Use 105,546 开放网页状态与浏览器动作
OpenHands 81,303 Coding Agent、Runtime、产品界面
E2B 13,038 隔离沙箱与 Agent 执行环境
Daytona 72,244 弹性开发环境与代码执行基础设施
项目 快照 Stars 最值得看的设计
Promptfoo 23,409 配置化测试、RAG/Agent Eval、红队
Inspect AI 2,372 Task、Solver、Tool、Scorer 的可组合评测
Langfuse 31,420 Trace、Dataset、Prompt 与 Eval 闭环
Phoenix 10,623 AI Observability、Experiment、Evaluation
τ2-bench 1,612 多轮用户:Agent:工具环境评测

Star 低不等于不重要。协议规范、评测框架和基础库的用户可能通过其他产品间接使用。选择时仍要看维护、License、设计适配和真实 Eval。

完整快照包含 55 个项目,按功能分为:

  • 框架:OpenAI Agents SDK、LangGraph、PydanticAI、Google ADK、Microsoft Agent Framework、smolagents、Strands Harness SDK、CrewAI、CAMEL、AutoGen、LlamaIndex、AgentScope;
  • Memory:Mem0、Letta、Graphiti、LangMem、Supermemory;
  • 工具/协议:MCP Specification、MCP Servers、FastMCP、Composio、A2A、ACP、AG-UI、Anthropic Skills;
  • Computer/Runtime:Browser Use、OpenHands、Skyvern、Magentic-UI、Playwright MCP、E2B、Daytona;
  • Eval/Observability:Promptfoo、Inspect AI、OpenAI Evals、OpenEvals、τ2-bench、Langfuse、Phoenix、AgentOps、OpenTelemetry Semantic Conventions、OpenLLMetry;
  • 生产与优化:Agent Lightning、DSPy、vLLM、SGLang、LiteLLM、Temporal Python SDK、DBOS Transact;
  • 历史项目:AutoGPT、BabyAGI、Semantic Kernel、MetaGPT;
  • 结构化输出/Guardrails:Instructor、Guardrails AI。

机器可读的完整指标和 CSV 已随本文交付:repository-snapshot.jsonrepository-landscape.csv

这里有一个故意保留的重复:AutoGen 在当前框架与历史演进中都有意义;55 项快照里只计一次。分类是学习视角,不是仓库官方分类。

五、三档未来判断:事实、强推断与开放问题

Section titled “五、三档未来判断:事实、强推断与开放问题”

A 档:已经发生,可直接投入工程

Section titled “A 档:已经发生,可直接投入工程”
  • Tool Use、结构化输出和状态机成为主流框架基础;
  • MCP 等协议扩大工具可连接性;
  • Trace、Eval、沙箱和批准进入框架与生产指南;
  • Coding Agent、Browser Agent 已形成高关注开源生态;
  • 长时任务开始连接 Durable Workflow;
  • AutoGen 等早期框架经验正在被新一代统一框架吸收。

这些判断有官方规范、源码、文档和活跃项目支持。

B 档:有多条证据支持,但落地仍分化

Section titled “B 档:有多条证据支持,但落地仍分化”
  • Agent Harness 会成为比单一模型更稳定的产品差异;
  • 多 Agent 将主要用于上下文和权限边界,而非开放群聊;
  • Memory 会从向量检索扩展为带来源、时间和治理的基础设施;
  • Eval 会与线上 Trace、发布 Gate 和优化闭环合流;
  • 协议会按工具、Agent、Client、UI 分层共存;
  • 小模型/大模型、规则/模型会按任务动态组合。

这是根据多个项目设计的共同方向作出的工程推断,不代表行业已经形成单一标准。

C 档:值得研究,但不应写成确定事实

Section titled “C 档:值得研究,但不应写成确定事实”
  • 大规模开放 Agent 社会能否长期稳定协作;
  • Agent 是否会形成通用、可交易的能力市场;
  • 端到端训练能否显著替代手工 Harness 设计;
  • 完全自主、跨周运行的通用工作 Agent 何时经济可行;
  • 多协议能否形成统一身份和责任基础设施。

这些方向有实验和产品探索,但安全、成本、归因、互操作和治理仍未解决。

Prompt 不会消失,但它会从“包办一切的魔法文本”变成系统中的一个版本化组件。

未来更常见的形态是:稳定政策由代码和权限系统执行,当前上下文由 Harness 动态构建,工具由 Schema 描述,业务状态由状态机维护,验证器读取环境证据;Prompt 负责表达目标、语气和模型需要的局部规则。

所以,Prompt Engineering 并没有失效,而是被 Context Engineering 和 Agent Systems Engineering 包围。越靠后,越不能把全部工程责任压在一段文字上。

第 1:2 周:模型、Tool 与最小 Loop

Section titled “第 1:2 周:模型、Tool 与最小 Loop”

学习结构化输出、函数调用、ReAct 和停止条件。手写一个不依赖框架的 Python Loop,能处理未知工具、Schema 错误、预算耗尽和成功终态。

实现上下文选择、来源标记和 Token 预算;做一份短期会话状态与长期 Memory,支持作用域、更新和删除。比较 Mem0、Letta、Graphiti 的设计,不急着全部接入。

第 5:6 周:State、Harness 与 Durable

Section titled “第 5:6 周:State、Harness 与 Durable”

把任务改为显式状态机,加入检查点、幂等和故障注入。选择 LangGraph、PydanticAI、ADK 或 Microsoft AF 做一次同任务实现。

先建立单 Agent 基线,再分别实现 Manager、Handoff 和 Parallel。用 MCP 接一个只读 Server,画清 A2A、ACP、AG-UI 的责任边界。

建立 30 个包含正常、边界、历史故障和攻击的 Case;同时检查终态、轨迹和安全。加入 OpenTelemetry 风格 Trace、敏感字段脱敏和最小 Capability。

选择研究、客服或 Coding Agent,完成 Shadow/Canary 方案、SLO、Kill Switch 和人工接管。写一份设计文档,明确不自动化的部分。

每两周都交付可运行工件和实验结果,不以“看完课程”作为完成。

八、公开课怎样组合,而不是重复刷课

Section titled “八、公开课怎样组合,而不是重复刷课”

Hugging Face AI Agents Course 覆盖 Agent 基础、框架、Agentic RAG、评测与结业项目,适合作为第一条实践主线。[8]

Hugging Face AI Agents Course

图 1:Hugging Face 官方课程适合建立第一套可运行基础。来源见文末。

Microsoft AI Agents for Beginners 以 18 课开源课程覆盖设计模式、工具、RAG、Multi-Agent、Context Engineering、Memory、协议与生产。[9]

Microsoft AI Agents for Beginners

图 2:Microsoft 开源课程适合按专题查缺补漏。来源见文末。

Berkeley LLM Agents 课程更偏理论、研究、基础设施与风险,适合在有实践后理解论文和前沿问题。[10][11]

Berkeley LLM Agents 课程

图 3:大学课程提供比框架教程更长的理论纵深。来源见文末。

还可以用 DeepLearning.AI 的 Agentic AI 课程梳理 Reflection、Tool Use、Planning 和 Multi-Agent,用 LangChain Academy 深入 State/Checkpoint,用 Google/Kaggle Agent Intensive 和 OpenAI Academy 补生产案例。[12][13][14][15]

课程矩阵已随文交付:course-curriculum-matrix.csv

九、20:40 分钟实践:建立个人 Agent 技术雷达

Section titled “九、20:40 分钟实践:建立个人 Agent 技术雷达”

创建一个四列表:

技术领域 | 我能解释 | 我能实现 | 我有真实 Eval
Tool Use | yes | yes | no
Memory | yes | partial | no
Durable | partial | no | no
Security | partial | partial | no

对本文十二项技术逐一评分。优先选择“能解释但没有真实 Eval”的一项,设计一个失败实验,而不是继续安装新框架。

再从 25 个核心项目中只选三个:一个框架、一个基础设施、一个 Eval/Observability 项目。用第 23 讲五个源码入口做读书卡,写清它解决什么、不解决什么、进入你的系统会增加什么责任。

先读 1、2、4、14、18、21、22、24,重点理解终态、权限、评测与生产边界。

按 1:13、18:20、22:24 阅读,再选一个框架实现。

重点读 8:13、15:22,关注 Context、State、Durable、协议、身份和 Trace。

先掌握 3、6、7、9、14、18,再读课程与论文,避免把实验结果直接写成生产事实。

十一、整套连载最终要建立的判断力

Section titled “十一、整套连载最终要建立的判断力”

看见一个新 Agent 项目时,不再只问“它用了什么模型”,而会继续问:

  • Harness 把上下文怎样构建;
  • Loop 的状态和停止条件在哪里;
  • Tool 权限与错误怎样表达;
  • Memory 怎样写、更新、删除;
  • 多 Agent 是否存在真实边界;
  • 协议连接的是哪一层;
  • 长任务怎样恢复;
  • 完成由什么环境证据证明;
  • Eval 是否包含重复、边界和攻击;
  • Trace、成本和责任是否可追溯。

这套问题比记住任何一个框架 API 更耐久。

Agent 技术的主线,正在从“让模型多做几步”发展为“让模型在受控系统中持续完成目标”。未来竞争力会更多来自 Context、Harness、状态、协议、Eval、执行环境、安全和运营的组合。

对学习者而言,最有效的路径不是追完所有新闻和仓库,而是围绕一个真实任务持续构建:先有最小 Loop,再有状态和工具,再用故障、攻击与 Eval 逼出可靠工程。

25 篇到这里收束。模型提供推理与生成,Agent 由模型、Harness、环境和证据共同成立;真正决定它能否进入生产的,是系统怎样面对不确定性。


[1] Yao et al., ReAct. https://arxiv.org/abs/2210.03629

[2] Shinn et al., Reflexion. https://arxiv.org/abs/2303.11366

[3] Park et al., Generative Agents. https://arxiv.org/abs/2304.03442

[4] Packer et al., MemGPT. https://arxiv.org/abs/2310.08560

[5] Wu et al., StateFlow. https://arxiv.org/abs/2403.11322

[6] Stanford NLP, DSPy. https://github.com/stanfordnlp/dspy

[7] Microsoft, Agent Lightning. https://github.com/microsoft/agent-lightning

[8] Hugging Face, AI Agents Course. https://huggingface.co/learn/agents-course/unit0/introduction

[9] Microsoft, AI Agents for Beginners. https://github.com/microsoft/ai-agents-for-beginners

[10] UC Berkeley, Large Language Model Agents, Fall 2024. https://rdi.berkeley.edu/llm-agents/f24

[11] UC Berkeley, Advanced Large Language Model Agents, Spring 2025. https://rdi.berkeley.edu/adv-llm-agents/sp25

[12] DeepLearning.AI, Agentic AI. https://www.deeplearning.ai/courses/agentic-ai

[13] LangChain Academy, Introduction to LangGraph. https://academy.langchain.com/courses/intro-to-langgraph

[14] Google, AI Agents Intensive Course Recap. https://blog.google/innovation-and-ai/technology/developers-tools/ai-agents-intensive-recap/

[15] OpenAI Academy, Builder Bootcamp. https://academy.openai.com/public/clubs/builders-etkn1/resources/builder-bootcamp-2026-04-22