Agent 前沿技术与学习地图:从模型能力到可靠系统
2023 年,人们用 AutoGPT、BabyAGI 演示“模型可以自己分解任务、调用工具、继续循环”。到 2026 年,问题已经发生变化:不是 Agent 能不能跑起来,而是它能不能在有权限、有状态、有失败的真实环境里长期运行。
这三年最重要的迁移,是讨论中心从 Prompt 和角色扮演,逐渐移向 Context、Harness、Durable Execution、Eval、协议、安全和运营。
最后一讲不做“十大趋势”式预测,而是按证据强弱回答:技术从哪里来,今天的主战场是什么,未来三类方向如何区分,以及怎样用 12 周建立系统知识。
一、来龙去脉:Agent 技术经历了四次重心迁移
Section titled “一、来龙去脉:Agent 技术经历了四次重心迁移”第一阶段:Reason + Act
Section titled “第一阶段:Reason + Act”ReAct 把推理与行动交替组织起来,奠定了“模型观察:决定:调用工具:继续”的基本形态。[1] 这个 Loop 让语言模型从一次性回答变成与环境互动的决策者。
第二阶段:自治演示与角色社会
Section titled “第二阶段:自治演示与角色社会”AutoGPT、BabyAGI、MetaGPT 等项目把目标分解、任务列表、角色协作和自主循环带入大众视野。它们证明了想象空间,也暴露出循环失控、上下文膨胀、错误累积和不可验证等问题。
第三阶段:状态、记忆与工作流
Section titled “第三阶段:状态、记忆与工作流”Reflexion 探索语言反馈,Generative Agents 组织观察、反思和规划,MemGPT 研究分层记忆,StateFlow 强调显式状态。[2][3][4][5]
与此同时,LangGraph、AutoGen、CrewAI、CAMEL 等框架将状态图、多 Agent 和编排工程化。行业开始意识到:Agent 不是一个 Prompt,而是模型嵌入控制系统。
第四阶段:生产基础设施与互操作
Section titled “第四阶段:生产基础设施与互操作”当前重点进一步移向工具协议、长时运行、沙箱、评测、可观测性、身份与安全。MCP、A2A、ACP、AG-UI 分别尝试标准化不同连接边界;OpenAI Agents SDK、PydanticAI、Google ADK、Microsoft Agent Framework 等把 Trace、Session、Eval、Approval 和 Durable 能力纳入框架。
这不是 Prompt 消失了,而是 Prompt 被放回更大的系统中。
二、未来 Agent 系统需要的十二项技术
Section titled “二、未来 Agent 系统需要的十二项技术”1. Context Engineering
Section titled “1. Context Engineering”模型能力越强,越需要准确选择当前任务所需的指令、事实、工具、历史和预算。Context 不再是“把所有资料放进长窗口”,而是一个有来源、权限、新鲜度和压缩策略的运行时输入系统。
2. Structured Tool Use
Section titled “2. Structured Tool Use”工具需要清楚 Schema、错误、幂等和权限。模型负责提出动作,Harness 和业务系统负责校验。未来工具生态会更标准化,但 Tool Contract 仍是领域设计。
3. Explicit State & Loop Engineering
Section titled “3. Explicit State & Loop Engineering”长任务必须有机器可读状态、状态迁移、重试预算和终态。Loop Engineering 会越来越像普通分布式 Workflow 工程:模型是一个动态决策节点,而不是全部控制面。
4. Durable Execution
Section titled “4. Durable Execution”检查点、队列、幂等、恢复、取消和补偿会成为生产 Agent 基础能力。一个任务运行数小时或等待人工几天,不能依靠单个进程和聊天历史存活。
5. Memory with Provenance
Section titled “5. Memory with Provenance”未来 Memory 的关键不是“记得更多”,而是写入、管理、读取的生命周期:谁写的、属于哪个租户、何时过期、能否删除、与当前事实是否冲突。时序图谱、分层记忆和后台整理会在不同任务中共存。
6. Multi-Agent Orchestration
Section titled “6. Multi-Agent Orchestration”多 Agent 会从角色聊天走向专业工具、上下文隔离、并行 Worker、最小权限和独立验证。价值来自边界,不来自角色数量。
7. Protocol Layering
Section titled “7. Protocol Layering”MCP 连接应用与工具,A2A 连接自治 Agent,ACP 连接 Coding Client,AG-UI 连接用户界面。接下来真正困难的是跨层身份委派、状态对齐和协议版本治理。
8. Evaluation & Verification
Section titled “8. Evaluation & Verification”Agent Eval 会同时检查业务终态、轨迹和安全,并从离线 Case 延伸到 Shadow、Canary 和线上回流。环境证据将比模型自评更重要。
9. Observability & AgentOps
Section titled “9. Observability & AgentOps”Trace、Span、Artifact、成本和状态事件会形成统一运行证据。重点从“记录每次模型调用”转向“解释每个用户任务为何成功或失败”。
10. Security, Identity & Governance
Section titled “10. Security, Identity & Governance”Prompt Injection 很难靠 Prompt 消除。最小 Capability、短期凭据、数据流政策、沙箱、批准和供应链治理会成为 Agent 能否进入高风险业务的前提。
11. Computer Use & Execution Environments
Section titled “11. Computer Use & Execution Environments”Agent 将操作浏览器、终端、桌面和更多真实环境。DOM、视觉、可访问性树、隔离 Runtime 与终态验证要共同工作。能力增长越快,环境责任越重。
12. Agent Optimization & Learning
Section titled “12. Agent Optimization & Learning”DSPy 把 LM 程序与评测驱动优化连接起来,Agent Lightning 等项目探索对现有 Agent 的训练与信用分配。[6][7] 未来优化对象不只是 Prompt,还包括路由、Tool Policy、Memory、轨迹和模型组合。
三、25 个核心项目:不是榜单,而是设计课
Section titled “三、25 个核心项目:不是榜单,而是设计课”以下项目来自 2026-07-19 GitHub 动态快照。推荐按“它把复杂度放在哪里”阅读。
框架与编排(8 个)
Section titled “框架与编排(8 个)”| 项目 | 快照 Stars | 最值得看的设计 |
|---|---|---|
| OpenAI Agents SDK | 28,017 | 最小 Runner、Tool、Handoff、Tracing |
| LangGraph | 37,611 | State Graph、Checkpoint、HITL |
| PydanticAI | 18,649 | 类型化依赖/输出、Toolset、Eval |
| Google ADK | 20,689 | Agent 生命周期、Event、Session、Deploy |
| Microsoft Agent Framework | 12,222 | Agent + Workflow、Durable、多种编排 |
| smolagents | 28,436 | Code Agent 与简洁 Agency 抽象 |
| CrewAI | 55,776 | Crew 自治角色与 Flow 确定控制的双层 |
| CAMEL | 17,423 | RolePlaying、Societies、Workforce |
Memory(3 个)
Section titled “Memory(3 个)”| 项目 | 快照 Stars | 最值得看的设计 |
|---|---|---|
| Mem0 | 61,173 | 通用 Memory Layer 与跨应用接入 |
| Letta | 23,865 | Stateful Agent 与分层上下文/记忆 |
| Graphiti | 28,909 | 动态时序知识图谱与事实演进 |
工具与协议(5 个)
Section titled “工具与协议(5 个)”| 项目 | 快照 Stars | 最值得看的设计 |
|---|---|---|
| Model Context Protocol | 8,630 | Host/Client/Server 与三类能力 |
| FastMCP | 26,282 | Python MCP Client/Server 开发体验 |
| A2A | 24,872 | 独立 Agent 的发现、任务和工件 |
| ACP | 3,693 | Editor/Client 与 Coding Agent 会话 |
| AG-UI | 14,808 | Agent 后端与前端的类型化事件 |
Computer Use 与 Runtime(4 个)
Section titled “Computer Use 与 Runtime(4 个)”| 项目 | 快照 Stars | 最值得看的设计 |
|---|---|---|
| Browser Use | 105,546 | 开放网页状态与浏览器动作 |
| OpenHands | 81,303 | Coding Agent、Runtime、产品界面 |
| E2B | 13,038 | 隔离沙箱与 Agent 执行环境 |
| Daytona | 72,244 | 弹性开发环境与代码执行基础设施 |
Eval 与 Observability(5 个)
Section titled “Eval 与 Observability(5 个)”| 项目 | 快照 Stars | 最值得看的设计 |
|---|---|---|
| Promptfoo | 23,409 | 配置化测试、RAG/Agent Eval、红队 |
| Inspect AI | 2,372 | Task、Solver、Tool、Scorer 的可组合评测 |
| Langfuse | 31,420 | Trace、Dataset、Prompt 与 Eval 闭环 |
| Phoenix | 10,623 | AI Observability、Experiment、Evaluation |
| τ2-bench | 1,612 | 多轮用户:Agent:工具环境评测 |
Star 低不等于不重要。协议规范、评测框架和基础库的用户可能通过其他产品间接使用。选择时仍要看维护、License、设计适配和真实 Eval。
四、55 个仓库的全景地图
Section titled “四、55 个仓库的全景地图”完整快照包含 55 个项目,按功能分为:
- 框架:OpenAI Agents SDK、LangGraph、PydanticAI、Google ADK、Microsoft Agent Framework、smolagents、Strands Harness SDK、CrewAI、CAMEL、AutoGen、LlamaIndex、AgentScope;
- Memory:Mem0、Letta、Graphiti、LangMem、Supermemory;
- 工具/协议:MCP Specification、MCP Servers、FastMCP、Composio、A2A、ACP、AG-UI、Anthropic Skills;
- Computer/Runtime:Browser Use、OpenHands、Skyvern、Magentic-UI、Playwright MCP、E2B、Daytona;
- Eval/Observability:Promptfoo、Inspect AI、OpenAI Evals、OpenEvals、τ2-bench、Langfuse、Phoenix、AgentOps、OpenTelemetry Semantic Conventions、OpenLLMetry;
- 生产与优化:Agent Lightning、DSPy、vLLM、SGLang、LiteLLM、Temporal Python SDK、DBOS Transact;
- 历史项目:AutoGPT、BabyAGI、Semantic Kernel、MetaGPT;
- 结构化输出/Guardrails:Instructor、Guardrails AI。
机器可读的完整指标和 CSV 已随本文交付:repository-snapshot.json、repository-landscape.csv。
这里有一个故意保留的重复:AutoGen 在当前框架与历史演进中都有意义;55 项快照里只计一次。分类是学习视角,不是仓库官方分类。
五、三档未来判断:事实、强推断与开放问题
Section titled “五、三档未来判断:事实、强推断与开放问题”A 档:已经发生,可直接投入工程
Section titled “A 档:已经发生,可直接投入工程”- Tool Use、结构化输出和状态机成为主流框架基础;
- MCP 等协议扩大工具可连接性;
- Trace、Eval、沙箱和批准进入框架与生产指南;
- Coding Agent、Browser Agent 已形成高关注开源生态;
- 长时任务开始连接 Durable Workflow;
- AutoGen 等早期框架经验正在被新一代统一框架吸收。
这些判断有官方规范、源码、文档和活跃项目支持。
B 档:有多条证据支持,但落地仍分化
Section titled “B 档:有多条证据支持,但落地仍分化”- Agent Harness 会成为比单一模型更稳定的产品差异;
- 多 Agent 将主要用于上下文和权限边界,而非开放群聊;
- Memory 会从向量检索扩展为带来源、时间和治理的基础设施;
- Eval 会与线上 Trace、发布 Gate 和优化闭环合流;
- 协议会按工具、Agent、Client、UI 分层共存;
- 小模型/大模型、规则/模型会按任务动态组合。
这是根据多个项目设计的共同方向作出的工程推断,不代表行业已经形成单一标准。
C 档:值得研究,但不应写成确定事实
Section titled “C 档:值得研究,但不应写成确定事实”- 大规模开放 Agent 社会能否长期稳定协作;
- Agent 是否会形成通用、可交易的能力市场;
- 端到端训练能否显著替代手工 Harness 设计;
- 完全自主、跨周运行的通用工作 Agent 何时经济可行;
- 多协议能否形成统一身份和责任基础设施。
这些方向有实验和产品探索,但安全、成本、归因、互操作和治理仍未解决。
六、Prompt 会不会不重要了
Section titled “六、Prompt 会不会不重要了”Prompt 不会消失,但它会从“包办一切的魔法文本”变成系统中的一个版本化组件。
未来更常见的形态是:稳定政策由代码和权限系统执行,当前上下文由 Harness 动态构建,工具由 Schema 描述,业务状态由状态机维护,验证器读取环境证据;Prompt 负责表达目标、语气和模型需要的局部规则。
所以,Prompt Engineering 并没有失效,而是被 Context Engineering 和 Agent Systems Engineering 包围。越靠后,越不能把全部工程责任压在一段文字上。
七、12 周学习路线
Section titled “七、12 周学习路线”第 1:2 周:模型、Tool 与最小 Loop
Section titled “第 1:2 周:模型、Tool 与最小 Loop”学习结构化输出、函数调用、ReAct 和停止条件。手写一个不依赖框架的 Python Loop,能处理未知工具、Schema 错误、预算耗尽和成功终态。
第 3:4 周:Context、RAG 与 Memory
Section titled “第 3:4 周:Context、RAG 与 Memory”实现上下文选择、来源标记和 Token 预算;做一份短期会话状态与长期 Memory,支持作用域、更新和删除。比较 Mem0、Letta、Graphiti 的设计,不急着全部接入。
第 5:6 周:State、Harness 与 Durable
Section titled “第 5:6 周:State、Harness 与 Durable”把任务改为显式状态机,加入检查点、幂等和故障注入。选择 LangGraph、PydanticAI、ADK 或 Microsoft AF 做一次同任务实现。
第 7:8 周:多 Agent 与协议
Section titled “第 7:8 周:多 Agent 与协议”先建立单 Agent 基线,再分别实现 Manager、Handoff 和 Parallel。用 MCP 接一个只读 Server,画清 A2A、ACP、AG-UI 的责任边界。
第 9:10 周:Eval、Trace 与安全
Section titled “第 9:10 周:Eval、Trace 与安全”建立 30 个包含正常、边界、历史故障和攻击的 Case;同时检查终态、轨迹和安全。加入 OpenTelemetry 风格 Trace、敏感字段脱敏和最小 Capability。
第 11:12 周:生产项目
Section titled “第 11:12 周:生产项目”选择研究、客服或 Coding Agent,完成 Shadow/Canary 方案、SLO、Kill Switch 和人工接管。写一份设计文档,明确不自动化的部分。
每两周都交付可运行工件和实验结果,不以“看完课程”作为完成。
八、公开课怎样组合,而不是重复刷课
Section titled “八、公开课怎样组合,而不是重复刷课”Hugging Face AI Agents Course 覆盖 Agent 基础、框架、Agentic RAG、评测与结业项目,适合作为第一条实践主线。[8]

图 1:Hugging Face 官方课程适合建立第一套可运行基础。来源见文末。
Microsoft AI Agents for Beginners 以 18 课开源课程覆盖设计模式、工具、RAG、Multi-Agent、Context Engineering、Memory、协议与生产。[9]

图 2:Microsoft 开源课程适合按专题查缺补漏。来源见文末。
Berkeley LLM Agents 课程更偏理论、研究、基础设施与风险,适合在有实践后理解论文和前沿问题。[10][11]

图 3:大学课程提供比框架教程更长的理论纵深。来源见文末。
还可以用 DeepLearning.AI 的 Agentic AI 课程梳理 Reflection、Tool Use、Planning 和 Multi-Agent,用 LangChain Academy 深入 State/Checkpoint,用 Google/Kaggle Agent Intensive 和 OpenAI Academy 补生产案例。[12][13][14][15]
课程矩阵已随文交付:course-curriculum-matrix.csv。
九、20:40 分钟实践:建立个人 Agent 技术雷达
Section titled “九、20:40 分钟实践:建立个人 Agent 技术雷达”创建一个四列表:
技术领域 | 我能解释 | 我能实现 | 我有真实 EvalTool Use | yes | yes | noMemory | yes | partial | noDurable | partial | no | noSecurity | partial | partial | no对本文十二项技术逐一评分。优先选择“能解释但没有真实 Eval”的一项,设计一个失败实验,而不是继续安装新框架。
再从 25 个核心项目中只选三个:一个框架、一个基础设施、一个 Eval/Observability 项目。用第 23 讲五个源码入口做读书卡,写清它解决什么、不解决什么、进入你的系统会增加什么责任。
十、给不同读者的阅读顺序
Section titled “十、给不同读者的阅读顺序”产品与业务负责人
Section titled “产品与业务负责人”先读 1、2、4、14、18、21、22、24,重点理解终态、权限、评测与生产边界。
按 1:13、18:20、22:24 阅读,再选一个框架实现。
平台与架构团队
Section titled “平台与架构团队”重点读 8:13、15:22,关注 Context、State、Durable、协议、身份和 Trace。
研究与前沿跟踪
Section titled “研究与前沿跟踪”先掌握 3、6、7、9、14、18,再读课程与论文,避免把实验结果直接写成生产事实。
十一、整套连载最终要建立的判断力
Section titled “十一、整套连载最终要建立的判断力”看见一个新 Agent 项目时,不再只问“它用了什么模型”,而会继续问:
- Harness 把上下文怎样构建;
- Loop 的状态和停止条件在哪里;
- Tool 权限与错误怎样表达;
- Memory 怎样写、更新、删除;
- 多 Agent 是否存在真实边界;
- 协议连接的是哪一层;
- 长任务怎样恢复;
- 完成由什么环境证据证明;
- Eval 是否包含重复、边界和攻击;
- Trace、成本和责任是否可追溯。
这套问题比记住任何一个框架 API 更耐久。
十二、这一讲的结论
Section titled “十二、这一讲的结论”Agent 技术的主线,正在从“让模型多做几步”发展为“让模型在受控系统中持续完成目标”。未来竞争力会更多来自 Context、Harness、状态、协议、Eval、执行环境、安全和运营的组合。
对学习者而言,最有效的路径不是追完所有新闻和仓库,而是围绕一个真实任务持续构建:先有最小 Loop,再有状态和工具,再用故障、攻击与 Eval 逼出可靠工程。
25 篇到这里收束。模型提供推理与生成,Agent 由模型、Harness、环境和证据共同成立;真正决定它能否进入生产的,是系统怎样面对不确定性。
[1] Yao et al., ReAct. https://arxiv.org/abs/2210.03629
[2] Shinn et al., Reflexion. https://arxiv.org/abs/2303.11366
[3] Park et al., Generative Agents. https://arxiv.org/abs/2304.03442
[4] Packer et al., MemGPT. https://arxiv.org/abs/2310.08560
[5] Wu et al., StateFlow. https://arxiv.org/abs/2403.11322
[6] Stanford NLP, DSPy. https://github.com/stanfordnlp/dspy
[7] Microsoft, Agent Lightning. https://github.com/microsoft/agent-lightning
[8] Hugging Face, AI Agents Course. https://huggingface.co/learn/agents-course/unit0/introduction
[9] Microsoft, AI Agents for Beginners. https://github.com/microsoft/ai-agents-for-beginners
[10] UC Berkeley, Large Language Model Agents, Fall 2024. https://rdi.berkeley.edu/llm-agents/f24
[11] UC Berkeley, Advanced Large Language Model Agents, Spring 2025. https://rdi.berkeley.edu/adv-llm-agents/sp25
[12] DeepLearning.AI, Agentic AI. https://www.deeplearning.ai/courses/agentic-ai
[13] LangChain Academy, Introduction to LangGraph. https://academy.langchain.com/courses/intro-to-langgraph
[14] Google, AI Agents Intensive Course Recap. https://blog.google/innovation-and-ai/technology/developers-tools/ai-agents-intensive-recap/
[15] OpenAI Academy, Builder Bootcamp. https://academy.openai.com/public/clubs/builders-etkn1/resources/builder-bootcamp-2026-04-22