---
title: "Anthropic 官方演示：构建会自我改进的 Agent（视频导读）"
author: deletexiumu
pubDatetime: 2026-07-20T17:00:00+08:00
featured: false
draft: false
tags:
  - AI Agent
  - Claude
  - 视频导读
description: "Anthropic 工程师讲解 context engineering 与 memory system 演进：从 CLAUDE.md、skills 到文件系统式记忆，再到 dreaming 离线学习范式，构建能自我改进的 Agent。"
---

这是 Anthropic Applied AI 团队工程师 Lamis 在 AI DevCon 上的演讲，主题是如何用 context engineering 让 Agent 具备「自我改进」能力。核心思想：模型智能本身不会复利增长，但记忆与上下文的持续积累会——Agent 记下自己犯过的错，下次就做得更好，这就是 continual learning 的雏形。演讲沿一条清晰的演进路线展开：从 CLAUDE.md 文件、memory tools、skills 的 progressive disclosure，走到把 memory system 建模成文件系统的当前最佳实践；再讲透 production 化必须补上的 versioning、concurrency、permissioning 等工程护栏；最后压轴介绍名为 dreaming 的 out-of-band 学习范式——用独立的批处理进程复盘 Agent transcripts、修订记忆库。视频为中英双语字幕版，约 31 分钟，信息密度很高，值得完整看一遍。

## 观看视频

<video controls preload="metadata" style="width:100%" src="https://video.deepai.wiki/anthropic-build-a-self-improving-agent-en-zh.mp4"></video>

时长约 31 分钟，中英双语字幕，建议配合下方时间戳跳看。

## 导读要点

### 01:59 为什么 context engineering 值得投入

模型一直在变强，但很多 context 与模型智能是「正交」的：最新模型开箱也不知道你的代码库、组织习惯和用户偏好。context engineering 的价值在于它会随时间放大智能——即使模型本身也在进步，这项投入依然复利。

### 03:19 一年演进史：CLAUDE.md → memory tools → skills → 文件系统

Anthropic 的口号是「做简单且有效的事」。起点是 CLAUDE.md：一份注入 session 开头的 Markdown，人能读、agent 能写，出奇有效，但文件变长后会撑爆 context。第二步是 memory tools，让 Agent 在 session 内（in-band）自主决定何时读、写、更新记忆。第三步是 skills 的 progressive disclosure：Agent 先只看 front matter，需要时才加载正文——Lamis 的类比是房间里的书架，有人说法语时才取下法语词典。最终收敛到当前 best practice：把 memory system 建模成文件系统，让 Agent 用 Bash 和 grep 这类它本就擅长的工具去检索，而不是硬造读写记忆的专用工具。

### 08:22 扩到 production 时的坑与四条设计原则

多 Agent 并发写同一个记忆文件、错误知识扩散到全组织、记忆过时、甚至被 prompt injection 写入坏内容——这些都是 production 里反复出现的问题。对应四条原则：**versioning**（可回滚，追踪更新源自哪个 session、谁写的）；**concurrency**（写前取 hash、提交前再取一次，不一致则重拉重写，乐观锁思路）；**permissioning**（组织级知识对 Agent 只读，自己的 scratchpad 可写，中间分层）；**portability**（精心策展的记忆应通过干净 API 跨产品面复用）。

### 14:43 in-band memory 的天花板

Agent 在 session 内自己写记忆有两个结构性局限：一是注意力分流——该把多少 capacity 花在「帮助未来的自己」而不是当前任务上，是个难解的优化问题；二是可见性局限——每个 session 都是新 context window，Agent 看不到跨 session 的重复错误，也看不到 fleet 里其他 Agent 的失败。

### 17:32 dreaming：out-of-band 的二阶学习进程

dreaming 是叠加在 memory 之上的批处理异步进程：取既有 memory store 加一批时段内的 transcripts，交给一个专职 Agent 审阅，识别反复失败的模式，输出对 memory store 的修订。Lamis 用学校作类比：校长统览所有学生的作业，发现整个地理班都答错同一道题，说明课程里整块缺失；数学考试全班输出弧度而非角度，对应 transcripts 里反复失败的 tool call 配置问题。审阅时不只看对话，还要认真检查 tool call 与元数据。

### 21:01 production 设计：orchestrator + sub-agents

实现上由 orchestrator 派出一队 sub-agents 分析所有 transcripts，再汇总判断哪些模式足够普遍、值得更新记忆。输出不只是修改建议，还附上观察到该模式的 transcript 示例和普遍性统计，由人决定接受或拒绝。memory（in-band，见效快但有资源竞争）与 dreaming（out-of-band，视野广、专用算力）双进程并行；额外的 token 开销会被 Agent 更高的 one-shot 成功率赚回来。

### 26:36 Q&A 三问

企业级 memory store 推荐用 Anthropic 的 Memory and Dreaming API（经 Claude Managed Agents）；dreaming 的权限问题可通过只挂载与 memory store 相同权限集的 transcripts 来镜像既有 permissioning；至于「是否在重新发明数据库」——Lamis 坦承这正是在把已被验证的软件工程原则（hashing、versioning）固化回 harness，用确定性方式做该确定的事。

## 适合谁看

- 正在给 Agent 设计记忆系统、纠结 CLAUDE.md / memory tools / skills 怎么选的开发者
- 要把单 Agent 原型扩展成多 Agent、长时运行 production 系统的工程团队
- 对 continual learning、Agent 自我迭代范式感兴趣，想了解 dreaming 这类 out-of-band 学习机制的人
- 关注 Anthropic 官方 context engineering 最佳实践演进脉络的从业者

---

## 相关阅读

- [Anthropic Workshop：从零构建真实 AI Agent 实战（视频导读）](/posts/anthropic-shipping-a-real-ai-agent/) — 同系列视频：把 memory/dreaming 放进 Managed Agents 全景里的动手实战
- [Claude Code 上下文工程实战：从"碰运气"到"有体系"](/posts/context-engineering-in-practice/) — 本演讲的 context engineering 理念在 Claude Code 里的落地打法
