Claude 学会了"做梦":Anthropic Dreaming 功能深度解读
🔥 2026 年 5 月 6 日,Anthropic 在 Code with Claude 大会上发布了三项重磅 Agent 功能——Dreaming、Outcomes、Multi-Agent Orchestration(多智能体编排),标志着 AI Agent 从"执行指令"跨入"自我进化"时代。
一、Dreaming:AI Agent 的"梦境"是什么?
Dreaming 是 Anthropic 发布的最具突破性的功能。它不是让模型变得更聪明,而是让 Agent 学会从自己的经验中学习。
工作原理
Dreaming 是一个在 Agent 任务之间运行的定时后台进程,它不改变模型权重,更像是一种结构化的"笔记整理"机制:
Dreaming 主要寻找三类模式:
| 模式类型 | 说明 |
|---|---|
| 重复错误 | Agent 反复犯的错误——比如特定文件格式的处理方式不对 |
| 收敛工作流 | Agent 在不同任务中逐渐"摸出来"的高效做法 |
| 团队偏好 | 一个 Agent 集群中共同涌现出的工作习惯 |
Anthropic 将这个过程比作海马体的记忆巩固——就像人脑在睡眠中回放一天的事件并决定保留什么。
Harvey 的惊艳数据
法律 AI 初创公司 Harvey 是 Dreaming 的内测客户。数据震撼:
- 任务完成率提升约 6 倍
- 痛点在于:Agent 总是"记不住"文件类型特性和工具相关的 workaround,导致同样的任务反复失败
- Dreaming 让这些经验真正"留下来了"
二、Outcomes:自评分的 Agent 质量闭环
第二个功能解决的是一个更日常但同样关键的问题:Agent 完成了任务,但输出质量不够好,没人及时发现。
工作机制
关键设计:评分 Agent 运行在自己的独立上下文中,不被执行 Agent 的推理过程污染,纯粹基于输出结果做判断。
效果数据
| 指标 | 提升幅度 |
|---|---|
| 任务成功率 | +10 个百分点 |
| Word 文档生成质量 | +8.4% |
| PPT 生成质量 | +10.1% |
| Wisedocs 审核速度 | 快 50% |
💡 最有趣的数据:单纯增加评分循环就提升了 10.1% 的 PPT 质量。这说明很多输出质量问题是评估问题而不是模型问题——你输出不好不是因为模型差,而是因为没人检查它。
三、Multi-Agent Orchestration:多智能体编排
第三个功能解决的是复杂任务的协同问题。一个主 Agent 将任务拆解,分发给多个专业子 Agent 并行执行。
架构图解
每个子 Agent 拥有独立的:
- 模型配置(可以混用不同模型)
- 自定义 Prompt
- 工具集
- 在共享文件系统上并行工作
客户案例
| 客户 | 使用方式 | 效果 |
|---|---|---|
| Netflix 平台团队 | 多 Agent 编排 | 用主 Agent 分派数百个仓库的构建日志给子 Agent 并行扫描 |
| Spiral(Every 出品) | 编排 + Outcomes | Haiku 主 Agent 接收请求,Opus 子 Agent 并行起草 |
| Wisedocs | Outcomes | 文档审核速度提升 50% |
四、技术深度:为什么 Dreaming 不是"微调"?
很多开发者会问:这不就是微调吗?
完全不是。
| 维度 | Dreaming | 微调/训练 |
|---|---|---|
| 模型权重 | 不变 | 会更新 |
| 运行频率 | 每次任务间 | 一次性 |
| 学习来源 | 自己的会话记录 | 标注数据集 |
| 范围 | Agent 级别的行为模式 | 全局能力改进 |
| 需要 GPU | ❌ | ✅ |
| 可控性 | 开发者可审核每次记忆变更 | 黑盒 |
Dreaming 更像是给 Agent 装了一个"个人经验笔记本",而不是给它重新上课。
五、对开发者的影响
Dreaming + Outcomes + 多 Agent 编排的组合,其实是在回答一个更本质的问题:模型能力趋同后,Agent 基础设施的竞争在哪里?
⚡ Anthropic 的核心观点:模型能力正在趋同,真正的竞争壁垒是 Agent 的记忆力、自改进能力和任务编排能力。
值得关注的点
- 开源早有方案,但 Anthropic 把它变成了平台能力:Hermes 等开源框架早就有跨会话记忆和定时审查功能,但 Anthropic 是第一个把这件事做成"开箱即用"管理服务的
- "Dreaming"还只是 research preview:需要申请才能使用,说明功能还不够成熟
- 没有独立基准:Harvey 的 6 倍提升数据来自客户自测,Anthropic 没有发布独立评估
- Agent 从工具变成"同事":当你训练的 Agent 开始自己总结经验、自己评分、自己分派子任务——它就不再只是一个工具了
六、总结
这三个功能一起定义了下一代 Agent 的基础设施蓝图:能记住、能自检、能协同。
如果说 2024-2025 年是"AI 能写代码",那 2026 年可能是"AI 能自己学会如何写好代码"的一年。
七、Dreaming 和 Prompt Caching(上下文缓存)有什么区别?
两者都涉及"让 Agent 记得更多",但本质完全不同。
什么是 Prompt Caching?
📦 Prompt Caching(上下文缓存) 是一种性能优化技术。当你连续向 API 发送请求时,相同的 prompt 前缀会被缓存起来,避免重复计算,从而降低延迟和成本。
核心区别
| 维度 | Prompt Caching | Dreaming |
|---|---|---|
| 本质 | 性能优化——省钱省时间 | 能力进化——让 Agent 变聪明 |
| 改变什么 | 重复 token 不再重新计算 | Agent 记忆被整理、优化、更新 |
| 存储什么 | KV 中间计算结果 | 长期记忆条目(文本形式) |
| 触发时机 | 每次 API 调用自动发生 | 任务之间定时触发 |
| 持续时间 | 分钟级(5分钟到1小时) | 跨天跨周持续存在 |
| 谁来控制 | 自动过期,开发者无感 | 开发者可审核每次变更 |
| 影响范围 | 当前会话内 | 跨会话、跨天、整个生命周期 |
打个比方
Prompt Caching 像是你看书时在关键页面夹书签——下次翻到同一页不用重新读整段。
Dreaming 像是你每天睡前回顾今天学了什么——整理笔记、提炼重点、忘掉没用的。第二天带着更清晰的知识体系开始新一天。
它们能一起工作吗?
能,而且应该一起用。
- Prompt Caching:让单次 Agent 任务执行更便宜、更快
- Dreaming:让 Agent 在多个任务之间持续进步、不重复犯错
一个是"跑得更快",一个是"越跑越聪明"。两者不冲突,是互补的。
Dreaming vs Claude Code 原有记忆系统
Claude Code 之前已经有 CLAUDE.md(项目级指令)、Memory.md 和自动记忆管理系统。Dreaming 是在这些之上的维护层——它不再是被动地存储记忆,而是主动分析、重组、提升记忆质量。
