CJH_BLOG

Claude 学会了"做梦":Anthropic Dreaming 功能深度解读

C
cjh
·2026年05月28日·👁 17 次阅读

Claude 学会了"做梦":Anthropic Dreaming 功能深度解读

🔥 2026 年 5 月 6 日,Anthropic 在 Code with Claude 大会上发布了三项重磅 Agent 功能——Dreaming、Outcomes、Multi-Agent Orchestration(多智能体编排),标志着 AI Agent 从"执行指令"跨入"自我进化"时代。

一、Dreaming:AI Agent 的"梦境"是什么?

Dreaming 是 Anthropic 发布的最具突破性的功能。它不是让模型变得更聪明,而是让 Agent 学会从自己的经验中学习

工作原理

Dreaming 是一个在 Agent 任务之间运行的定时后台进程,它不改变模型权重,更像是一种结构化的"笔记整理"机制:

Dreaming 主要寻找三类模式:

模式类型说明
重复错误Agent 反复犯的错误——比如特定文件格式的处理方式不对
收敛工作流Agent 在不同任务中逐渐"摸出来"的高效做法
团队偏好一个 Agent 集群中共同涌现出的工作习惯

Anthropic 将这个过程比作海马体的记忆巩固——就像人脑在睡眠中回放一天的事件并决定保留什么。

Harvey 的惊艳数据

法律 AI 初创公司 Harvey 是 Dreaming 的内测客户。数据震撼:

  • 任务完成率提升约 6 倍
  • 痛点在于:Agent 总是"记不住"文件类型特性和工具相关的 workaround,导致同样的任务反复失败
  • Dreaming 让这些经验真正"留下来了"

二、Outcomes:自评分的 Agent 质量闭环

第二个功能解决的是一个更日常但同样关键的问题:Agent 完成了任务,但输出质量不够好,没人及时发现。

工作机制

关键设计:评分 Agent 运行在自己的独立上下文中,不被执行 Agent 的推理过程污染,纯粹基于输出结果做判断。

效果数据

指标提升幅度
任务成功率+10 个百分点
Word 文档生成质量+8.4%
PPT 生成质量+10.1%
Wisedocs 审核速度快 50%

💡 最有趣的数据:单纯增加评分循环就提升了 10.1% 的 PPT 质量。这说明很多输出质量问题是评估问题而不是模型问题——你输出不好不是因为模型差,而是因为没人检查它。

三、Multi-Agent Orchestration:多智能体编排

第三个功能解决的是复杂任务的协同问题。一个主 Agent 将任务拆解,分发给多个专业子 Agent 并行执行。

架构图解

每个子 Agent 拥有独立的:

  • 模型配置(可以混用不同模型)
  • 自定义 Prompt
  • 工具集
  • 在共享文件系统上并行工作

客户案例

客户使用方式效果
Netflix 平台团队多 Agent 编排用主 Agent 分派数百个仓库的构建日志给子 Agent 并行扫描
Spiral(Every 出品)编排 + OutcomesHaiku 主 Agent 接收请求,Opus 子 Agent 并行起草
WisedocsOutcomes文档审核速度提升 50%

四、技术深度:为什么 Dreaming 不是"微调"?

很多开发者会问:这不就是微调吗?

完全不是。

维度Dreaming微调/训练
模型权重不变会更新
运行频率每次任务间一次性
学习来源自己的会话记录标注数据集
范围Agent 级别的行为模式全局能力改进
需要 GPU
可控性开发者可审核每次记忆变更黑盒

Dreaming 更像是给 Agent 装了一个"个人经验笔记本",而不是给它重新上课。

五、对开发者的影响

Dreaming + Outcomes + 多 Agent 编排的组合,其实是在回答一个更本质的问题:模型能力趋同后,Agent 基础设施的竞争在哪里?

Anthropic 的核心观点:模型能力正在趋同,真正的竞争壁垒是 Agent 的记忆力、自改进能力和任务编排能力

值得关注的点

  1. 开源早有方案,但 Anthropic 把它变成了平台能力:Hermes 等开源框架早就有跨会话记忆和定时审查功能,但 Anthropic 是第一个把这件事做成"开箱即用"管理服务的
  2. "Dreaming"还只是 research preview:需要申请才能使用,说明功能还不够成熟
  3. 没有独立基准:Harvey 的 6 倍提升数据来自客户自测,Anthropic 没有发布独立评估
  4. Agent 从工具变成"同事":当你训练的 Agent 开始自己总结经验、自己评分、自己分派子任务——它就不再只是一个工具了

六、总结

这三个功能一起定义了下一代 Agent 的基础设施蓝图:能记住、能自检、能协同

如果说 2024-2025 年是"AI 能写代码",那 2026 年可能是"AI 能自己学会如何写好代码"的一年。


七、Dreaming 和 Prompt Caching(上下文缓存)有什么区别?

两者都涉及"让 Agent 记得更多",但本质完全不同

什么是 Prompt Caching?

📦 Prompt Caching(上下文缓存) 是一种性能优化技术。当你连续向 API 发送请求时,相同的 prompt 前缀会被缓存起来,避免重复计算,从而降低延迟和成本

核心区别

维度Prompt CachingDreaming
本质性能优化——省钱省时间能力进化——让 Agent 变聪明
改变什么重复 token 不再重新计算Agent 记忆被整理、优化、更新
存储什么KV 中间计算结果长期记忆条目(文本形式)
触发时机每次 API 调用自动发生任务之间定时触发
持续时间分钟级(5分钟到1小时)跨天跨周持续存在
谁来控制自动过期,开发者无感开发者可审核每次变更
影响范围当前会话内跨会话、跨天、整个生命周期

打个比方

Prompt Caching 像是你看书时在关键页面夹书签——下次翻到同一页不用重新读整段。

Dreaming 像是你每天睡前回顾今天学了什么——整理笔记、提炼重点、忘掉没用的。第二天带着更清晰的知识体系开始新一天。

它们能一起工作吗?

能,而且应该一起用。

  • Prompt Caching:让单次 Agent 任务执行更便宜、更快
  • Dreaming:让 Agent 在多个任务之间持续进步、不重复犯错

一个是"跑得更快",一个是"越跑越聪明"。两者不冲突,是互补的。

Dreaming vs Claude Code 原有记忆系统

Claude Code 之前已经有 CLAUDE.md(项目级指令)、Memory.md 和自动记忆管理系统。Dreaming 是在这些之上的维护层——它不再是被动地存储记忆,而是主动分析、重组、提升记忆质量

登录后可为文章点赞


#评论区

登录 后参与讨论
💬

暂无评论,成为第一个留言的人吧