智能体新范式Chain-of-Agents,多项任务新SOTA
近年来,人工智能领域最令人兴奋的进展之一,莫过于基于大型语言模型(LLM)的智能体(Agent)系统。
想象一下,不再是和一个简单的聊天机器人对话,而是雇佣了一个由专家组成的虚拟团队:一个负责规划,一个负责搜索信息,一个负责写代码,他们相互协作,共同解决一个复杂问题。
这就是多智能体系统(Multi-Agent Systems, MAS)展现出的强大能力,它们已经在深度研究、复杂编码和数学推理等任务中取得了惊人成果。
然而,现有的多智能体系统大多建立在繁琐的"手工作坊"之上。
研究人员需要为每个智能体精心设计提示词(Prompt),并手动编排它们之间的工作流程和通信协议。这种方式存在几个致命缺点:
- 一是计算效率低下:智能体间大量的通信和协调消耗了巨额的计算资源(通常是 Token 数量);
- 二是泛化能力差:每个新任务都需要重新设计和调试流程,费时费力;
- 三是无法通过数据学习持续改进:其核心的 LLM 模型本身并没有被训练来理解和执行这种多角色、多工具的工作流,只是被"忽悠"着这么做。
另一条技术路线是工具集成推理(Tool-Integrated Reasoning, TIR)。它训练一个单一的 LLM 模型按照"思考-行动-观察"(ReAct)的步骤来使用工具,比手动提示的智能体更高效、更强大。
但它本质上仍然是"单线程"的,无法模拟多智能体之间丰富的、并行的协作模式。
[!info] 论文卡片
- 论文:Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL
- 链接:https://arxiv.org/pdf/2508.13167
本篇论文提出的 Chain-of-Agents(CoA) 范式,旨在取两家之长,弃两家之短。它希望在一个模型内部,原生地、端到端地实现复杂问题解决,其能力堪比一个多智能体系统,但其形态和效率却像一个 TIR 模型。这就像是把一整个专家团队的知识和协作模式,"压缩"进了一个全能型天才的大脑里。
论文还详细介绍了如何通过多智能体蒸馏(Multi-Agent Distillation) 和智能体强化学习(Agentic RL) 来训练这种新型的"智能体基础模型(Agent Foundation Models, AFMs)",并用详实的实验证明了其在多项任务上达到了新的 state-of-the-art(SOTA)性能。
[!info] 阅读导览
第 1 章 CoA 的设计理念与运作机制 → 第 2 章 两阶段训练框架(SFT + RL)→ 第 3 章 Web/Code 实验验证与效率分析 → 第 4 章 结论与展望
flowchart LR
A[复杂查询] --> B[激活角色 φt]
B --> C{角色类型}
C --> D[角色扮演智能体<br>思考 / 规划 / 反思 / 验证]
C --> E[工具智能体<br>搜索 / 爬取 / 代码生成]
D --> F[更新持久状态 St]
E --> F
F --> G{问题已解决?}
G -- 否 --> B
G -- 是 --> H[输出最终答案]
1. Chain-of-Agents(CoA)
1.1. 设计理念:内化的协作
CoA 的核心思想非常直观:为什么不把一个多智能体系统的协作过程,看作是模型内部的一种特殊"思维链"呢? 传统的思维链是"一步一步地想",而 CoA 是"一个角色一个角色地切换着去想和做"。
在 CoA 范式中,给定一个复杂查询(如"总结近期 AI 重大突破"),模型不会固定地执行"想-搜-读"的循环。相反,它会在内部动态地激活不同的"子模块"或"角色":
| 类别 | 角色 | 职责 |
|---|---|---|
| 角色扮演智能体 (负责高层次认知与协调) |
思考智能体 | 总指挥,负责激活其他智能体并保持解题状态的连贯性 |
| 规划智能体 | 大师,负责将复杂问题分解成有结构的任务序列(如先搜索,再爬取,再分析) | |
| 反思智能体 | 批评家,负责检查知识的一致性,进行自我批判和修正 | |
| 验证智能体 | 质检员,根据正式标准验证推理过程的完整性 | |
| 工具智能体 (负责执行具体领域任务) |
搜索智能体 | 搜索引擎高手,负责生成和优化搜索查询 |
| 爬取智能体 | 网络爬虫,负责从网页中并行提取和解析内容 | |
| 代码生成智能体 | 程序员,负责在安全沙箱中生成和执行代码 |
1.2. 运作机制:动态编排
CoA 的整个工作流程可以用一个状态转移方程来抽象地描述:
$$
\mathcal{S}{t} = f{\theta}(\mathcal{S}{t-1}, \phi{t-1}, \mathbf{o}{t-1}), \quad \phi{t} \sim P(\phi \mid \mathcal{S}_{t})
$$
- $\mathcal{S}_t$:代表在时间步 $t$ 模型内部的持久推理状态。它可以理解为当前解决问题的"工作记忆"或"上下文",包含了之前所有的思考、行动结果和观察。
- $\phi_t$:代表在时间步 $t$ 被激活的智能体角色(例如,$\phi_{search}$、$\phi_{think}$、$\phi_{code}$)。
- $f_\theta$:是模型本身(参数为 $\theta$),它根据前一状态 $\mathcal{S}{t-1}$、前一个角色 $\phi{t-1}$ 的执行结果 $\mathbf{o}_{t-1}$,来更新当前的状态 $\mathcal{S}_t$。
- 然后,模型再基于当前状态 $\mathcal{S}_t$,抽样决定下一个要激活的角色 $\phi_t$。
这个过程完全在一次模型推理(解码)过程中完成,不同角色间的切换和协作没有额外的通信开销,实现了高效的内化协作。
1.3. 优势对比:全面领先
上表清晰地对比了 CoA 与其它范式的优劣。CoA 是唯一一个在工具集成、端到端执行、多智能体协作和数据中心优化四个维度上全部获得"✓"的方案。这意味着:
- vs. ReAct:CoA 支持多智能体协作,而 ReAct 是单智能体。
- vs. 传统 MAS:CoA 是端到端可训练的,计算效率更高,避免了智能体间冗余的通信。
- vs. TIR:CoA 支持真正的多智能体协作模式,而 TIR 仅限于 ReAct 模式。
| 优势维度 | CoA |
|---|---|
| 工具集成 | ✓ |
| 端到端执行 | ✓ |
| 多智能体协作 | ✓ |
| 数据中心优化 | ✓ |
2. 如何炼成"智能体基础模型"(AFM)
拥有一个美好的架构蓝图(CoA)只是第一步,如何让一个普通的 LLM 学会这种复杂的内部协作模式才是真正的挑战。论文提出了一个两阶段的训练框架。
2.1. 阶段一:智能体监督微调(SFT)——模仿专家
目标是让模型"学会"CoA 的行为模式。方法是多智能体知识蒸馏。
- 数据生成:研究者利用当时最先进的开源多智能体系统(如 OAgents[82])作为"教师",让它们去解决大量的复杂任务(如"在 GAIA 基准上的问题")。然后,全程记录下这些"教师团队"的解决轨迹:哪个智能体在什么时候被激活、它看到了什么、它做了什么、输出了什么。
- 轨迹转换:将这些原始的、分布在多个智能体上的协作轨迹,转换成一条单一的、序列化的"CoA 轨迹"。这条轨迹看起来就像是一个模型自己产生的、交替出现思考、工具调用和观察的复杂推理链。
- 渐进式质量过滤:生成的轨迹质量不一,需要严格筛选。
- 复杂度过滤:过滤掉交互次数太少(<5 次)的简单任务。
- 质量过滤:用 LLM 或代码执行等方式验证答案是否正确,去除"脏数据"。
- 反思 enrichment:优先选择那些包含自我反思、自我修正步骤的高质量轨迹。
- 错误修正轨迹上采样:特别青睐那些一开始出错但通过反复检查最终做对的轨迹,这能教会模型纠错能力。
经过过滤后,用于 SFT 的数据集包含约 1.6 万条高质量轨迹,其推理链长度(5-20 步)远超传统基准(2-3 步)。
模型的训练目标就是预测 CoA 轨迹中的每一个 token(除了观察结果,因为那是外部环境的信息,不应让模型去学习预测噪声)。
2.2. 阶段二:智能体强化学习(RL)——精益求精
SFT 阶段让模型"学会"了行为,RL 阶段则要让它"做得更好"。其核心是奖励函数,用来告诉模型什么样的行为是好的。
- 数据采样:从开源数据集中筛选出那些真正需要工具才能解决的、有挑战性的查询。
- Web Agent:先用一个强大的 LLM(Qwen-72B)尝试直接回答问题,如果正确率超过 30%,说明这个问题可能不需要工具或已被模型记忆,则被过滤掉。剩下的才是 RL 训练的"硬骨头"。
- Code Agent:用一个较小的 AFM 模型尝试多次解决问题,如果一个题目每次都能被轻松解决,说明它不够难,也会被丢弃。
- 奖励函数设计:
- Web Agent 奖励 $R_{web}$:结果导向。直接使用 LLM-as-a-Judge(让另一个 LLM 当裁判)来判断最终答案是否正确。正确则奖励为 1,否则为 0。这种设计简单直接,避免了复杂的奖励塑造可能带来的问题。
- Code Agent 奖励 $R_{code}$:结果 + 格式。奖励 = $score_{answer} \times score_{format}$。$score_{answer}$ 由代码是否通过测试或答案是否正确决定(1 或 0)。$score_{format}$ 则检查工具调用(如代码块)的格式是否正确(1 或 0)。这意味着,即使代码逻辑正确,如果格式错误导致无法执行,也得不到奖励。
通过 RL 优化,模型在 SFT"模仿"的基础上,进一步学会了如何更高效、更可靠地协调工具来解决难题。
[!note] 两阶段训练对比
阶段 方法 目标 关键手段 阶段一 智能体监督微调(SFT) 让模型"学会"CoA 行为模式 多智能体知识蒸馏:数据生成 → 轨迹转换 → 渐进式质量过滤 阶段二 智能体强化学习(RL) 让模型"做得更好" 奖励函数:Web 结果导向 / Code 结果 + 格式
3. 实验验证
论文在 Web 和 Code 两大智能体任务上进行了全面详尽的实验,结果相当亮眼。
3.1. Web Agent 实验
- 多跳问答(MHQA):在 7 个不同的数据集上,AFM 模型(无论是 SFT 还是 RL 版本)在同等参数规模下,平均性能全面超越了之前的 SOTA 方法(如 Search-R1、ZeroSearch 等)。这表明多智能体蒸馏成功地将协作智能注入了模型。
- 复杂 Web 任务(GAIA, BrowseComp, HLE):这是真正的"硬核"测试。AFM-32B 在 GAIA 上达到了55.3% 的准确率,超越了所有同规模的 TIR 模型,甚至逼近了使用 GPT-4.1 作为核心的庞大 Agent 框架(如 OWL、OAgents)的性能。在衡量前沿学术能力的 HLE 基准上,AFM-32B 也取得了18.0% 的优异成绩,显著优于其他对比模型。
特别值得注意的是仅经过 SFT 的 AFM 模型(AFM-SFT) 就已经表现非常出色,这强有力地证明了多智能体蒸馏框架本身的有效性,而 RL 是在此基础上的进一步精炼。
3.2. Code Agent 实验
- 数学推理:在 AIME、MATH500、AMC 等从高中到奥林匹克难度的数学竞赛题上,AFM-7B 和 AFM-32B 都创造了新的 SOTA。例如,在最具挑战性的 AIME 2025 上,AFM-32B 达到了59.8% 的解决率,相比此前最优方法(ReTool-32B,49.3%)实现了10.5% 的绝对提升。
- 代码生成:在 LiveCodeBench 和 CodeContests 等编程竞赛题库上,AFM 同样显著领先于仅依赖内部知识的模型和其他的 TIR 方法。
[!success] 关键实验数据
任务域 基准 AFM 成绩 对比 Web 多跳问答(MHQA) 7 个数据集 平均性能全面超越 Search-R1、ZeroSearch 等 SOTA 方法 Web 复杂任务 GAIA AFM-32B 55.3% 超越同规模 TIR,逼近 GPT-4.1 驱动的 OWL、OAgents Web 前沿学术 HLE AFM-32B 18.0% 显著优于其他对比模型 数学推理 AIME 2025 AFM-32B 59.8% 较 ReTool-32B(49.3%)绝对提升 10.5% 代码生成 LiveCodeBench / CodeContests 显著领先 内部知识模型与 TIR 方法
3.3. 效率分析
与传统多智能体系统(如 OAgents)和 TIR 方法(如 WebThinker)相比,AFM 在解决相同任务时,令牌消耗降低了 84.6%,并且所需的工具调用次数也更少。这得益于其端到端的内化协作,消除了智能体间大量的通信开销。效率的提升对于实际应用至关重要。
3.4. 泛化性分析
一个有趣的实验是:将一个只在"代码"任务上训练过的 AFM 模型,突然赋予它"网页搜索"和"视觉检查"等它从未见过的工具描述,它能否正确使用?
结果是:可以! 模型能够严格遵循提示词中的格式要求,在第一次尝试中就正确协调使用了这些新工具。这证明了 CoA 范式强大的零样本泛化能力。
反之,一个只在"网页"任务上训练的模型,在面对需要严格代码格式的工具时则表现不佳,这突显了代码训练带来的格式严谨性的优势。
3.5. 测试时扩展(TTS)分析
测试时扩展(Test-Time Scaling)是指通过多次采样(如多次尝试并选择最佳结果)来提升模型表现。论文发现,AFM 模型(AFM-Pass@3)从 TTS 中获得的性能提升远大于其他模型。例如,在 GAIA 上,AFM-Pass@3 比单次采样(AFM)的性能高出 14.6 个百分点,而其他模型的提升通常在 10 个百分点左右。这表明 CoA 模型具有更高的"潜力上限",可以通过投入更多计算资源来获得更大幅度的性能提升。
4. 结论
这篇论文代表了大语言模型智能体研究的一个重大方向性进展。它巧妙地绕过了传统多智能体系统繁琐、低效的工程陷阱,通过"蒸馏"和"内化"的思想,将协作的复杂性封装进一个可端到端训练的基础模型内部。
实验结果无可争议地证明,这种名为 Chain-of-Agents 的新范式,不仅在性能上全面领先于现有的工具集成方法,更在效率、泛化性和潜力上展现出巨大优势。AFM 的提出,为我们迈向真正通用、高效、强大的 AI 智能体迈出了坚实而关键的一步。
[!success] 核心要点
- CoA 是什么:把多智能体协作"内化"为模型内部的一种特殊思维链——一个角色一个角色地切换着去想和做,无需外部通信
- 七大角色:思考、规划、反思、验证四种角色扮演智能体 + 搜索、爬取、代码生成三种工具智能体,动态激活、端到端执行
- 两阶段训练:先多智能体蒸馏做 SFT(约 1.6 万条高质量轨迹"学会"协作),再 Agentic RL 用奖励函数"精益求精"
- 多项 SOTA:GAIA 55.3%、HLE 18.0%、AIME 2025 达 59.8%(较 ReTool-32B 绝对提升 10.5%)
- 效率与潜力:同任务令牌消耗降低 84.6%;测试时扩展收益远超同类模型,潜力上限更高