智能体新范式Chain-of-Agents,多项任务新SOTA

近年来,人工智能领域最令人兴奋的进展之一,莫过于基于大型语言模型(LLM)的智能体(Agent)系统。

想象一下,不再是和一个简单的聊天机器人对话,而是雇佣了一个由专家组成的虚拟团队:一个负责规划,一个负责搜索信息,一个负责写代码,他们相互协作,共同解决一个复杂问题。

这就是多智能体系统(Multi-Agent Systems, MAS)展现出的强大能力,它们已经在深度研究、复杂编码和数学推理等任务中取得了惊人成果。

然而,现有的多智能体系统大多建立在繁琐的"手工作坊"之上。

研究人员需要为每个智能体精心设计提示词(Prompt),并手动编排它们之间的工作流程和通信协议。这种方式存在几个致命缺点:

  • 一是计算效率低下:智能体间大量的通信和协调消耗了巨额的计算资源(通常是 Token 数量);
  • 二是泛化能力差:每个新任务都需要重新设计和调试流程,费时费力;
  • 三是无法通过数据学习持续改进:其核心的 LLM 模型本身并没有被训练来理解和执行这种多角色、多工具的工作流,只是被"忽悠"着这么做。

另一条技术路线是工具集成推理(Tool-Integrated Reasoning, TIR)。它训练一个单一的 LLM 模型按照"思考-行动-观察"(ReAct)的步骤来使用工具,比手动提示的智能体更高效、更强大。

但它本质上仍然是"单线程"的,无法模拟多智能体之间丰富的、并行的协作模式。

图片

[!info] 论文卡片

本篇论文提出的 Chain-of-Agents(CoA) 范式,旨在取两家之长,弃两家之短。它希望在一个模型内部,原生地、端到端地实现复杂问题解决,其能力堪比一个多智能体系统,但其形态和效率却像一个 TIR 模型。这就像是把一整个专家团队的知识和协作模式,"压缩"进了一个全能型天才的大脑里。

论文还详细介绍了如何通过多智能体蒸馏(Multi-Agent Distillation)智能体强化学习(Agentic RL) 来训练这种新型的"智能体基础模型(Agent Foundation Models, AFMs)",并用详实的实验证明了其在多项任务上达到了新的 state-of-the-art(SOTA)性能。

图片

[!info] 阅读导览
第 1 章 CoA 的设计理念与运作机制 → 第 2 章 两阶段训练框架(SFT + RL)→ 第 3 章 Web/Code 实验验证与效率分析 → 第 4 章 结论与展望

flowchart LR
    A[复杂查询] --> B[激活角色 φt]
    B --> C{角色类型}
    C --> D[角色扮演智能体<br>思考 / 规划 / 反思 / 验证]
    C --> E[工具智能体<br>搜索 / 爬取 / 代码生成]
    D --> F[更新持久状态 St]
    E --> F
    F --> G{问题已解决?}
    G -- 否 --> B
    G -- 是 --> H[输出最终答案]

1. Chain-of-Agents(CoA)

1.1. 设计理念:内化的协作

CoA 的核心思想非常直观:为什么不把一个多智能体系统的协作过程,看作是模型内部的一种特殊"思维链"呢? 传统的思维链是"一步一步地想",而 CoA 是"一个角色一个角色地切换着去想和做"。

在 CoA 范式中,给定一个复杂查询(如"总结近期 AI 重大突破"),模型不会固定地执行"想-搜-读"的循环。相反,它会在内部动态地激活不同的"子模块"或"角色":

类别 角色 职责
角色扮演智能体
(负责高层次认知与协调)
思考智能体 总指挥,负责激活其他智能体并保持解题状态的连贯性
规划智能体 大师,负责将复杂问题分解成有结构的任务序列(如先搜索,再爬取,再分析)
反思智能体 批评家,负责检查知识的一致性,进行自我批判和修正
验证智能体 质检员,根据正式标准验证推理过程的完整性
工具智能体
(负责执行具体领域任务)
搜索智能体 搜索引擎高手,负责生成和优化搜索查询
爬取智能体 网络爬虫,负责从网页中并行提取和解析内容
代码生成智能体 程序员,负责在安全沙箱中生成和执行代码

图片

1.2. 运作机制:动态编排

CoA 的整个工作流程可以用一个状态转移方程来抽象地描述:

$$
\mathcal{S}{t} = f{\theta}(\mathcal{S}{t-1}, \phi{t-1}, \mathbf{o}{t-1}), \quad \phi{t} \sim P(\phi \mid \mathcal{S}_{t})
$$

  • $\mathcal{S}_t$:代表在时间步 $t$ 模型内部的持久推理状态。它可以理解为当前解决问题的"工作记忆"或"上下文",包含了之前所有的思考、行动结果和观察。
  • $\phi_t$:代表在时间步 $t$ 被激活的智能体角色(例如,$\phi_{search}$、$\phi_{think}$、$\phi_{code}$)。
  • $f_\theta$:是模型本身(参数为 $\theta$),它根据前一状态 $\mathcal{S}{t-1}$、前一个角色 $\phi{t-1}$ 的执行结果 $\mathbf{o}_{t-1}$,来更新当前的状态 $\mathcal{S}_t$。
  • 然后,模型再基于当前状态 $\mathcal{S}_t$,抽样决定下一个要激活的角色 $\phi_t$。

这个过程完全在一次模型推理(解码)过程中完成,不同角色间的切换和协作没有额外的通信开销,实现了高效的内化协作。

1.3. 优势对比:全面领先

图片

上表清晰地对比了 CoA 与其它范式的优劣。CoA 是唯一一个在工具集成、端到端执行、多智能体协作和数据中心优化四个维度上全部获得"✓"的方案。这意味着:

  1. vs. ReAct:CoA 支持多智能体协作,而 ReAct 是单智能体。
  2. vs. 传统 MAS:CoA 是端到端可训练的,计算效率更高,避免了智能体间冗余的通信。
  3. vs. TIR:CoA 支持真正的多智能体协作模式,而 TIR 仅限于 ReAct 模式。
优势维度 CoA
工具集成
端到端执行
多智能体协作
数据中心优化

2. 如何炼成"智能体基础模型"(AFM)

拥有一个美好的架构蓝图(CoA)只是第一步,如何让一个普通的 LLM 学会这种复杂的内部协作模式才是真正的挑战。论文提出了一个两阶段的训练框架。

2.1. 阶段一:智能体监督微调(SFT)——模仿专家

目标是让模型"学会"CoA 的行为模式。方法是多智能体知识蒸馏

  1. 数据生成:研究者利用当时最先进的开源多智能体系统(如 OAgents[82])作为"教师",让它们去解决大量的复杂任务(如"在 GAIA 基准上的问题")。然后,全程记录下这些"教师团队"的解决轨迹:哪个智能体在什么时候被激活、它看到了什么、它做了什么、输出了什么。
  2. 轨迹转换:将这些原始的、分布在多个智能体上的协作轨迹,转换成一条单一的、序列化的"CoA 轨迹"。这条轨迹看起来就像是一个模型自己产生的、交替出现思考、工具调用和观察的复杂推理链。
  3. 渐进式质量过滤:生成的轨迹质量不一,需要严格筛选。
    • 复杂度过滤:过滤掉交互次数太少(<5 次)的简单任务。
    • 质量过滤:用 LLM 或代码执行等方式验证答案是否正确,去除"脏数据"。
    • 反思 enrichment:优先选择那些包含自我反思、自我修正步骤的高质量轨迹。
    • 错误修正轨迹上采样:特别青睐那些一开始出错但通过反复检查最终做对的轨迹,这能教会模型纠错能力。

经过过滤后,用于 SFT 的数据集包含约 1.6 万条高质量轨迹,其推理链长度(5-20 步)远超传统基准(2-3 步)。

图片

图片

模型的训练目标就是预测 CoA 轨迹中的每一个 token(除了观察结果,因为那是外部环境的信息,不应让模型去学习预测噪声)。

2.2. 阶段二:智能体强化学习(RL)——精益求精

SFT 阶段让模型"学会"了行为,RL 阶段则要让它"做得更好"。其核心是奖励函数,用来告诉模型什么样的行为是好的。

  1. 数据采样:从开源数据集中筛选出那些真正需要工具才能解决的、有挑战性的查询。
    • Web Agent:先用一个强大的 LLM(Qwen-72B)尝试直接回答问题,如果正确率超过 30%,说明这个问题可能不需要工具或已被模型记忆,则被过滤掉。剩下的才是 RL 训练的"硬骨头"。
    • Code Agent:用一个较小的 AFM 模型尝试多次解决问题,如果一个题目每次都能被轻松解决,说明它不够难,也会被丢弃。
  2. 奖励函数设计
    • Web Agent 奖励 $R_{web}$:结果导向。直接使用 LLM-as-a-Judge(让另一个 LLM 当裁判)来判断最终答案是否正确。正确则奖励为 1,否则为 0。这种设计简单直接,避免了复杂的奖励塑造可能带来的问题。
    • Code Agent 奖励 $R_{code}$:结果 + 格式。奖励 = $score_{answer} \times score_{format}$。$score_{answer}$ 由代码是否通过测试或答案是否正确决定(1 或 0)。$score_{format}$ 则检查工具调用(如代码块)的格式是否正确(1 或 0)。这意味着,即使代码逻辑正确,如果格式错误导致无法执行,也得不到奖励。

图片

通过 RL 优化,模型在 SFT"模仿"的基础上,进一步学会了如何更高效、更可靠地协调工具来解决难题。

[!note] 两阶段训练对比

阶段 方法 目标 关键手段
阶段一 智能体监督微调(SFT) 让模型"学会"CoA 行为模式 多智能体知识蒸馏:数据生成 → 轨迹转换 → 渐进式质量过滤
阶段二 智能体强化学习(RL) 让模型"做得更好" 奖励函数:Web 结果导向 / Code 结果 + 格式

3. 实验验证

论文在 Web 和 Code 两大智能体任务上进行了全面详尽的实验,结果相当亮眼。

3.1. Web Agent 实验

图片

图片

  • 多跳问答(MHQA):在 7 个不同的数据集上,AFM 模型(无论是 SFT 还是 RL 版本)在同等参数规模下,平均性能全面超越了之前的 SOTA 方法(如 Search-R1、ZeroSearch 等)。这表明多智能体蒸馏成功地将协作智能注入了模型。
  • 复杂 Web 任务(GAIA, BrowseComp, HLE):这是真正的"硬核"测试。AFM-32B 在 GAIA 上达到了55.3% 的准确率,超越了所有同规模的 TIR 模型,甚至逼近了使用 GPT-4.1 作为核心的庞大 Agent 框架(如 OWL、OAgents)的性能。在衡量前沿学术能力的 HLE 基准上,AFM-32B 也取得了18.0% 的优异成绩,显著优于其他对比模型。

图片

特别值得注意的是仅经过 SFT 的 AFM 模型(AFM-SFT) 就已经表现非常出色,这强有力地证明了多智能体蒸馏框架本身的有效性,而 RL 是在此基础上的进一步精炼。

3.2. Code Agent 实验

图片

图片

  • 数学推理:在 AIME、MATH500、AMC 等从高中到奥林匹克难度的数学竞赛题上,AFM-7B 和 AFM-32B 都创造了新的 SOTA。例如,在最具挑战性的 AIME 2025 上,AFM-32B 达到了59.8% 的解决率,相比此前最优方法(ReTool-32B,49.3%)实现了10.5% 的绝对提升。
  • 代码生成:在 LiveCodeBench 和 CodeContests 等编程竞赛题库上,AFM 同样显著领先于仅依赖内部知识的模型和其他的 TIR 方法。

[!success] 关键实验数据

任务域 基准 AFM 成绩 对比
Web 多跳问答(MHQA) 7 个数据集 平均性能全面超越 Search-R1、ZeroSearch 等 SOTA 方法
Web 复杂任务 GAIA AFM-32B 55.3% 超越同规模 TIR,逼近 GPT-4.1 驱动的 OWL、OAgents
Web 前沿学术 HLE AFM-32B 18.0% 显著优于其他对比模型
数学推理 AIME 2025 AFM-32B 59.8% 较 ReTool-32B(49.3%)绝对提升 10.5%
代码生成 LiveCodeBench / CodeContests 显著领先 内部知识模型与 TIR 方法

3.3. 效率分析

图片

与传统多智能体系统(如 OAgents)和 TIR 方法(如 WebThinker)相比,AFM 在解决相同任务时,令牌消耗降低了 84.6%,并且所需的工具调用次数也更少。这得益于其端到端的内化协作,消除了智能体间大量的通信开销。效率的提升对于实际应用至关重要。

3.4. 泛化性分析

一个有趣的实验是:将一个只在"代码"任务上训练过的 AFM 模型,突然赋予它"网页搜索"和"视觉检查"等它从未见过的工具描述,它能否正确使用?

结果是:可以! 模型能够严格遵循提示词中的格式要求,在第一次尝试中就正确协调使用了这些新工具。这证明了 CoA 范式强大的零样本泛化能力。

反之,一个只在"网页"任务上训练的模型,在面对需要严格代码格式的工具时则表现不佳,这突显了代码训练带来的格式严谨性的优势。

3.5. 测试时扩展(TTS)分析

图片

测试时扩展(Test-Time Scaling)是指通过多次采样(如多次尝试并选择最佳结果)来提升模型表现。论文发现,AFM 模型(AFM-Pass@3)从 TTS 中获得的性能提升远大于其他模型。例如,在 GAIA 上,AFM-Pass@3 比单次采样(AFM)的性能高出 14.6 个百分点,而其他模型的提升通常在 10 个百分点左右。这表明 CoA 模型具有更高的"潜力上限",可以通过投入更多计算资源来获得更大幅度的性能提升。

4. 结论

这篇论文代表了大语言模型智能体研究的一个重大方向性进展。它巧妙地绕过了传统多智能体系统繁琐、低效的工程陷阱,通过"蒸馏"和"内化"的思想,将协作的复杂性封装进一个可端到端训练的基础模型内部。

实验结果无可争议地证明,这种名为 Chain-of-Agents 的新范式,不仅在性能上全面领先于现有的工具集成方法,更在效率、泛化性和潜力上展现出巨大优势。AFM 的提出,为我们迈向真正通用、高效、强大的 AI 智能体迈出了坚实而关键的一步。

[!success] 核心要点

  • CoA 是什么:把多智能体协作"内化"为模型内部的一种特殊思维链——一个角色一个角色地切换着去想和做,无需外部通信
  • 七大角色:思考、规划、反思、验证四种角色扮演智能体 + 搜索、爬取、代码生成三种工具智能体,动态激活、端到端执行
  • 两阶段训练:先多智能体蒸馏做 SFT(约 1.6 万条高质量轨迹"学会"协作),再 Agentic RL 用奖励函数"精益求精"
  • 多项 SOTA:GAIA 55.3%、HLE 18.0%、AIME 2025 达 59.8%(较 ReTool-32B 绝对提升 10.5%)
  • 效率与潜力:同任务令牌消耗降低 84.6%;测试时扩展收益远超同类模型,潜力上限更高