首篇基于强化学习的 Agentic Search 最新综述

[!abstract] 摘要
首次对基于强化学习的智能体搜索RL-based Agentic Search)进行了全面概述:基础、角色、优化、评估与应用

不同 survey 的对比
不同 survey 的对比

1. 从“工具”到“决策者”的范式跃迁

传统 RAG(检索增强生成)系统就像一个“图书馆借书机器人”——用户提问,它检索一次,生成答案,任务结束。但真实世界的复杂问题往往需要多轮推理、动态调整、策略规划。这正是Agentic Search的用武之地:

Agentic Search 与 RAG 对比

智能体搜索通过将 LLM 构建为一个自主决策的智能体,从而超越了 RAG。模型不再是被动地使用检索到的文档,而是主动决定何时、何地以及如何搜索…

论文开篇就点明了核心痛点:LLM 面临静态知识、幻觉问题,而传统 RAG 又是单次、启发式的。RL 的引入让智能体能够通过试错自我改进,实现了从“被动检索”到“主动决策”的质变。

2. 核心框架:RL 赋能搜索的三维空间

论文提出了一个极具洞察力的分析框架,将 RL 在智能搜索中的作用解构为三个互补维度:

三维分析框架

这三大维度构成了我们理解这个领域的“黄金三角”:

  • What RL is for:RL 的功能角色(决定何时搜、如何搜)
  • How RL is used:优化策略(奖励设计、训练方法)
  • Where RL is applied:优化范围(Agent 级/模块级/系统级)

3. What—RL 扮演什么角色?

这部分是整篇综述最精彩的内容。作者将 RL 的功能角色归纳为五大核心类别,并提供了详细的分类表:检索控制查询优化推理—检索融合多智能体协作工具知识整合

RL 功能角色分类

3.1. 检索控制:让搜索变得“聪明”

传统 RAG 不管需不需要都会检索,而 RL 训练的智能体会自主判断

  • Search-R1学会了只在内部知识不足时才调用搜索引擎
  • DeepRAG将复杂查询分解为原子子查询,逐个决策
  • IKEA引入知识边界感知奖励,鼓励优先使用内部知识

关键洞察是:搜索不是越多越好,而是在正确的时间做正确的搜索

3.2. 查询优化:会说才会搜

用户提问往往是模糊的,RL 让智能体学会“翻译”:

  • ConvSearch-R1通过 Rank-Incentive 奖励,让改写后的查询能检索到更高排名的相关文档
  • DeepRetrieval训练 LLM 生成符合特定搜索引擎偏好的查询(就像“黑进”搜索引擎)

3.3. 推理—检索融合:边想边搜,边搜边想

这是 Agentic Search 的核心优势——推理与检索的闭环

  • AutoRefine奖励“搜索—思考—精炼”的迭代过程
  • ReSum训练智能体主动总结历史交互,避免上下文溢出

3.4. 多智能体协作:分工的艺术

多智能体协作架构

两种架构:

  • 规划—执行架构:高层规划器协调专业执行器(查询重写、文档选择)
  • 合作多智能体:各模块作为独立 RL 智能体,共享全局奖励

OPERA采用分级 RL,为规划、分析、改写代理提供定制化奖励信号。

4. ⚙️ 第二维:How—RL 如何优化?

4.1. 训练范式:从冷启动到自我进化

标准流程是:SFT 冷启动 → RL 微调。但创新点在于:

  • ZeroSearch完全放弃 SFT,在潜在空间模拟检索,实现纯 RL 训练
  • AgentGym-RL通过课程学习逐步扩展交互时长,从短任务到多步推理
  • EvolveSearch开创自我进化循环:RL 生成高质量轨迹 → 蒸馏为 SFT 数据 → 再 RL 训练

Search-R1 的标准提示模板,要求模型先推理再搜索:

Search-R1 标准提示模板

4.2. 奖励设计:从结果到过程的精细化

奖励函数从单一到多维的演进:Outcome、Process

奖励函数演进

核心教训:有效代理需要平衡最终准确性与中间行为质量

强化学习优化策略视角

5. 第三维:Where—RL 优化哪里?

将优化范围分为三级:Agent 级、模块/步骤级、系统级

RL 优化范围分级

模块级优化的优势是无需重训大模型,如 s3 仅训练一个轻量搜索模块。而系统级框架如 VerlTool 提供统一接口,支持跨模态工具训练。

6. 评估体系:如何衡量智能搜索?

6.1. 数据集全景

列出了覆盖 6 大类的评估基准:

评估基准数据集

  • 知识密集型 QA:HotpotQA, 2WikiMultiHopQA(多跳推理)
  • 网页搜索:GAIA, Mind2Web(真实浏览器环境)
  • 多模态:InfoSeek, MM-BrowseComp(图文混合)
  • 对话式:TopiOCQA, QReCC(多轮上下文)
  • 领域专用:MATH, MedQA, OlympiadBench

6.2. 评估指标

除了传统的 EM/F1,Agentic Search 需要新指标:

  • 搜索效率:查询次数、API 成本、响应时间
  • 过程质量:信息增益、证据利用率、查询冗余度
  • 多样性:O²-Searcher 引入多样性奖励避免重复查询

7. 🚀 应用实战:RLAgent 正在改变这些领域

  • Deep Research:DeepResearcher, MedResearcher-R1 实现自动化文献综述
  • 多模态搜索:MMSearch-R1, WebWatcher 融合视觉与文本理解
  • 代码助手:Tool-Star 协调搜索、执行、调试工具链
  • 对话助手:ConvSearch-R1 在多轮对话中保持上下文
  • 企业搜索:HierSearch 整合本地知识库与网页搜索

强化学习优化策略视角应用

应用案例图 1
应用案例图 2
应用案例图 3

https://arxiv.org/pdf/2510.16724
A Comprehensive Survey on Reinforcement Learning-based Agentic Search: Foundations, Roles, Optimizations, Evaluations, and Applications
https://github.com/ventr1c/Awesome-RL-based-Agentic-Search-Paper