大模型下半场:从 LLM-RL 到 Agentic RL 全新范式
1. 大模型下半场:从 LLM-RL 到 Agentic RL 全新范式
由牛津大学、上海 AI Lab、新加坡国立大学等 16 家研究机构联合发表的 100 页综述,首次系统提出**Agentic RL(代理式强化学习)**范式:把大语言模型(LLM)从"一次性文本生成器"升级为"可在动态环境中持续感知、规划、行动、反思的自主智能体",并给出统一理论框架、能力图谱、任务全景与开源资源大盘点。
[!info] 阅读导览
本文基于综述《The Landscape of Agentic Reinforcement Learning for LLMs: A Survey》整理,共四部分:
为什么需要 Agentic RL(1)→ 理论框架:POMDP(2)→ RL 如何点亮六大能力(3)→ 任务视角:十大战场与开源资源(4)。
flowchart LR
A[为什么需要 Agentic RL] --> B[理论框架 POMDP]
B --> C[RL 点亮六大模块]
C --> D[任务视角 十大战场]
D --> E[开源环境与框架资源]
1.1. 为什么需要 Agentic RL?
从 LLM-RL 到 Agentic RL 范式迁移概览
| 传统 LLM-RL | Agentic RL |
|---|---|
| 单轮问答 | 多轮交互 |
| 静态 prompt → 静态回答 | 动态环境状态 → 动作 → 新状态 |
| reward 只评"答得好不好" | reward 还评"做得对不对" |
| 退化 MDP(T=1) | 标准 POMDP(T>1) |
1.2. 理论框架:用 POMDP 把"LLM 当 policy"
给出形式化七元组 ⟨S, A, P, R, Ω, O, γ⟩(状态、动作、转移概率、奖励、观测空间、观测函数、折扣因子),其中:
- A = A_text ∪ A_action:模型既可"说话"也可"调用工具/执行命令"
- Ω 为观测空间,O 为局部可观察的文本/图像/代码等多模态信号
- R 支持稀疏(任务成败)或稠密(中间步骤)奖励
与传统 PBRFT 的逐项对比
[!note] 术语解释
PBRFT(Preference-Based Reinforcement Fine-Tuning,基于偏好的强化微调)是传统 LLM-RL 的代表范式(如 RLHF、DPO、GRPO 等),其奖励只看"单步回答好不好";Agentic RL 则把奖励扩展到"整个轨迹做得对不对"。
PO、DPO、GRPO 家族对比
1.3. RL 如何"点亮"六大模块
图 3:Agentic LLM 与环境之间的动态交互过程
| 能力 | RL 作用 | 代表工作 |
|---|---|---|
| Planning | 外部搜索(MCTS)或内部策略梯度直接优化计划 | LATS、AdaPlan |
| Tool Use | 从模仿 ReAct → 奖励驱动 TIR(Tool-Integrated Reasoning) | ToolRL、ReTool、OpenAI o3 |
| Memory | 把静态 RAG 升级为"RL 决定何时写/删/查" | Memory-R1、MemAgent |
| Self-Improvement | 自生成 critique → 在线 DPO/GRPO 更新 | Reflexion、R-Zero、Absolute Zero |
| Reasoning | 慢思维"长链推理"由过程奖励塑形 | DeepSeek-R1、o1/o3 |
| Perception | 视觉/音频/3D 任务统一用 GRPO 优化 | Vision-R1、SVQA-R1、EchoInk-R1 |
Agentic RL 6 大核心能力板块
1.4. 任务视角:十大战场全景图
图 6:按时间轴梳理的"任务进化树"
1.4.1. 各领域关键趋势与开源亮点
| 领域 | 关键趋势 | 开源亮点 |
|---|---|---|
| Search & Research | 从单轮 RAG 到多轮深度研究 | Search-R1、WebSailor、DeepResearcher |
| Code | 函数级 → 文件级 → 仓库级 SWE-bench | DeepSWE、SWE-RL、Qwen3-Coder |
| Math | 非形式化 + 形式化(Lean/Isabelle)双轨 | DeepSeek-Prover、Leanabell、STP |
| GUI | 静态截图 → 在线真机交互 | UI-TARS、DiGiRL、ZeroGUI |
| Vision | 被动看图 → 主动"用图思考" | Vision-R1、Ground-R1、Got-R1 |
| Embodied | VLA 模型 + 轨迹级奖励 | VLN-R1、TGRPO、VIKI-R |
| Multi-Agent | 去中心化训练 & 博弈自博弈 | MAGRPO、SPIRAL、Chain-of-Agents |
1.4.2. 开源环境与框架速查表
搜索与研究 Agent
代码与软件工程 Agent
数学推理 Agent
GUI Agent
Multi-Agent 框架
汇总 50+ 环境与基准
汇总 15 个 RL 框架
1.4.3. 推荐上手环境与框架
| 类型 | 推荐上手 |
|---|---|
| Web 任务 | WebArena、VisualWebArena、AppWorld |
| 代码任务 | SWE-bench、Debug-Gym、R2E-Gym |
| 多智能体 | SMAC-Exp、Factorio、PaperBench |
| 框架 | OpenRLHF、trlX、EasyR1、AgentFly、AWorld |
1.4.4. 参考资源
- 论文:The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
- 代码仓库:Awesome-AgenticLLM-RL-Papers(论文官方资源清单)
[!success] 核心要点回顾
- 范式迁移:Agentic RL 把 LLM 从"一次性文本生成器"变为"在动态环境中持续感知、规划、行动、反思的自主智能体",对应从单步 MDP 到多步 POMDP。
- 理论形式:POMDP 七元组 ⟨S, A, P, R, Ω, O, γ⟩,动作既包括"说话"也包括"调用工具/执行命令",奖励可稀疏可稠密。
- 六大能力:Planning、Tool Use、Memory、Self-Improvement、Reasoning、Perception,全部由 RL 驱动升级(代表工作:LATS、TIR、Memory-R1、Reflexion、DeepSeek-R1、Vision-R1)。
- 上手建议:Web 任务用 WebArena,代码用 SWE-bench,框架从 OpenRLHF / EasyR1 入手;开源清单见论文官方仓库。