大模型下半场:从 LLM-RL 到 Agentic RL 全新范式

1. 大模型下半场:从 LLM-RL 到 Agentic RL 全新范式

Agentic RL 综述总览

由牛津大学、上海 AI Lab、新加坡国立大学等 16 家研究机构联合发表的 100 页综述,首次系统提出**Agentic RL(代理式强化学习)**范式:把大语言模型(LLM)从"一次性文本生成器"升级为"可在动态环境中持续感知、规划、行动、反思的自主智能体",并给出统一理论框架、能力图谱、任务全景与开源资源大盘点。

Agentic RL 综述架构图

[!info] 阅读导览
本文基于综述《The Landscape of Agentic Reinforcement Learning for LLMs: A Survey》整理,共四部分:
为什么需要 Agentic RL(1)→ 理论框架:POMDP(2)→ RL 如何点亮六大能力(3)→ 任务视角:十大战场与开源资源(4)

flowchart LR
    A[为什么需要 Agentic RL] --> B[理论框架 POMDP]
    B --> C[RL 点亮六大模块]
    C --> D[任务视角 十大战场]
    D --> E[开源环境与框架资源]

1.1. 为什么需要 Agentic RL?

从 LLM-RL 到 Agentic RL 范式迁移概览

从 LLM-RL 到 Agentic RL 范式迁移概览

传统 LLM-RL Agentic RL
单轮问答 多轮交互
静态 prompt → 静态回答 动态环境状态 → 动作 → 新状态
reward 只评"答得好不好" reward 还评"做得对不对"
退化 MDP(T=1) 标准 POMDP(T>1)

1.2. 理论框架:用 POMDP 把"LLM 当 policy"

POMDP 理论框架示意图

给出形式化七元组 ⟨S, A, P, R, Ω, O, γ⟩(状态、动作、转移概率、奖励、观测空间、观测函数、折扣因子),其中:

  • A = A_text ∪ A_action:模型既可"说话"也可"调用工具/执行命令"
  • Ω 为观测空间,O 为局部可观察的文本/图像/代码等多模态信号
  • R 支持稀疏(任务成败)或稠密(中间步骤)奖励

与传统 PBRFT 的逐项对比

与传统 PBRFT 的逐项对比

[!note] 术语解释
PBRFT(Preference-Based Reinforcement Fine-Tuning,基于偏好的强化微调)是传统 LLM-RL 的代表范式(如 RLHF、DPO、GRPO 等),其奖励只看"单步回答好不好";Agentic RL 则把奖励扩展到"整个轨迹做得对不对"。

PO、DPO、GRPO 家族对比

PO, DPO, GRPO 家族对比

1.3. RL 如何"点亮"六大模块

RL 赋能六大能力示意图

图 3:Agentic LLM 与环境之间的动态交互过程

能力 RL 作用 代表工作
Planning 外部搜索(MCTS)或内部策略梯度直接优化计划 LATS、AdaPlan
Tool Use 从模仿 ReAct → 奖励驱动 TIR(Tool-Integrated Reasoning) ToolRL、ReTool、OpenAI o3
Memory 把静态 RAG 升级为"RL 决定何时写/删/查" Memory-R1、MemAgent
Self-Improvement 自生成 critique → 在线 DPO/GRPO 更新 Reflexion、R-Zero、Absolute Zero
Reasoning 慢思维"长链推理"由过程奖励塑形 DeepSeek-R1、o1/o3
Perception 视觉/音频/3D 任务统一用 GRPO 优化 Vision-R1、SVQA-R1、EchoInk-R1

Agentic RL 6 大核心能力板块

Agentic RL 6 大核心能力板块

Agentic RL 能力图谱细节

1.4. 任务视角:十大战场全景图

任务进化树示意图

图 6:按时间轴梳理的"任务进化树"

1.4.1. 各领域关键趋势与开源亮点

领域 关键趋势 开源亮点
Search & Research 从单轮 RAG 到多轮深度研究 Search-R1、WebSailor、DeepResearcher
Code 函数级 → 文件级 → 仓库级 SWE-bench DeepSWE、SWE-RL、Qwen3-Coder
Math 非形式化 + 形式化(Lean/Isabelle)双轨 DeepSeek-Prover、Leanabell、STP
GUI 静态截图 → 在线真机交互 UI-TARS、DiGiRL、ZeroGUI
Vision 被动看图 → 主动"用图思考" Vision-R1、Ground-R1、Got-R1
Embodied VLA 模型 + 轨迹级奖励 VLN-R1、TGRPO、VIKI-R
Multi-Agent 去中心化训练 & 博弈自博弈 MAGRPO、SPIRAL、Chain-of-Agents

1.4.2. 开源环境与框架速查表

搜索与研究 Agent

搜索与研究 Agent

代码与软件工程 Agent

代码与软件工程 Agent

数学推理 Agent

数学推理 Agent

GUI Agent

GUI Agent

Multi-Agent 框架

Multi-Agent 框架

汇总 50+ 环境与基准

汇总 50+ 环境与基准

汇总 15 个 RL 框架

汇总 15 个 RL 框架

1.4.3. 推荐上手环境与框架

类型 推荐上手
Web 任务 WebArena、VisualWebArena、AppWorld
代码任务 SWE-bench、Debug-Gym、R2E-Gym
多智能体 SMAC-Exp、Factorio、PaperBench
框架 OpenRLHF、trlX、EasyR1、AgentFly、AWorld

1.4.4. 参考资源

[!success] 核心要点回顾

  • 范式迁移:Agentic RL 把 LLM 从"一次性文本生成器"变为"在动态环境中持续感知、规划、行动、反思的自主智能体",对应从单步 MDP 到多步 POMDP。
  • 理论形式:POMDP 七元组 ⟨S, A, P, R, Ω, O, γ⟩,动作既包括"说话"也包括"调用工具/执行命令",奖励可稀疏可稠密。
  • 六大能力:Planning、Tool Use、Memory、Self-Improvement、Reasoning、Perception,全部由 RL 驱动升级(代表工作:LATS、TIR、Memory-R1、Reflexion、DeepSeek-R1、Vision-R1)。
  • 上手建议:Web 任务用 WebArena,代码用 SWE-bench,框架从 OpenRLHF / EasyR1 入手;开源清单见论文官方仓库。