详解AI Agent智能体L0_L5的分级框架

AI 智能体自主性表现(Agentic behavior)指的是 AI 系统具备的自主能力与决策水平,其范围涵盖从简单的任务自动化,到完全自主运行的智能体系统。本文将详解智能体自主性的每个层级,当前智能体的行业现状以及发展的核心局限。

1. 一、何为"自主性"?为何要分级?

如今行业都在争相构建 AI 智能体,但若问"AI 智能体究竟是什么",往往会得到不同答案。与其纠结定义,不如聚焦核心问题:这些系统实际能做什么?它们拥有多少自主性、推理能力与适应性?会在哪些环节受阻?距离真正的自主运行还有多远?

事实上,所有的 AI 系统都具备一定程度的自主性、控制力与决策能力,但自主性的内涵并不相同。为理清这一概念,我们参考自动驾驶的分级逻辑,构建了一个六层级框架(L0-L5)。其核心思想在于,自主性并非一蹴而就,而是一个逐步、结构化的演进过程。

自动驾驶 L0-L5 分级

图 1:自动驾驶 L0–L5 分级示意(数据来源:SAE / NHTSA),AI 智能体分级正参考了这一逻辑

正如自动驾驶汽车必须依次掌握车道保持、自适应巡航和自动泊车,才能迈向 L3 及以上级别,AI 智能体的发展也遵循同样的模式,每个层级都增加了更复杂的推理能力和独立性。

2. 二、AI 智能体的六层框架

AI 智能体六层框架总览

图 2:AI 智能体六层框架总览——从反应式到完全创造式

L0:基于规则的工作流(追随者)——这一层级的 AI 无智能可言,仅遵循"若满足 A 则执行 B"的逻辑运行,类似 Excel 宏命令:

  • 无决策能力:仅遵循预设规则,无法自主判断;
  • 无适应性:规则需人工更新,一旦条件变化就会失效;
  • 无推理能力:不具备思考能力,仅执行固定指令。

典型实例包括流水线调度器、脚本机器人等传统自动化系统,这类系统虽有实用价值,但灵活性极差,一旦场景偏离预设规则,就会失灵。

L1:基础响应式(执行者)——从 L1 开始,AI 具备了初步的自主性,能处理输入信息、调取相关数据,并基于模式生成响应。但它仍缺乏真正的智能体属性,仅能被动反应,无法规划行动,也没有记忆功能。

L1 基础响应式流程

图 3:L1 基础响应式——检索(Retrieval)→ 调用 LLM → 评估(In-line Evals)→ 输出

其核心局限在于没有控制循环,既没有记忆历史交互,也无法进行迭代推理,更没有自主决策的动力,本质仍是被动响应工具。

L2:工具使用式(行动者)——L2 阶段的 AI 不再局限于响应,而是能主动执行,可自主决定调用外部工具、获取数据,并将结果整合到输出中。这一阶段的 AI 不再是功能单一的高级自动补全工具,而是能真正做事的系统,比如自主判断是否需要查询信息。

L2 工具使用式架构

图 4:L2 工具使用式——通过 Router 自主决定调用网页搜索、检索与记忆

系统能自主决定何时从 API 调取数据、查询搜索引擎、读取数据库或调用记忆,但也面临关键挑战,需内置信息验证机制,否则可能自信地生成错误信息,即所谓的幻觉。

目前多数 AI 应用处于这一层级,虽向智能体迈进了一步,但本质仍是被动触发。仅在收到指令时行动,且缺乏迭代优化能力,一旦出错,无法自主修正。

L3:观察、规划、行动式(操作者)——L3 与 L2 的核心区别在于,AI 不仅能执行,还能管理执行过程。它会规划步骤、评估输出、调整后再推进。

L3 观察规划行动式架构

图 5:L3 观察规划行动式——Planner 规划、Coordinator 协调、Actor 执行,并带评估反馈

具体表现为:

  1. 感知状态变化:能监测触发条件,如数据库更新、新邮件;
  2. 规划多步工作流:不止返回结果,还能根据依赖关系排序行动;
  3. 内部评估:推进下一步前,会先验证上一步是否有效。

这是对工具使用的重大升级,但仍有局限。任务完成后系统就会停止运行,无法自主设定目标或持续工作。即便未来 GPT-5 发布,若未突破这一局限,仍只能停留在 L2,是高级协调工具,而非完全自主智能体。当前这类工作流更偏向复杂自动化,而非真正的自主智能体。

L4:完全自主式(探索者)——L4 智能体开始像有状态的系统一样运作,不再局限于孤立的任务循环,核心能力包括:

  • 维持状态:持续运行、监测环境,且能跨会话保留信息;
  • 自主触发行动:无需等待明确指令,可主动启动工作流;
  • 实时优化执行:基于反馈调整策略,而非依赖静态规则。

L4 完全自主式架构

图 6:L4 完全自主式——持续监测邮件、Slack、云盘等多信息源,跨会话保留状态并自主执行

此时的 AI 更接近独立系统,能同时监测多个信息源、规划行动、自主执行,无需人类持续干预。但目前该层级仍处于早期阶段,多数 L4 级工作流无法可靠地跨会话保留状态、动态适应环境,或突破预设循环迭代,可靠性仍是核心瓶颈。

L5:完全创造式(创造者)——L5 是 AI 智能体的终极目标,不再局限于执行预设任务,而是能自主创建逻辑、实时构建工具,并为人类尚未找到答案的问题提供解决方案。它无需遵循现有规则,而是会根据任务需求,从零设计工具与方法。

目前我们远未达到这一层级,当前 AI 模型仍存在过拟合问题,擅长复述训练数据中的内容,却缺乏真正的推理能力。即便像 o1、o3、DeepSeek-R1 这样的先进模型,仍依赖硬编码启发式规则,无法实现自主创造。

3. 三、当前 AI 智能体的行业现状

智能体角色与能力层级矩阵

图 7:智能体角色与能力层级匹配矩阵——生产级应用集中在低层级,创新集中在高层级

3.1. 多数系统停留在 L1 与 L2

当前 AI 应用的核心焦点是协调优化,比如优化模型与系统的交互方式、调整提示词、改进信息检索与评估流程、尝试多模态技术。这类应用更易管理与控制,调试难度较低,故障模式也相对可预测。

o1、o3-mini、DeepSeek 等模型正在推动更智能的多阶段工作流发展,也催生出许多新颖的产品与 UI 体验。但目前 L2 的探索主要由初创公司主导,多数企业暂未涉足,原因在于生产环境中,AI 仍需人类辅助;LLM 处理边缘场景的能力不足,且调试偏离轨道的智能体难度极高。

3.2. L2 是当前的主战场

无论是模型层面(LLM 过度依赖训练数据,缺乏自主推理),还是基础设施层面(缺乏支撑真正自主性的核心组件),当前技术都尚未满足 L3 与 L4 的需求,应用范围仍十分有限。

3.3. L3 与 L4 仍受技术限制

1. 模型过拟合问题突出

即便像 DeepSeek-R1(主要通过纯强化学习训练,而非依赖海量语料)这样的模型,也仍存在过拟合问题。这意味着当前 AI 可能陷入了局部最优解,难以突破训练数据的限制,实现真正的泛化推理。

2. 自主推理能力缺失

真正的自主智能体工作流,依赖能推理的模型,而不仅仅是重组训练数据。但目前我们尚未突破这一核心瓶颈:AI 能处理已知问题,却无法自主解决未知问题。

未来我们会看到 AI 系统的渐进式改进,但能否实现向 L3、L4 的跨越式突破,仍是未知数。这可能需要一场根本性的技术革新,也可能我们会在当前阶段停留较长时间。

参考链接:

Vellum:The Six Levels of Agentic Behavior