Loops explained Claude, GPT, Mira and what actually works

图像

AI 已经普及多年。

不是因为更快的方式有多复杂,而是没人告诉过他们更快的长什么样。

更快的方式叫 Loop(循环),目前这是世界上最好的 AI 工程师最关注的东西。这篇文章补上没人解释过的那部分。读完你会比绝大多数人更懂 Loop:它是什么,底层如何运作,什么时候值得用、什么时候是陷阱,怎么在 Claude 或 ChatGPT 里自己搭一个基础的,以及那些值得在你生活中运行的简单版本。

开始之前,在 X 上关注我并加入我刚创建的 Telegram 频道,我每天发更多 AI 内容。两者都免费。

X - https://x.com/AnatoliKopadze

Telegram - https://t.me/kopadzemp

1. 大多数人怎么用 AI?

仔细看这种「一次一问」的习惯,因为这正是全部问题所在。每一步都得经过你。你决定问什么,你判断答案,你决定下一步。除非你推它一把,否则 AI 从不主动行动;你一停,它就停。

这没问题,但它有天花板。你是发动机。AI 只是你手里的工具,而工具自己不会动。

有另一种工作方式,也是为什么世界上最好的工程师正在改变他们的构建方式。你不是带着 AI 走每一步,而是给它一个目标,让它自己跑步骤。它自己规划、执行、检查结果、修复薄弱点、重复直到目标达成。你抽身出来,工作继续。

6 月 8 日

这是你的月度提醒:你不应该再提示编码代理了。你应该设计循环来提示你的代理。

视频截图

两位最受尊敬的工程师,用不同的话说着同一件事。大多数人读到这种话,心里其实不知道在实践层面意味着什么。所以让我们好好拆解一下。

2. 什么是 Loop?

提示词(Prompt)是一条指令。Loop 是一个 AI 持续朝着它工作的目标,直到达成。把它想象成一个递归目标:你定义一个目的,AI 不断迭代直到完成。

Prompt 给你一个答案,然后等你决定下一步。Loop 自己跑完整周期:

DISCOVER  →  弄清楚需要做什么
PLAN      →  决定怎么做
EXECUTE   →  执行工作
VERIFY    →  对照目标检查
ITERATE   →  还没到?把结果喂回去,重复

五个步骤中有三个才是真正干活的,也是人们搞错 Loop 的地方。

Verify 是 Loop 的心脏。 没有对结果的真正检查,你就没有 Loop,你只有 Agent 在重复地自我认同。检查是把重复变成进步的关键。它可以是硬测试(“代码能通过吗”)、可衡量的条件(“数字大于 X 吗”),或者是模型打分的评估表。没有关卡,Agent 就是在给自己的作业打分,而干活的那个模型当评分员太仁慈了。

State 是让 Loop 能学习的原因。 每次循环,AI 必须记住它已经试过什么,否则它会永远重复同一个错误。真正的 Loop 在旁边维护一条小记录:做了什么、什么失败了、下一步是什么。明天的运行从中断处恢复,而不是从零开始。这也是费用开始上涨的地方,后面会讲到。

停止条件让它保持理智。 没有出口的 Loop 会一直运行到成功、崩溃或花光你的预算。每个正经的 Loop 都有两种停止方式:成功,以及硬限制(“尝试 8 次后停止并报告”)。跳过这个,你就造了一台可以整夜白跑的机器。

Prompt 递给 AI 一条指令。Loop 递给 AI 一份工作、一种知道工作何时完成的方法,以及一条何时放弃的规则。

3. 你真的需要 Loop 吗?

大多数文章在告诉你什么时候不该用 Loop 之前就先推销它了。这是正经人真正在用的判断标准。只有以下四条全部满足时,才值得构建 Loop:

  • 任务至少每周重复一次。 低于这个频率,搭建成本永远收不回来。一次性任务用一个好 prompt 就够了。
  • 有东西能自动拒绝糟糕的输出。 测试、类型检查、构建、linter、硬规则。如果没有什么能替你淘汰不合格的工作,Loop 只是在空转。
  • Agent 能自己完成整件事,而不是把一半丢回给你。
  • "完成"是客观的,不是主观判断。 如果质量取决于品味,人类仍然胜出。

漏掉任何一条,就保持手动 prompt。这个话题的诚实版本是:Loop 工程是真实存在的,但大多数人也还不需要重型版本。每个人都能用的是轻量版,我们后面会讲到。 但你应该知道分界线在哪。

4. 为代码而生的版本

Loop 首先在软件领域流行起来,因为代码是世界上最容易验证的东西。测试通过或不通过,没得争,所以 AI 总是知道自己完成了没有。

代码 Loop 被赋予一个目标和严格的检查方式:

▸ LOOP SPEC
目标:/tests/auth 里的每个测试都通过,lint 干净,没有类型错误。

每次迭代:
  1. 运行测试套件,读取每个失败
  2. 挑选影响最大的单一失败
  3. 写最小的改动来修复它
  4. 重新运行测试、lint 和类型检查器

VERIFY:全部绿色 + 零 lint 警告 + 零类型错误
STOP WHEN:验证通过,或者达到 8 次迭代
ON STOP:总结改了哪些,还有什么仍然失败

在底层,真正的 Loop 由五个构建块组成。Claude Code 和 Codex 现在内置了全部五个。

1. 自动化(心跳)

这是让它成为 Loop(而不是一次性运行)的触发器。你定义一个 prompt、一个节奏和一个目标,它按计划运行,不需要你启动。在 Claude Code 里,/loop 按间隔重新运行 prompt,/goal 让会话持续直到你写的条件确实为真,hooks 在 Agent 生命周期的节点触发命令,推到 cron job 或 GitHub Actions 让你合上笔记本后它还在跑。发现的结果来找你,而不是你四处去检查。

2. Skill(可复用的指令)

不用把一整面指令墙粘贴到每次运行中。你把规则、要遵循的模式、绝对不能碰的东西列表保存成一个文件,Loop 每次读取它。现在自动化只需按名称调用 Skill,重复性任务变得可维护,不会烂在没人更新的计划表里。

3. 子 Agent(让干活的和检查的分开)

Loop 里最有用的一条结构技巧是把干活的那个 Agent 和检查它的 Agent 分开。写代码的模型给自己作业打分时太仁慈了。第二个 Agent 用不同的指令,有时是更强的模型、更高的 effort,能抓住第一个自己说服了自己接受的问题。你的写手可以又快又便宜,你的审查员慢而严格。这种分离占了质量提升的大部分。

4. 连接器(让它行动,而不只是建议)

这是"Agent 说’这是修复方法’"和一个 Loop 之间真正的区别——后者会自己打开 PR、关联 ticket、构建变绿后自动 ping 频道。连接器让 Loop 在真实环境里行动,而不是描述如果它能做到的话它会做什么。

5. 验证器(关卡)

自动拒绝糟糕工作的测试、类型检查或构建。这是决定 Loop 帮你省钱还是烧钱的那个模块。其他都是管道,这部分才是让它变得真实的东西。

把上面这些叠在一起,你就得到了大团队现在规模化运行的东西:成群 Agent 在同个任务上循环,几十甚至几千个同时跑。有位工程师用这种 Loop 在六天内把整个代码库从一种编程语言重写为另一种——手工做需要接近一年。这是正经软件构建方式的真正变革。而它有一个演示从不展示的代价。

5. 没人提到的成本

Loop 跑在 token 上,token 就是钱。问题不在于每一步都要花钱,而在于成本是如何指数级增长的。

每次循环,Agent 重新读取它的上下文:目标、代码、上一步的结果、什么失败了。整堆东西每次迭代都重新送进模型,而且每次都在变大。跑十次的 Loop 不是十个 prompt 的成本,是十个越来越大的 prompt。那个提升质量的"干活的+检查的"技巧也让账单翻倍,因为现在两个模型在读同一份工作。

▸ 单次 Loop 的粗略成本
单 Agent、中等任务:     ~50,000 – 200,000 token
每次迭代重新发送上下文:  每次都在增长
并行 Agent 集群:       以上全部 × N

真正重要的指标——而且几乎没人追踪——是每次验收变更的成本。不是花了多少 token,也不是跑了多少次。如果 Loop 给你十个结果,你扔掉了六个,那你还是在做它本该替你省掉的审查工作。验收率低于 50% 时,成本高于回报。

Loop 也会悄悄地失败。工程师 Geoffrey Huntley 称之为"Ralph Wiggum Loop":Agent 过早判定自己完成了,在半成品上退出,Loop 继续运行、持续花钱,却不产生任何东西。没有能淘汰不合格工作的硬关卡,Loop 不会崩溃,它只会沉默地计费。

这就是为什么重型版本属于有预算和护栏的团队:迭代上限、token 预算、无聊步骤上用便宜模型、监控。如果你不属于这行列,你也没错过什么——核心思想用一小部分成本就能工作,完全不需要那些搭建。

6. 真正有效的顺序

如果你真打算建一个,顺序比工具重要。那些发运了能在生产环境中存活的 Loop 的人,都是这么做的:

1. 先把一次手动跑通做可靠。
2. 把它变成 Skill(保存指令)。
3. 把 Skill 包进 Loop(加上关卡 + 停止条件)。
4. 然后才上计划任务。

跳过前几步,把还没手动做可靠的东西放进计划,正是 Loop 在你睡觉时爆炸的原因。先证明一次,加固它,再自动化它。

7. 自己搭一个基础 Loop(任何 LLM 都能用)

你不需要编码 Agent 就能感受这是怎么工作的。你现在就可以在任何 LLM 里用手动方式运行一个简单的 Loop,只需要一个 prompt。诀窍是一次性把三个 Loop 部分都给模型:目标、严格的成功标准、以及一个迫使它在允许自己停止之前先做自我检查的协议。

▸ 自检 Loop(粘贴到 Claude 或 ChatGPT)
你将以循环方式工作,直到任务达标。

任务:
[精确描述你想要产出的内容]

成功标准(严格,不要软性通过):
- [标准 1]
- [标准 2]
- [标准 3]

循环协议,每轮重复:
1. 规划  - 说明唯一的下一个步骤
2. 执行  - 产出或改进工作
3. 验证  - 对每个标准打 1-10 分。
           要极其诚实。列出仍然薄弱的地方。
4. 判定  - 如果每个标准都 ≥8 分,打印 "FINAL" 并停止。
           否则打印 "ITERATING" 并继续,优先修复最弱项。

规则:
- 在每项标准都达到 8 分或更高之前,绝不声称完成。
- 每轮必须修复上一轮验证中最弱的部分。
- 不要问我问题。做合理的假设,记下来,继续。

开始。循环执行直到 FINAL。

看会发生什么。模型起草、对照你的标准给自己的作业打分、找到薄弱点、重写,一遍又一遍,直到它真正越过那条线,而不是把第一个看起来差不多的东西交给你。这就是 Loop。你用一段话就搭了一个。

但注意还缺了什么,因为这就是接下来要说的全部重点。你是触发器。你打开了聊天,你粘贴了 prompt,你坐在那里看着它迭代。关掉标签页,它就消失了。没有计划任务,没有"每天早上做这个",没有"收到邮件时唤醒"。它没法主动找你,因为它只存在于你看着它的时候。

要得到一个独立运行的 Loop——按计划、由真实事件触发、不需要你盯着——你通常得进入之前提到的那个重型世界:工具、托管、代码、关卡、账单。

当你在处理真正繁重的任务时,这说得通。但对于 99% 的日常任务,已经有了一个现成的、极其简单的解决方案。

8. 同样的理念,用在你的真实生活里

剥离代码和成本,剩下的是一个简单、真正有用的概念:一个自己运行的任务,按计划或在某事发生时触发,不需要你记住它或在场。你不需要是工程师也能用。你只需要为生活而构建的 Loop,而不是为代码库。

有一个免费选项,你用大白话描述就能创建一个。不需要代码、托管、密钥、保持标签页打开、或者搞错构建顺序。

它叫 Mira,在 Telegram 里,这个你大概率已经打开着的应用里。像朋友一样给它发消息,它运行的 Loop 被称为 Skills。每个 Skill 都拥有真正 Loop 需要的那些部分——触发器、动作、自主运行的方式——但你不必把它们任何一个连接起来。你只要说出你想要什么。

▸ SKILL
"每个工作日早上 7 点,检查我的 Gmail 和 Google Calendar。
给我发一条简报:3 个最重要的会议、收件箱里任何紧急事项、
以及一件我说过要跟进但还没做的事。控制在 120 字以内。"

这就是一个真实的 Loop。时间触发器、跨两个连接应用的多步骤动作、自主运行并主动来找你。你用一条消息就写出来了。

9. Mira 实际能做什么

这是让一切变得直观的部分。Mira 不是一个更聪明的聊天机器人。它和 ChatGPT 的区别很简单:ChatGPT 回答,Mira 行动。你不是让它写邮件,你让它发邮件。你不是得到一张工单草稿,而是得到一张在 Linear 里已分配负责人的真实工单。它做事,在后台,而且它在每次对话之间都记得你。

它通过 Composio 连接 500+ 应用(Notion、Gmail、Google Calendar、GitHub、Figma、Stripe 等数百个),拥有跨会话和群聊的长期记忆,并且是模型无关的——根据任务自动使用 GPT、Claude 或 Gemini。下面这些是具体能做到的。

工作场景 这是 Loop 理念不需要一行代码就能变现的地方。

▸ SKILLS
"每次会议前一小时,用上次跟那个人谈话的上下文和决策来提醒我。"

"当我转发一条消息过来时,把它变成 Linear ticket,
设置正确的优先级并分配负责人。"

"每周五下午 4 点,收集团队的任务状态和指标,
在我们的聊天里发布一份干净的周报。"

"用 5 条要点总结我在这个群聊里错过的一切。"

它几秒钟就能把你错过的一条 200 条消息的线程补回来,你继续聊着天它就把 ticket 建好了,走进会议室时已经被简要汇报过了。在群聊里它记得团队的决策和任务,不只是你一个人的。

创作者场景 这是大部分人低估的部分。Mira 在聊天内部端到端制作内容。

▸ SKILLS
"我会发一条语音消息,里面有一个原始想法。把它变成一篇
带标题和标签的完整帖子。"

"拿这个想法,写出适用于 X、Instagram、LinkedIn、
邮件和 Newsletter 的版本,每个用合适的格式。"

"为这篇文章生成 3 张图片选项。"

"把这张图变成一段短视频,发到我的 Telegram 频道。"

语音消息进去,成品帖子出来,大约三十秒。一个 Brief 变成六个平台原生版本。它在聊天里直接生成图片和视频,编辑照片、替换背景、构建吉祥物和头像,甚至唇同步和动画化。整个内容管线就在一个窗口里。

语音场景 Mira 把语音当作一等输入,这比听起来更重要。

▸ SKILLS
"把我的语音消息转写成干净的文本。"
"把这篇文章读成音频给我听。"
"把这个群聊里的语音消息总结成要点。"

它转写你的语音消息、把文本读给你听、理解群聊里的语音消息并总结讨论内容,还能在你不能打字时当免提语音助手。

生活场景 同样的引擎,用在一切其他方面。

▸ SKILLS
"每天晚上 7 点,问我今天锻炼了没有。保持连续记录,
不要让我连续跳过超过一天。"

"每晚问我 3 个关于今天的问题,记住答案,
每周告诉我一次有什么变了。"

"通过一张我盘子的照片追踪卡路里。"

"盯着这条航线,当价格跌到我的数字时买入。"

"每天早上给我一份关于我关注话题的、无标题党的新闻摘要。"

一个督促你保持纪录的教练。一本真正记住你的日记,随着时间推移成为你的陪伴式查问伙伴。通过照片追踪卡路里,不需要额外 app。从你自己的错误中构建的语言练习。价格对了就买入的航班盯盘器。一份去掉标题党的每日摘要。

10. 两分钟上手

打开 Telegram。去 Mira。给它发条消息。免费访问立即可用。先试试这些:

@mira, plan my week
@mira, summarize this chat
@mira, remind me to review PRs every Monday at 9am
@mira, write a post about [topic] for X and Instagram

本文中的任何示例,在你输入的那一刻就变成了一个正在运行的 Loop。

11. 这对你实际意味着什么

Loop 不是一种潮流。它们是"谁在工作"这个问题的转变。AI 不再等你推着它走每一步,而是自己跑完整件工作。话说回来,这不是你要去追逐或强行塞入不合适的场景的东西。更多时候,你只会白白烧钱。我的建议是:先用已经免费的,直到你真的觉得不够了,再开始思考你真正需要什么。