循环(Loop)是全新的 Prompt

@kyronis_talks
英语1天前 · 2026年7月25日
141K
102
102
2
24

TL;DR

本指南探讨了从手动 Prompt 到自主 AI 循环的转变,详细介绍了各大实验室如何通过自我修正的循环机制来处理复杂的多步骤任务。

手动摇动的方式

每个主要实验室都在悄然围绕同一个理念重建自身:一个在你停止输入后仍能持续运行的循环。这是截至 2026 年 7 月 25 日,Claude、GPT、Gemini、Grok、Meta 的 Muse Spark、Mira 以及开源模型浪潮中,循环实际运作方式的实用指南,每项声明皆有出处。

观察某人使用 AI 工作时,你通常会看到同样的仪式:输入请求,等待,阅读答案,发现问题,解释问题,再次等待,将结果粘贴到别处。第二天回来,从头再来一遍。

这里有个令人不安的地方:那个仪式本身就是一个循环——提问、检查、纠正、重复。它与实验室现在推出的产品之间的唯一区别,是谁在转动曲柄。当你手动操作时,你就是触发器、记忆、验证器和停止条件,而你的成本很高。

在过去一年里,每个严肃的 AI 实验室都汇聚到同一个解决方案上:将曲柄移到机器内部。Anthropic 为 Claude 发布了官方的循环分类法。OpenAI 围绕一个能自主运行多步骤任务的工作模式,重建了 ChatGPT。Google 销售按任务租用的研究循环。Meta 训练了其 Muse Spark 模型,专门用于编排子 Agent 集群。即使是这个故事中最小的参与者——一个使用名为 Mira 的 Telegram 机器人的两人初创公司——实际上也在向那些永远不会打开终端的人销售循环。

当我写下这些文字时,这片领域仍在快速变化。仅在过去七天内:Anthropic 发布了专为日常 Agent 工作打造的新 Opus;阿里巴巴预览了 2.4 万亿参数的 Qwen;而迄今为止最大的开源模型,其权重将在约 48 小时内公布。

其结果是自聊天界面出现以来,这项技术使用方式上最重大的悄然转变:工作单位不再是提示词,而是循环——一个持续运行直到你定义的某个条件被满足的工作周期。

本文是那个故事的完整版本。循环究竟是什么,剥离炒作。每个实验室当前的循环栈是什么,包括一个月前还不存在的模型。什么真正有效——事实证明这在各个供应商之间惊人地一致。以及那些发布公告中未提及的失败模式和成本。

关于方法的一点说明,因为 AI 领域的讨论充斥着不可靠的论断:以下所有内容均基于实验室自己的文档和公告,或具名的独立评估,并在截至 2026 年 7 月 25 日的一周内进行了实时验证。如果某个数字由供应商自行报告,我会说明。如果某件事未经证实或仍处于预览阶段,我也会说明。完整来源列表在文末。

第一部分:循环究竟是什么

去掉专业术语,一个循环就是四个节拍加上一个停止原因。

Anthropic 的 Claude Code 团队——该领域最接近标准定义的团队——将其概括为一句话:循环是 "Agent 重复工作周期直到满足停止条件"。OpenAI 自己的 Agent 指南用工程师的语言表达了同样的意思:"每个编排方法都需要一个"运行"的概念,通常实现为一个循环,让 Agent 持续运行直到达到退出条件",退出条件包括最终输出、错误或最大轮数。

用通俗语言来说,这四个节拍是:

  1. 触发。 某个东西启动运行。你、一个计划、一个警报、一个新的拉取请求、一封到达的邮件。
  2. 工作。 模型收集上下文并使用工具执行操作:读取文件、运行查询、起草消息、编辑代码。
  3. 检查。 结果根据实际情况进行验证。测试通过或失败。数字与来源匹配。第二个模型根据你的标准对草稿进行评分。
  4. 重复或停止。 如果检查失败,循环会带着它学到的东西再次运行。如果检查通过,或达到上限,则停止。

这就是全部诀窍。一个提示词是经过节拍二和三的一次通过,你在脑海中完成节拍三。循环则是将检查和重复交给机器,再加上两条安全护栏:一个停止条件,这样它就不会永远运行下去;以及一个预算,这样它就不会无限花费。

辅助角色

围绕这四个节拍,每个严肃的循环栈都提供相同的五个辅助部分,无论供应商如何称呼它们:

  • 记忆。 在运行之间存活的笔记,这样第四十次运行就知道第一次运行学到了什么。
  • 状态。 循环当前的位置:什么已完成,什么已失败,下一步是什么。
  • 验证器。 决定"足够好"的东西。你将做出的最重要的设计选择。
  • 停止条件。 "测试通过"、"队列为空"、"五次尝试后停止"、"现在是上午 9 点,摘要已发送"。
  • 成本计量器。 每个周期的代币和美元,因为循环会放大它们接触的任何东西,包括你的账单。

四种循环

Anthropic 的分类法值得学习,因为它能清晰地映射到其他每个供应商的产品上,尽管名称不同。他们的团队根据你移交的内容对循环进行分类:

  • 基于轮次的循环。 你提示,Agent 执行一个周期(收集、行动、检查、响应),你审查,你再次提示。你仍然是停止条件。这是每个人的起点,Anthropic 指出每个提示词已经在内部运行这个微循环。
  • 基于目标的循环。 你移交停止条件。你定义"完成"的样子,Agent 不断迭代直到达到目标或达到轮次上限。在 Claude Code 中,这实际上是一个 /goal 命令,每次模型试图停止时,"一个评估模型会检查你的条件,并将其送回工作,直到目标达成"。确定性标准效果最好:测试通过、分数达标、检查清单完成。
  • 基于时间的循环。 你移交触发器。循环按间隔或计划运行,并对变化做出反应:每天早上总结 Slack,检查拉取请求直到 CI 通过。
  • 主动循环。 你移交提示词本身。一个事件或计划启动运行,无需人类实时参与:新的错误报告到达时自动分类,依赖项每周自动升级,每个任务在达到自己的目标时退出。

记住这个阶梯(移交检查,然后是停止条件,然后是触发器,然后是提示词),本文的其余部分就是观察七个供应商从不同方向攀登这个阶梯。

第二部分:当前状态一览

在逐个实验室介绍之前,先了解一下背景,因为前沿领域在本文撰写前的五周内发展得极其迅速:Grok 4.5 于 7 月 8 日发布,Meta 的 Muse Spark 1.1 和 OpenAI 的 GPT-5.6 均于 7 月 9 日发布,Thinking Machines 于 7 月 15 日发布了其首个模型,Moonshot 的 Kimi K3 于 7 月 16 日落地,阿里巴巴于 7 月 19 日预览了 Qwen3.8-Max,而 Anthropic 于 7 月 24 日(本文更新前一天)发布了 Claude Opus 5。

作为一个中立的标准,独立评估机构 Artificial Analysis 在其智能指数上对通用能力进行评分。截至本周的快照(v4.1),已公布的排名前列如下:

  • Claude Fable 5 (Anthropic):59.9
  • GPT-5.6 Sol Max (OpenAI):58.9
  • Kimi K3 (Moonshot,开源权重即将发布):57.1,总体第四
  • Claude Opus 4.8、Grok 4.5、Muse Spark 1.1、GLM-5.2 以及其余模型位列其后。

有两个值得注意的注意事项。Claude Opus 5 在撰写本文时仅发布一天,尚未被纳入指数。此外,一个单一的复合指数无法捕捉长期 Agent 工作——而这正是循环实际做的事情——因此,如果某个实验室发布了 Agent 特定结果,我会在该实验室的章节中引用它们,并在是自行报告时进行标注。

尽管如此,有两件事值得注意。排名前列的分数差距现在不到三分,也就是说,为了构建循环,该区间内的模型选择比围绕它的循环更重要。而且,一个开源模型首次进入了该区间。

Claude:循环作为一级原生组件

模型。 Claude Fable 5 于 2026 年 6 月 9 日发布,是 Anthropic 最强大的模型,也是最能明确为这种工作方式构建的模型。Anthropic 自己的说法是,在像 Claude Code 这样的框架内运行,它可以 "连续工作数天:跨阶段规划、委派给子 Agent、并检查自己的工作"。它的思考是自适应的且始终开启,通过一个努力程度设置进行调节,拥有 100 万 token 的上下文窗口。它仍然在独立指数中排名第一。其兄弟模型 Mythos 5 与它同时发布,是 Anthropic 评估为在网络安全任务上最强的专家模型。

本周的消息是 Claude Opus 5,于 7 月 24 日发布:Anthropic 描述它接近 Fable 5 的前沿智能,但价格是其一半(每百万输入 token 5 美元,每百万输出 token 25 美元),根据公告,它是知识工作评估(如 GDPval-AA)的最佳模型,并且是 Claude Max 计划的新默认模型。对于循环构建者来说,其卖点直截了当:以一半的成本获得接近前沿的循环,这改变了你能负担得起整天运行的内容。

循环栈。 Anthropic 的独特之处在于,循环不是隐藏在应用程序中的功能。它们是你可以直接输入的原生组件:

  • /goal 定义"完成",并让评估模型将 Agent 送回工作,直到条件满足或达到轮次上限。这就是基于目标的循环,名副其实地产品化了。
  • /loop 在你的机器上按间隔重新运行提示词;/schedule 将该循环作为例行程序移动到 Anthropic 的云端,在那里它可以在你的笔记本电脑关闭的情况下持续运行,由计划、API 调用或 GitHub 事件触发。
  • 动态工作流处理极端情况:Claude 编写一个实际的编排脚本,可以在单次运行中协调多达 1000 个子 Agent。标志性的案例是,一位开发者在大约 11 天内,使用数百个并行 Agent,将 Bun 运行时(大约 75 万行代码)从 Zig 移植到了 Rust。
  • 技能、钩子和子 Agent 构成了辅助角色:技能编码如何验证工作,一个全新上下文的第二 Agent 执行代码审查,而记忆在会话之间持久化到文件中。

理念。 Anthropic 的指导方针在克制方面异常明确:并非每个任务都需要复杂的循环,从最简单的原生组件开始,设置确定性停止标准,在大型运行前先试点一个小部分,并使用内置命令监控使用情况。他们那句整个领域不断重新发现的座右铭是:能够检查并改进自身输出的 Agent 从根本上来说更可靠。

解读为: 开发者的循环实验室。最清晰、最可组合的每种循环类型版本,现在有了一个更便宜的接近前沿的引擎在内部运行。

OpenAI:三种模式和一个独立的审批者

模型。 OpenAI 的 GPT-5.6 代产品于 2026 年 7 月 9 日全面上市,分为 三个层级:Sol(旗舰,每百万 token 输入 5 美元,输出 30 美元)、Terra(平衡的中端)和 Luna(快速且便宜),所有模型都拥有大约 100 万 token 的上下文窗口。Sol 在独立指数中排名第二,与 Fable 5 基本持平。其标志性的循环功能是一种超模式,在困难问题上默认协调四个并行 Agent。

消费者循环栈。 OpenAI 在这里的故事是一次重建。2025 年的独立 "ChatGPT Agent" 已 被淘汰;取而代之的是,ChatGPT 现在有三种模式:Chat 用于对话,Work 用于产生最终交付物的长多步骤任务,以及 Codex 用于软件。Work 在云端运行作业,可以在审批检查点暂停,并且关键的是,可以由触发器启动:计划任务 现在包括监控任务,这些任务按间隔检查某些内容,只有在有内容需要报告时才通知你。这是一个销售给消费者的基于时间的循环,无需编码。一个 Agent 模式也存在于 Atlas 浏览器中,用于执行网页上的操作任务。

开发者循环栈。 OpenAI 的文档中明确界定了分界线:"当你希望拥有循环时,使用 Responses API。当你希望 SDK 运行循环时,使用 Agents SDK。" Responses API 默认是 Agent 化的,允许模型在单个请求内调用网页搜索、文件搜索、计算机使用、代码执行和你的函数。两个 GPT-5.6 时代的新增功能对循环特别重要:程序化工具调用(Programmatic Tool Calling),模型在沙箱中编写一个小的 JavaScript 程序来协调其自身的工具调用;以及一个多 Agent 测试版,其中根 Agent 生成并管理一个子 Agent 树。

独特的理念:将执行者与审批者分开。 OpenAI 最有趣的循环贡献是 Auto-review(2026 年 4 月 30 日):当 Codex Agent 想要在其沙箱之外执行某些操作时,一个独立的审查模型(而不是 Agent 本身)来决定该操作是否与用户的请求一致。他们的推理直截了当:主 Agent 被优化为完成任务,这会产生压力,将审批边界视为另一个障碍。将审批决策保留在不同的模型调用中,使其可审计。结果,根据 OpenAI 的说法:会话停止向人类询问的频率大约降低了 200 倍,并且审查者批准了大约 99% 仍然升级上来的请求。这些数字是自行报告的,但设计原则具有普适性:永远不要让想要完成任务的模型也成为决定它是否完成的模型。

解读为: 消费者的循环入门,加上一个严肃的开发者栈。以及给平台构建者的一个警示:OpenAI 在推出其可视化 Agent 构建器后不到一年就弃用了它,硬性关闭日期为 2026 年 11 月 30 日。

Google:按任务租赁的研究循环

模型。 Google 当前的旗舰模型是 Gemini 3.1 Pro(2026 年 4 月),但对于这个故事而言,有趣的部分不是聊天模型。而是 Google 将整个循环变成了一个产品。

循环栈。 深度研究 Agent 于 2026 年 4 月 21 日推出,有两种版本(标准版,注重速度;Max 版,注重详尽性),是你可以通过一次 API 请求调用的基于目标的研究循环。文档直接描述了循环:计划、搜索、阅读、迭代、输出,在后台运行几分钟到一小时,最终报告中包含引用。设计细节是循环工程的一堂小型大师课:

  • 后台执行是强制性的。 研究循环会超过 HTTP 超时时间,因此你需要轮询结果。循环,而不是请求,是工作单元。
  • 协作式规划 是前端的一个人类关卡:Agent 提出其研究计划,你编辑或批准它,然后它开始运行。在循环开始前进行引导,而不是在循环期间进行监护。
  • 内置了硬性停止条件: 最大研究时间为 60 分钟,大多数任务在大约 20 分钟内完成。
  • 工具按每次运行限定范围: 默认情况下包括 Google 搜索、URL 读取、代码执行,可选地包括你自己的 MCP 服务器和文件存储,你可以完全关闭开放网络,仅研究你的私有数据。
  • 成本按循环定价,[透明公开。](http://honestly.google/) Google 自己的估计:一个典型的标准任务大约消耗 80 次搜索和大约 25 万输入 token,成本在 1 到 3 美元之间;一次 Max 运行可能达到 160 次搜索,成本大约在 3 到 7 美元。循环不是聊天消息,Google 的计费方式也体现了这一点。

解读为: 最清晰的商业证明,表明循环(而非模型调用)正在成为产品。你购买的不是 token,而是一个完整的研究结果。

一个诚实的注意事项:截至本文撰写时,深度研究 Agent 通过 Interactions API 处于预览阶段,因此预计界面可能会发生变化。

Muse Spark 1.1:为编排而生新秀

模型。 Muse Spark 1.1 是 Meta Superintelligence Labs 的多模态推理模型,于 2026 年 7 月 9 日发布,是 4 月份 Muse Spark 1.0 的升级版,它是本次综述中最重要的新来者之一,原因有三。

首先,策略:这是 Meta 第一个付费模型 API,价格为每百万输入 token 1.25 美元,输出 token 4.25 美元,并且是闭源的,与开放的 Llama 时代彻底决裂。Llama 系列的拥护者实际上已让位于下面介绍的开源模型浪潮;Meta 仅表示希望未来开放 Muse 的某些版本。

其次,训练目标。大多数模型将 Agent 行为作为副产品来学习,而 Meta 表示这个模型是直接为组织架构而训练的:"作为主 Agent,它可以收集上下文、制定计划,并在并行子 Agent 之间委派执行。作为子 Agent,它遵守其职责,理解可用工具,并知道何时应升级回主 Agent。" 它可以零样本学习新工具、MCP 服务器和自定义技能,积极管理其 100 万 token 的上下文(在工作时记住、检索和压缩),并处理跨多个应用程序的计算机使用工作流。

第三,性价比定位。在独立指数上,它在三个月内从 1.0 版本上升了 8 分,使其低于前沿三巨头,但每个任务的成本只是其一小部分,并且它目前在 MCP Atlas 工具使用基准测试中以 88.1 分领先(供应商相关数字;请谨慎对待)。

给循环构建者的脚注,说明了这一切的发展方向。 Meta 自己的开发者文档警告说,如果你在旧的 Chat Completions 风格 API 上构建一个多轮对话 Agent,模型的推理会在轮次之间被丢弃,导致循环漂移和重复工作;他们引导你使用一种 Responses 风格的 API,该 API 在轮次之间携带加密的推理。整个行业的架构正在围绕循环进行重建,一次弃用一个 API。

解读为: 当前沿三巨头在成本上过于奢侈时,你租用用于编排密集型循环的引擎。仍然年轻;从 1.0 到 1.1 的斜率是值得关注的原因。

Grok 4.5:廉价、快速的循环,在工作中训练

模型。 Grok 4.5 于 2026 年 7 月 8 日由马斯克的 xAI(现隶属于公开上市的 SpaceXAI 伞形公司)发布,被宣传为其在编码、Agent 任务和知识工作方面最智能的模型。马斯克自己的定位异常直接:一个 Opus 级别的模型,大致与 Claude Opus 4.7 相当,但更快、更便宜。独立评分与这种感觉一致:高于上一代 Opus,低于前沿三巨头。

为什么它对循环特别重要。 两个声明,均来自 xAI,并且即使考虑到营销因素,也与循环相关:

  • 它是在循环中训练的。 xAI 表示,强化学习涵盖了数十万个多步骤工程任务,并带有自动评分,基础设施上 Agent 部署可以运行数小时,同时训练仍在继续。无论基准测试怎么说,其训练内容就是工作本身。
  • 循环经济性是卖点。 价格为每百万 token 输入 2 美元,输出 6 美元,每秒大约 80 个 token,以及声称的两倍 token 效率(以不到可比模型一半的步骤解决任务),其论点不是"最智能的循环",而是"每美元最多的循环"。对于循环来说,成本等于每次循环成本乘以循环次数,这个算术就是全部游戏。文档 通过平淡无奇的循环管道强化了这一点:对话固定的提示缓存,因此长循环不必支付冷缓存的价格;以及针对工具密集型运行的上下文压缩指南。

产品化的循环存在于 Grok Build 中,这是它的编码 Agent(与 Cursor 一起训练,在所有计划中均可使用),它扩展到了一些奇怪的实用领域:带有网页研究的多表格 Excel 模型、原生 PowerPoint 图表、Word 文档。

解读为: 高容量循环的预算主力,通常的注意事项是大多数效率数字是供应商自己提供的。

Mira:面向永远不会打开终端的人的循环

这是一个在顶级模型列表中看起来像是个错误,但实际上是最具启发性的条目之一。

Mira 究竟是什么。 Mira 不是一个模型。它是一个完全存在于 Telegram 内部 的消费者 AI Agent,由一个规模小到可以归为两个人的初创公司构建,由 Daria Yakovleva 领导,并从 The Open Platform(一家 Telegram 生态系统软件公司)孵化出来。它于 2026 年 2 月悄然推出,据报道到 6 月初月活跃用户突破 100 万(自行报告,大约 117 万)。在底层,它与模型无关:它将每个任务路由到第三方模型(GPT、Claude 等),而不是运行自己的模型。

为什么它属于本文。 因为 Mira 的产品就是循环,而且只有循环,销售给那些永远不会听到这个词的人。它打包的自动化功能,称为技能,每个都包含了第一部分中描述的确切结构:一个触发器(计划、语音笔记、群聊事件)、跨连接应用程序(日历、电子邮件、项目跟踪器、内容工具)的操作,以及自主交付回聊天。监控航班价格并提醒我。将我的语音备忘录转换为三个平台的帖子。总结今天这个群组决定的内容并归档行动项。其自身材料中的定位语是整个循环时代最简洁的总结:ChatGPT 回答,Mira 行动。

诚实的注意事项。 用户数量和连接器数量(其材料中有时说 200 个,有时说 1000 多个服务)是自行报告且不同页面不一致的,该公司没有发布任何关于其循环如何验证任何内容的工程指导,并且将技能称为"循环"是一种外部解读,并非 Mira 自己的词汇。一个包裹其他实验室模型的小团队,与本文列表中的其他任何东西相比,也是一个脆弱的基础。

解读为: 需求信号。当一个两人的 Telegram 机器人为普通人打包触发器、操作和自主交付,并达到 100 万用户时,循环已经不再是一个开发者的概念。对于大量实际工作来说,分发和零设置比能力更重要。

开源模型浪潮:自带循环

2026 年中期最响亮的故事是,开源世界已经从落后数年变为落后数月,而在过去两周,落后分数。对于循环构建者来说,这完全改变了计算方式,因为开源模型是唯一一个没有人能从你下面弃用的循环引擎。

简要介绍,日期和许可证已核实:

  • Kimi K3 来自 Moonshot,现在是头条新闻。2026 年 7 月 16 日发布,拥有 2.8 万亿参数,成为首个突破独立指数前沿区间的开源模型:在 Artificial Analysis(v4.1)上获得 57.1 分,总体排名第四,仅次于 Fable 5、GPT-5.6 Sol Max 等已公布分数。它还在 Arena.ai 的盲评 Frontend Code Arena 中夺得第一名,领先于 Fable 5。完整权重计划于 2026 年 7 月 27 日在 HuggingFace 上以修改版 MIT 许可证发布,这将使其成为该类别中首个可下载的模型;截至 7 月 24 日,权重尚未发布,因此这一声明应视为计划而非已完成的。Moonshot 的旗舰演示是纯粹的循环剧场:连续 48 小时的自主运行,设计一个功能型小芯片,作为单个 Agent 在百万 Token 上下文中运行。另一个重要的数字,来自同一独立评估:K3 在事实敏感任务上的实测幻觉率上升至约 51%,高于其前代的 39%,即使事实准确性有所提高。正确的答案更好了,但更不知道何时出错。记住这一点,第三部分会用到。
  • Qwen3.8-Max 来自阿里巴巴,于 2026 年 7 月 19 日在世界人工智能大会上预览:声称是 2.4 万亿参数的多模态模型,是 Qwen 团队首个超过万亿参数的模型,自称“仅次于 Fable 5”,并承诺即将开源权重。预览已上线;但基准表、模型卡、许可证和权重尚未发布,因此在它们落地之前,所有声明都只能视为厂商预览。
  • DeepSeek V4(2026 年 4 月 24 日,MIT 许可证)按 OpenRouter 的说法 是首个被团队投入实际 Agent 流程中作为可行前沿替代品的开源模型。Pro 变体在 SWE-bench Verified 上以 80.6% 的得分领先于开源权重编码 Agent 图表;Flash 变体保留了几乎所有性能,而价格仅需几美分。
  • GLM-5.2 来自 Z.ai(2026 年 6 月中旬,MIT,753B 混合专家模型)是 K3 到来之前的开源权重质量领导者,被 OpenRouter 描述为最接近 Opus 风格规划和长周期编码的开源替代品。已知缺点:它思考成本高,消耗大量输出 Token。
  • MiniMax M3(2026 年 6 月 1 日,修改版 MIT)是开源多模态赛道:原生图像和视频理解,支持百万 Token 上下文,当你的循环需要读取截图或检查 UI 状态时,这一点至关重要。
  • NVIDIA Nemotron 3 Ultra 是美国最强的开源权重参与者,差异化在于部署和 NVIDIA 堆栈,而非峰值分数。
  • Also on the board: Thinking Machines Lab,Mira Murati 的公司,于 2026 年 7 月 15 日发布了其首个模型 Inkling:一个 975B 参数的开源权重多模态混合专家模型,使用 Apache 2.0 许可证。又一个顶级实验室押注开源权重是切入点的证据。

关键解读:如果你的循环是高流量、对隐私敏感,或者需要超越厂商路线图,那么开源浪潮不再是妥协方案。与闭源前沿的差距现在仅以几点衡量,并且这一差距并未在扩大。

第三部分:真正有效的方法

在研究了七家厂商的文档数周后,惊人的发现是:去掉品牌标签,它们给出的建议如出一辙。当激烈的竞争对手在相同的指引上达成一致时,这几乎就是该领域的地面真相。以下是七条规则,每条都经过多家实验室的交叉验证。

1. 在开始之前定义完成。Anthropic 的 /goal 存在是为了让评估者可以检查明确的条件;OpenAI 的指南要求每个运行都有退出条件;Google 将研究限制在 60 分钟内。一个没有清晰停止条件的循环不是自动化,而是燃烧 Token 的订阅。确定性优于感觉:测试通过、数字匹配、清单完成、最大尝试次数 N。

2. 验证器就是产品。 循环的质量上限在于其检查步骤,而非模型。Anthropic 告诉你将验证编码为技能,并让一个拥有全新上下文的 Agent 负责审查。OpenAI 更进一步,将审批者结构化为一个与执行者独立的模型,明确理由是执行者想要完成。Google 将报告基于可点击的引用。本周这一规则得到了迄今为止最好的证据:开源模型中最令人印象深刻的模型在产生正确答案方面显著提升,但同时在知道何时出错方面变得更差。在聊天中,这只是一个脚注。但在未经验证的循环中,它就是一个生产自信错误的工厂。如果你要在一个地方投入一小时,那就投入在“检查”对你的任务意味着什么上。

3. 永远不要让执行者对自己任何重要的事情进行评分。 同样的原则从另一面来看,因为这是整个行业付出代价学到的教训:一个任务完成模型将每个门视为障碍。使用独立的验证器模型、独立的审查 Agent,或者在不可逆步骤上放一个人。

4. 像管理稀缺资源一样管理上下文。Anthropic 的上下文工程指导(最小的高信号 Token 集、笔记文件、返回摘要的子 Agent)、Meta 的主动压缩、Grok 的压缩指导、Kimi 的巨上下文反论:所有人都在回答同一个问题,即如何让长循环保持连贯。共识答案是记忆在窗口之外,加上按需检索,而不是塞满。

5. 仅当上一级失败时才提升循环类型。Anthropic 说从最简单的原语开始。OpenAI 说在转向多 Agent 之前先最大化单个 Agent。Google 要求你在一个小时的运行之前批准一个计划。第一部分的梯子也是一种纪律:按顺序移交检查、停止条件、触发器和提示,一次一级。

6. 为循环定价,而不是为消息定价。 循环的成本是每次循环的成本乘以循环次数,这就是为什么 Google 为每个任务定价研究($1 到 $7),为什么 Grok 以 Token 效率领先,为什么 Anthropic 刚刚通过 Opus 5 将近前沿的循环价格减半,以及为什么每个严肃的堆栈都提供使用检查工具。在开始运行之前,决定一个运行允许花费多少。

7. 在不可逆的关口保留人工。 资金流出、邮件发送、数据删除、代码合并到生产环境。工作模式的审批检查点、协作规划、权限模式,以及 Auto-review 的升级:每个厂商,无一例外,都在不可逆步骤上保留了人工网关。拥有最强大循环的厂商也是对此最坚持的。这应该能说明些问题。

第四部分:没人告诉你的事

发布文章到此为止。运营经验却远不止于此。

循环会放大一切,包括错误。 聊天中的一个错误假设会得到一个糟糕的答案。同一个错误假设在循环中,到早上会变成五十个一致、自信的错误工件。这就是为什么验证是第一条规则,以及为什么无人值守的循环应该先以只读模式启动,直到它们赢得写入权限。

账单会悄悄累积。 每家厂商的指导中都有 Token 管理部分,理由充分。思考密集型模型可能在单个困难步骤上消耗大量输出 Token;当底层事物每天变化一次时,每小时运行一次的例行程序是在为无事可做支付 24 倍的费用。匹配间隔与变化率,限制轮次,并检查仪表。

提示注入在循环中变得更糟。 一旦你的循环读取开放网络、收件箱或用户上传的内容,就要假设有人最终会在该内容中植入指令。一个被欺骗的聊天助手只会让你尴尬一次;一个被欺骗的循环拥有工具访问权限,会在你睡觉时反复执行。OpenAI 自己的安全文档明确了这一点:即使有缓解措施,Agent 也不会完美,仍然可以被欺骗。将循环摄入的所有内容视为数据,而不是指令,并像你认真的那样限定其权限。

演示到生产的差距是真实存在的。 48 小时的自主芯片设计是一个宏伟的演示,也是一个受控的演示。自我报告的效率倍数、私有基准、没有模型卡就宣布的厂商预览参数数量:这些是有用的信号,但没有一个能替代用你自己的任务和你自己的验证器运行循环。每家实验室都暗自同意这一点,这就是为什么它们都告诉你构建评估。

平台在你脚下不断变化。 在这篇文章之前的十二个月里:OpenAI 停止了其独立 Agent 产品,退役了 Pulse,并计划在 2026 年 11 月 30 日关闭其可视化 Agent Builder;一个新的 Opus 一夜之间重新洗牌了 Claude 的计划阵容;API 围绕循环友好的设计进行了重构;甚至 6 月份的一项出口管制指令使许多用户暂时无法使用前沿 Claude 模型。构建你的循环,使逻辑(目标、验证器、笔记)存在于你的文件中,而不是厂商的 UI 中,并且引擎保持可替换。

护城河不是模型。 前沿现在是一个每周重新洗牌的不到三点的差距,并且一个开源模型刚刚加入了它。真正积累的是你自己的东西:从你的失败中构建的评估集,编码你标准的验证器,你的循环积累的笔记。切换模型是一个配置更改。重建一年的验证逻辑则不是。

你的循环堆栈是哪一种?

基于以上所有内容,诚实的匹配如下:

  • 你生活在终端中,想要最大控制权: Claude Code,搭配 Fable 5 用于最困难的运行,以及 Opus 5 作为新的默认价值选择。最清晰的基元(/goal、/schedule、动态工作流)以及最完善的文档化理念。
  • 你想要在每个人都在使用的产品中运行循环: ChatGPT 的 Work 模式加上 Scheduled Tasks(监控任务被严重低估),或者 Codex 加上 Auto-review 用于代码。
  • 你的循环是“彻底调查 X 并给我一份带引用的报告”: 按任务租用 Google 的 Deep Research 或 Deep Research Max,跳过任何构建工作。
  • 你正在编排大量子 Agent 并关注成本: 使用 Muse Spark 1.1 或 Grok 4.5 作为引擎;两者定价合理且正是为此构建,比前沿三巨头低一个级别。
  • 你想要零设置的自动化,放在口袋里: 在你已经使用的聊天应用中,使用 Mira 风格的消费者 Agent。
  • 你需要数量、隐私或持久性: 开源浪潮。DeepSeek V4 Flash 用于成本,GLM-5.2 用于规划质量,MiniMax M3 用于多模态,以及如果你想要前沿级别能力且可以(从 7 月 27 日起,如果权重按计划发布的话)实际下载的 Kimi K3。只要带上一个真正的验证器;K3 自己的数据也支持这一点。

你本周的第一个循环

一个简单的、与厂商无关的步骤:

  1. 选择一个你已经手动重复的任务,并且你是瓶颈。
  2. 先写停止条件。如果你不能写出“完成意味着 X”,那么该任务还没有准备好循环。
  3. 写检查步骤。一个脚本、一个测试、一个用于第二个模型的评分标准。这是最重要的一小时。
  4. 以轮流方式运行几次,观察每个循环。
  5. 移交停止条件(一个带有轮次上限的目标循环)。观察它在哪里停滞或过度;收紧标准。
  6. 然后才移交触发器(安排它),设置预算上限和初始只读权限。
  7. 当它失败时(它一定会失败),将失败转化为一个测试用例。这就是自我改进的部分,而且是你和循环一起完成的。

一次爬一级。那些从这些系统中获得超常结果的人,并没有找到秘密模型。他们找到了一个值得循环的任务,定义了完成,并构建了一个他们信任的检查。

最后一件事

提示词时代训练每个人提出更好的问题。循环时代对你提出了不同的要求:足够精确地定义结果,以便机器在你不在场时也能追求它们,并设计检查来保持这种追求诚实。

这是一项真正的技能,而且不是写提示词。它更接近于管理。一个目标,一个完成的标准,正确的工具,一个预算,一个你信任的检查,以及一个用于判断升级的路径。本文中的每个实验室,从三万亿美元的公司到两人的 Telegram 初创公司,都在趋同于奖励这种技能的机器。

慢速方法仍然有效,如果你希望与这项技术的关系是打字、等待、修复和重新提问的话。但手摇曲柄现在已是可选项,而且实验室们已经共同决定了这条路的方向。工作单元是循环。定义循环的人是你。

从一个开始。定义完成。信任,但验证。然后放手。

来源

以上所有内容均基于截至 2026 年 7 月 25 日那周的一手来源进行核实。按实验室分组:

循环概念

Anthropic

OpenAI

Google

Meta

xAI

Mira

开源权重浪潮

二次创作

使用 YouMind 创作爆款文章

收集素材、拆解爆点、生成视觉资产、撰写内容,并在一个 AI 工作空间里完成分发。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章