跳转至

智能体循环详解:从 ReAct 到循环工程(2026 指南)

原文:Agentic Loops Explained: From ReAct to Loop Engineering (2026 Guide)
作者:Data Science Dojo · 发布时间:2026 年 6 月 9 日


核心要点

  • 智能体循环(Agentic Loop) 就是一个触发器 + 一个可验证的目标。智能体持续运行直到目标达成——无需人类持续输入提示词。
  • 循环工程(Loop Engineering) 是设计这些循环的实践:指定目标、设置触发器、构建防止循环无限运行的护栏。
  • 从 ReAct(2022)到 Ralph 循环和 OpenAI 的 /goal 命令,共有 10 种不同类型的智能体循环。
  • 没有护栏,循环就会失败。无限循环、目标漂移和 token 成本爆炸是常见的生产问题——而不是边缘案例。

引言:向循环的转变

今年早些时候,两位身处 AI 编程核心的人发了帖子,引发了一场至今未停的讨论。

Anthropic 公司 Claude Code 的创建者 Boris Cherny 说:"我不再给 Claude 写提示词了。我让一些循环持续运行,由它们去给 Claude 写提示词并想清楚该做什么。我的工作是写循环。"

OpenClaw 创始人 Peter Steinberger 对他数百万的粉丝说:

每月提醒:你不应该再给编码智能体写提示词了。

你应该设计一些循环,让循环去给智能体写提示词。

Steinberger 的帖子在不到 24 小时内达到了 500 万次浏览。突然之间,开发者们都在问:什么是循环,它为什么重要?

本文回答这两个问题,并逐一分解每种主要的智能体循环类型,以及循环工程在实践中到底涉及什么。

什么是智能体循环?

智能体循环 比听起来简单。它只需要两样东西:

  1. 一个触发器(Trigger): 启动循环的某个事件(PR 被打开、按计划触发、人说"开始")
  2. 一个可验证的目标: 智能体要努力达到的、已定义的最终状态

智能体不会等待你的下一条消息。它启动、运行、检查目标是否已经达成,如果没有就再次循环,直到达成,或者触发停止条件。

你给智能体一个目标,而不是一句提示词。它自己想出步骤、执行步骤、检查工作、然后继续。

这正是它与提示词工程不同的地方。在旧的工作流中,你对智能体写提示词,等它完成,再写下一句。循环工程的目标是减少你的参与。

确定性目标很容易:所有测试通过、CI 绿灯、函数无错误运行。困难在于当目标是"构建这个功能"这类时——定义"完成"到底是什么,需要预先写一份完整规格说明。这正是让循环工程既难又有价值的地方。

要理解什么让循环在模型层面变得可行,先理解 什么是智能体 LLM 以及它们与标准语言模型的区别会很有帮助。

循环 vs 自动化:有什么区别?

有必要澄清,因为这两者很容易混淆。

自动化 执行一系列步骤。运行一个脚本,按配方操作。它不做任何决策。

循环 内部包含决策过程。智能体在主动判断是否已经达到目标。它不只是执行——它在评估、循环、并根据发现调整方向。

三种触发器类型

每个智能体循环都由一个触发器启动,只有三种类型:

  • 基于事件(Event-based)——有事发生:PR 被打开、文件发生变化、API 调用完成
  • 基于计划(Scheduled)——定时任务触发:每 30 分钟、每小时、每天
  • 人触发(Human-initiated)——你输入一个目标,然后说"开始"

Claude Code 的 /loop 命令是"人触发"类型的最简单形式:/loop every 5 minutes, compare what we have built with our full spec and continue building until we complete it——每 5 分钟循环一次,将我们已构建的内容与完整规格说明对比,持续构建直到完成。


智能体循环内部如何运作

每个智能体循环都经历五个阶段,反复执行直到满足停止条件。

1. 感知(Perceive)——接收输入:用户目标、工具结果、API 响应,或上一次操作的错误。

2. 推理(Reason)——思考输入意味着什么、它已知什么、还缺什么,以及有哪些选择。

3. 规划(Plan)——选择下一步做什么。简单的循环选一个步骤。复杂的架构则生成完整的任务拆解。

4. 行动(Act)——执行:调用工具、写入文件、运行代码、查询数据库,或协调其他智能体。

5. 观察(Observe)——接收结果并更新理解。成功则前进。失败则触发对原因的推理。

然后回到步骤 1,继续循环。

这种结构直接对应强化学习(Reinforcement Learning)。一个循环需要一个可验证的奖励信号——也就是知道目标何时已达成。这个奖励可以是确定性的(测试通过、无类型错误),也可以是非确定性的(由另一个 LLM 评估输出是否满足目标)。

循环何时停止?

LLM 没有内置的"完成"概念。没有显式的停止条件,循环会一直运行直到钱烧光。

每个生产级智能体循环都需要:

  • 硬迭代上限(Hard iteration cap)
  • 每次运行的 token 和成本预算(Token and cost budget)
  • 无进展检测(No-progress detection)——跨迭代没有变化就退出
  • 对照可验证标准进行目标达成检查(Goal-achievement check)
  • 任务级和单个工具调用级的超时(Timeouts)

"让智能体自己决定什么时候完成"的策略,可能会在你反应过来之前就把 token 额度耗尽。下面介绍的每种循环类型,在某种程度上都是为了解决这个问题而构建的。


每种智能体循环详解

第一代:概念验证(2023)

AutoGPT

2023 年 3 月 30 日发布。第一个将循环概念推到数百万开发者面前的工具。

工作原理:

  • 给 GPT-4 一个高层目标
  • 它将目标拆解为子任务
  • 用工具执行:网页浏览、文件管理
  • 反思结果并循环

AutoGPT 在几个月内获得了 10 万 GitHub Star。它证明了需求的真实性。

然而,AutoGPT 并没有被普通用户广泛采用,因为它昂贵且不可靠。用户抱怨它经常陷入无限循环,并产生巨额 API 账单。

虽然这个开源概念为现代循环铺平了道路,但它更像是一个迷人的技术实验,而非可靠的生产力工具。

第二代:学术框架(2022-2023)

ReAct

2022 年 10 月 6 日发布——比 AutoGPT 早五个月。来自普林斯顿大学和 Google Research。

ReAct 代表 推理(Reasoning)+ 行动(Acting)。在每一步,智能体产生两样东西:

  • 一段推理追踪(Reasoning trace):"在调用这个端点之前,我需要检查 API 速率限制"
  • 一个具体行动:实际发出的工具调用或搜索请求

每次行动的观察结果输入到下一步推理中。当返回的结果出乎意料时,智能体可以推理"为什么",而不是盲目重试。

结果: 在 ALFWorld 上比纯行动方案提升 34%,在 WebShop 上提升 10%。

ReAct 是 LangChain 的 AgentExecutor 和大多数生产级编码智能体内部的模式。它是任何循环工程工作的默认起点。

Reflexion

NeurIPS 2023。ReAct 加上一个自我评估层。

在完成或失败一个任务后,智能体生成一篇关于哪里出了问题的批判分析。这份批判存储在记忆中,并在下一次尝试时注入上下文。

  • 比 ReAct 更贵(额外的 LLM 调用用于反思)
  • 在试错任务上表现更好:调试、不熟悉的代码库、创造性问题解决
  • 对于直接的检索任务,通常不值得额外开销

ReAct 是基础。Reflexion 在之上构建了一个学习层。

Plan-and-Execute(规划-执行)

将思考与执行分离。

  • 规划器(Planner) 预先生成完整的任务拆解
  • 执行器(Executor) 逐步执行每个步骤
  • 重新规划器(Re-planner) 在执行偏离计划时进行调整

LangChain 的 LLMCompiler 通过并行运行独立的步骤,比顺序 ReAct 快了 3.6 倍(Kim 等人,ICML 2024)。

权衡: 当早期步骤产生意外结果时,适应性较差。Plan-and-Execute 提交给一个计划。ReAct 在每一步都重新校准。

第三代:架构模式(2024)

OODA 循环

来自美国空军上校 John Boyd:观察 → 定向 → 决策 → 行动(Observe, Orient, Decide, Act)。

其独特的贡献在于 定向(Orient) 步骤。大多数循环直接从观察跳到决策。OODA 先插入一个情境化步骤——智能体将原始观察对照其目标、约束和先验知识进行处理,然后再做决策。

对于处于复杂、快速变化环境中的智能体,这个额外的步骤能可衡量地提升决策质量。

内/外双层循环(Inner/Outer Dual Loop)

微软的 Magentic-One 架构。

  • 外层循环:战略规划,对照原始目标监控进展
  • 内层循环:在当前策略内逐步执行

当内层循环停滞时,外层循环重置整个策略——而不仅仅是重试当前步骤。这防止了"固执失败"模式:智能体因为没有后退一步的机制而反复重复一种失效的路径。

多智能体编排(Multi-Agent Orchestration)

一个监督者(Supervisor)将工作分配给专门的子智能体:规划器、执行器、研究者、验证器。监督者负责协调,而非亲自执行。

数据:

  • Anthropic 的多智能体研究系统在内部评估中比单智能体高出 90.2%
  • 单智能体消耗的 token 约是标准聊天的 4 倍
  • 多智能体系统消耗约 15 倍

OpenAI Agents SDK 是当下构建这种编排层最易上手的框架之一。

多智能体适用于需要并行探索或真正超出单一上下文窗口的复杂任务。对大多数任务来说大材小用,且成本必须能合理证明。

第四代:实践者循环工程(2025-2026)

Ralph 循环(Ralph Wiggum 技术)

来源:Dhanush Kumar

由 Geoffrey Huntley 于 2025 年 7 月发明。以《辛普森一家》中一边喊着"I'm helping!"一边撞门框的角色命名。设计刻意简单,效果出奇有效。

工作原理:

  • 一个编码智能体在一个无限的 shell 循环内运行
  • 每次迭代从磁盘读取同一个 Prompt 文件
  • 智能体修改代码库后退出
  • 循环以全新的上下文窗口重新启动
  • 状态存在文件系统中——代码库、TODO 文件、Git 历史

它解决了两个问题:

  1. 上下文溢出——长会话会随着上下文窗口填满而退化。Ralph 循环每次迭代重置上下文;新会话从磁盘读取当前状态。
  2. 过早退出——LLM 在主观看完任务是否完成时就停止。停止钩子(Stop Hook)拦截退出尝试,检查完成条件是否真正满足(测试通过、覆盖率达标、类型检查干净),如果不满足则重新注入任务 Prompt。

它在一次黑客马拉松中发布,但在不到六个月的时间里迅速成为标准模式。

/goal 命令(OpenAI Codex CLI)和 /loop(Claude Code)

两个直接内置于 AI 编码工具中的持久化循环工程原生实现。

Claude Code 的 /goal 于 2026 年 5 月 12 日在 v2.1.139 版本中发布。你设定一个完成条件,Claude 跨多个轮次自主工作,直到条件满足——途中追踪已用时间、轮次和 token。支持交互模式、-p 标志和远程控制。早期采用者称其为"2026 年最被低估的 AI 功能",因为它完全消除了多步骤任务中的手动迭代循环。核心机制:一个独立的评估模型在每轮结束时检查目标条件是否满足,只有通过时才停止循环。

Codex CLI 的 /goal(v0.128.0):同样的概念,Codex 端的实现。设置一个可跨会话中断持续存在的持久目标。默认关闭——需要编辑 TOML 配置文件来启用。在一项有记录的实验中:不间断运行 25 小时,消耗 1300 万 token,生成 3 万行代码。

两者都要求预先明确指定目标。目标越抽象,循环就越昂贵、越不可预测。

Boris Cherny 的并行循环工作流

这个工作流让循环工程进入了主流开发者观众的视野。

配置:

  • 终端中 5 个 Claude Code 实例,按标签页编号
  • 浏览器中同时运行 5-10 个 Claude 会话
  • 系统通知仅在智能体需要输入时提醒你查看
  • 一个"传送"命令用于在本地和云端之间传递上下文
  • CLAUDE.md 作为每个新会话启动时读取的持久指令层

CLAUDE.md 的实践是核心洞见。智能体犯的每一个错误,修正都会写入 CLAUDE.md。未来的会话不会重复这个错误。该文件成为项目知识的累积记录,可以在上下文重置后保留。


智能体循环中的记忆

记忆是将一个会学习的循环与一个只会重复的循环区分开来的要素。没有记忆,每次迭代都从零开始。

生产环境中使用的四种记忆类型:

  • 情节记忆(Episodic memory)——先前操作和结果的记录。智能体回忆起某个特定方法曾失败过,并避免重复。
  • 语义记忆(Semantic memory)——结构化领域知识:架构决策、命名约定、API 文档。
  • 向量记忆(Vector memory)——基于相似度的检索。即使原始存储方式与检索请求方式不同,也能找到相关上下文。
  • 基于文件的记忆(File-based memory)——Ralph 循环的方法。状态存在于文件系统中。对于编码任务,比向量存储更简单、更可靠。

CLAUDE.md 是人工策划的语义记忆。比自动生成的记忆更可靠,因为由人来决定放什么内容进去。

关于智能体系统中的记忆架构,大行动模型详解(Large Action Models Explained) 深入探讨了记忆如何支撑长周期任务。

智能体循环也直接关联到 RAG。当循环在执行过程中动态检索外部知识时,它运行的正是智能体式 RAG(Agentic RAG)模式——动态决定何时以及检索什么,而不是预先一次性检索。

失败模式

这些都会在生产中出现,无一例外。

失败模式 说明
无限循环 没有客观的目标验证。智能体总能找到可以优化的地方,于是不断优化。AutoGPT 2023 年的事故就是典型案例。
目标漂移 智能体追求相关的但不同的目标。由模糊的规格说明或工具结果将其引偏导致。
上下文溢出 长会话填满上下文窗口,推理能力退化。Ralph 循环正是为解决这个问题而存在。
静默失败 智能体输出自信却没有真正进展。工具调用在发生,但实际什么都没改变。最难捕获。
Token 成本爆炸 单智能体约标准聊天的 4 倍,多智能体约 15 倍。Steinberger 承认曾达到月均 130 万美元的 token 支出。一个记录的循环事故:智能体在五分钟内调用了一个损坏的工具 400 次。
错误传播 循环初期的一个错误决策在每个后续步骤中复利。要在每个阶段验证,而非只在最后。

循环工程:护栏

循环工程与只是让循环跑起来的区别在于:循环工程包含护栏。这些不是可选项。

  • 硬迭代上限——最大循环次数,达到后智能体必须停止并报告当前状态
  • Token 和成本预算——每次运行的硬性支出上限,从第一天就内建
  • 无进展检测——如果输出状态在多个迭代中没有变化就退出
  • 熔断器——工具调用重试上限,在设定次数的尝试后进行清晰的失败报告
  • 终止条件——在循环启动前就用可验证的自动化检查(而非智能体自我评估)定义"完成"的含义
  • 人机交互检查点——不可逆操作前的强制性审查:数据库写入、部署、对外 API 调用

目标不是消除自主性,而是为自主性设定边界。

智能体 OS 架构文章(Agentic OS Architecture) 更深入地探讨了生产系统如何在基础设施层面处理故障检测和重新规划。

选择合适的循环

从最简单能工作的循环开始。只有在能量化改进时才增加复杂性。

任务 推荐循环
带重试的单步工具使用 ReAct
需要自我纠正的多步骤任务 ReAct + Reflexion
长时间代码库重构或构建 Ralph 循环 或 /goal
并行独立的研究线程 多智能体编排
具有已知依赖关系的复杂规划 Plan-and-Execute
快速变化的环境 OODA
策略可能需要完全重置 内/外双层循环

一个带四种工具的单一 ReAct 智能体能处理绝大多数真实世界任务。多智能体系统每次会话的成本约 15 倍。这个成本需要通过产出来证明合理。

现在人人都适合循环工程吗?

诚实的回答:不是。

循环工程确实强大,但 token 成本是真实的。单智能体消耗的 token 约是标准聊天的 4 倍。多智能体系统约 15 倍。像 Cherny 和 Steinberger 那样跨多个会话运行并行循环,需要只有少数公司目前才向工程师无限提供的 token 预算。

Cherny 和 Steinberger 都在公司工作——分别是 Anthropic 和 OpenAI——在那里预算实际上并不构成约束。这正是这些工作流得以开发和优化的环境。

成本是真实的。技术是真实的。这两个事实之间的差距,就是大多数开发者目前所处的位置。

这个差距会缩小。计算资源的历史一直如此。今天花一大笔钱的东西,几年后就会成为日常基础设施。即使在你当前的规模下经济上还不划算,循环工程也值得现在开始了解。

接下来会发生什么

  • Agent 框架(Agent harnesses) 正在成为主要的开发者工具——编排逻辑、记忆管理、成本控制和可观测性,使循环工程在大规模下可靠运行
  • 可审计性 随着循环在更长时间维度上采取重要操作,正变得不容妥协
  • 自优化循环——追踪自身 token 使用并调整方法的循环,正从实验阶段走向生产
  • 人的角色 正在转变:写代码 → 写提示词 → 设计循环 → 构建运行循环的工厂

人类最终是否会被完全移出循环,仍是一个悬而未决的问题。目前,人类仍然不可或缺。但方向已经很明确。

现在走在前面的开发者,不是那些在写更好提示词的人。而是那些在学习循环工程的人。

常见问题(FAQ)

什么是智能体循环? 智能体循环是一个 AI 智能体的运行循环,它具有一个触发器和一个可验证的目标。智能体启动,朝目标努力,检查目标是否已达成,循环直到达成——而无需每一步都等待新的提示词。

什么是循环工程? 循环工程是设计、指定和维护智能体循环的实践。它包括定义可验证的目标、选择合适的触发类型、选择合适的循环架构,以及构建防止成本失控和无限循环的护栏。

智能体循环与自动化有什么区别? 自动化执行的是一系列步骤。循环内部包含决策过程——智能体主动评估目标是否已达成,并基于这个评估决定是否继续循环。关键区别在于目标验证这一步。

我应该从哪种循环类型开始? ReAct。它是适用性最广、文档最完善、也是大多数生产框架构建的基础。只有在 ReAct 触及明确极限时才增加复杂性。

为什么智能体循环会在生产中失败? 大多数失败可以追溯到四个原因:没有硬性停止条件、目标定义不明确、长会话中的上下文溢出,以及缺少成本控制。

循环工程贵吗? 是的,很贵。单智能体消耗约标准聊天 4 倍的 token,多智能体约 15 倍。像先驱工程师那样大规模运行并行循环,可能达到每月七位数的 token 账单。随着技术成熟,成本预计会下降,但目前成本是真实的。

智能体式 RAG 与智能体循环有什么关系? 智能体式 RAG 是一种将检索嵌入推理循环中的循环模式——智能体根据循环中段的发现,动态决定何时检索、检索什么,而不是预先一次性检索。

结语

转变已经在进行中了。提示词是这个时代 AI 交互最初几年的单元。循环工程正在取代它。

从 ReAct 开始。需要自我纠正时加入 Reflexion。当长时间任务触及上下文限制时使用 Ralph 循环或 /goal。在开始之前清晰地定义你的目标。在增加复杂性之前先建造护栏。

目前从智能体 AI 中获得最大收益的开发者,不是那些编写巧妙提示词的人。而是那些构建良好边界循环、可靠完成任务的——在循环工程成为主流之前就学习它的人。


参考来源

# 引用 链接
1 ReAct: Synergizing Reasoning and Acting in Language Models (2022) arxiv.org
2 Ralph Loop — GitHub github.com
3 AutoGPT github.com
4 OpenAI Agents SDK datasciencedojo.com
5 Large Action Models Explained datasciencedojo.com
6 Agentic RAG datasciencedojo.com
7 Agentic OS Architecture datasciencedojo.com