跳到主要内容
Cowers://
全部文章
推理范式

Agent 推理范式总览

这四个不是互斥的 Agent 架构,而是四种可组合的 Reasoning / Agent Design Pattern。它们的划分维度是:控制流管在哪一层。

Agent 推理范式总览

阅读提示 这是 Plan-and-Execute / Reflexion / Self-Ask / ToT 四篇笔记的索引与横向对照页。 想看某个范式的完整机制和坑,点进对应笔记;想快速回忆区别,看本页表格。

核心概念 这四个不是互斥的 Agent 架构,而是四种可组合的 Reasoning / Agent Design Pattern。它们的划分维度是:控制流管在哪一层

一、四者速查

概念 核心思想 管哪一层 适合场景
Plan-and-Execute 先制定计划,再逐步执行 任务序列 长任务、多步骤工程任务
Reflexion 执行后反思错误,再改进重试 失败回路 需要自我纠错的 Agent
Self-Ask 不断向自己提出子问题,逐个回答 问题分解 多跳推理、知识问答
ToT 同时探索多条思路,选择更好的分支 候选搜索 复杂推理、搜索型问题

二、放在同一个任务里理解

Plan-and-Execute   先决定:我要做哪些事情
Self-Ask           遇到问题:我还需要回答哪些子问题
ToT                遇到难题:有哪些不同思路可以尝试
Reflexion          做完发现错了:刚才哪里出了问题

一个高级 Agent 可能同时用上四种:

Agent 推理范式组合流程

读图顺序:自上而下是一次任务的正向流程,右侧橙色虚线是 Reflexion 的经验回流——它把失败教训送回 Planner,触发重新规划。左侧标注的是每一层各自控制什么。

三、怎么选:三个判断问题

💡 选型决策 问自己缺的是什么:

你缺的是 用哪个
步骤(不知道要做哪几件事) Plan-and-Execute
信息(知道要做什么,但事实不够) Self-Ask(+ 检索)
思路(有信息,但不知道哪条路对) ToT
修正(做完了但结果不对) Reflexion

这四个问题彼此独立,所以四个范式可以叠加使用,不用二选一。

四、共同的工程前提

四篇笔记里反复出现同一个主题,值得单独记住:

⚠️ 信号的质量决定范式的上限

  • Plan-and-Execute 靠执行观察决定要不要推翻旧计划 → 观察不到真实结果,重规划就是瞎改
  • Reflexion 靠 Evaluator 给出的反馈驱动 Self-Reflection 写出有用的反思 → Evaluator 只说「错了」,反思就只能写「下次注意」
  • Self-Ask 靠检索/来源校验中间答案 → 不校验就会错误放大
  • ToT 靠 Evaluator 决定剪谁 → 未校准的打分等于随机剪枝

优先接确定性信号(测试、编译器、检索结果、规则校验),少让 LLM 给自己打分。

注意 Reflexion 那一行的分工:Evaluator 负责评价并给出反馈,Self-Reflection 才负责把反馈写成语言化的教训,两者是不同组件,别合成一个(详见 Reflexion 反思式自我纠错)。

另外,「四个范式都是反馈循环」这个概括并不成立——只有 Reflexion 和 Plan-and-Execute 里的重规划算真正的反馈回路;Self-Ask 是串行分解,ToT 是搜索,它们中间那一步是评估或检索,不构成「拿结果去修正上一次产出」的闭环。四者共同依赖的是信号质量,不是共用同一种控制结构。

五、复习重点

复习重点

  1. 四者不互斥,是可组合的设计模式,划分维度是控制流管在哪一层
  2. 记忆口诀:缺步骤→Plan,缺信息→Self-Ask,缺思路→ToT,缺修正→Reflexion。
  3. 串行 vs 并行:Self-Ask 是串行拆解(一条路往前推),ToT 是铺开多条候选再选优(结构上并行,工程上不必并发)。
  4. 四者共同的命门是信号质量,确定性信号永远优先于 LLM 自评。但别把四者都概括成「反馈循环」——只有 Reflexion 和重规划是闭环,Self-Ask 是分解、ToT 是搜索。
  5. Reflexion 的三个角色别混:Actor(执行)、Evaluator(评价并给反馈)、Self-Reflection(把反馈写成语言教训)。

四篇详细笔记:Plan-and-Execute 先规划再执行Reflexion 反思式自我纠错Self-Ask 自问自答多跳推理ToT 思维树