三种推理-行动循环的代价权衡
很多人一上来就用 LATS,觉得搜索树最强。但 LATS 每步要展开 N 个分支、评估、回溯,token 消耗是 ReAct 的 10 倍。
ReAct 的循环最朴素:思考 → 行动 → 观察 → 再思考。它是一条直线,错了就错了,不会回头。但对 80% 的任务——查个信息、调个工具、写段代码——这条线就够,简单、便宜、可调试。
Reflexion 在 ReAct 上加了一层:失败后让模型反思哪里错了,把反思写进记忆,下次重试时带着教训。代价是每个失败任务要多跑一轮,但能纠 ReAct 纠不了的错。LATS 更激进:每步展开多个候选行动,用评估函数打分,像下棋一样搜索最优路径——效果最好,但贵且复杂。
选任务复杂度,看 ReAct / Reflexion / LATS 的步数、token 消耗、成功率差距。
一个常见坑:用 LATS 做简单任务,token 烧了 10 倍,成功率只高 2%——性价比极差。反过来用 ReAct 做需要探索的任务,会卡在局部最优反复失败。先判断任务的"分支度":分支少用 ReAct/Reflexion,分支多用 LATS。