3.3 推理增强技术对比选型 本节摘要:提示工程从最朴素的直接问,到 CoT、自洽采样、思维树、ReAct(推理加行动),技术谱系越来越丰富,但每种都有适用边界和代价。本节把这些技术放在一起横向对比,按"任务复杂度"和"成本预算"两个维度给出一套选型决策框架,帮你在准确率、延迟、成本三角里找到适合自己业务的平衡点。 你能学到什么 阅读完本节,你应当能够: 在一张对比表里说清五种推理增强技术各自的原理、效果、代价 根据任务复杂度选择合适的推理增强策略 在准确率、延迟、成本之间做出有意识的工程权衡 判断什么时候该停止在提示层面优化、转向微调或换模型 一、问题与直觉 前两节我们讲了提示的基础范式和 CoT、自洽采样。
本节摘要:提示工程从最朴素的直接问,到 CoT、自洽采样、思维树、ReAct(推理加行动),技术谱系越来越丰富,但每种都有适用边界和代价。本节把这些技术放在一起横向对比,按"任务复杂度"和"成本预算"两个维度给出一套选型决策框架,帮你在准确率、延迟、成本三角里找到适合自己业务的平衡点。
阅读完本节,你应当能够:
前两节我们讲了提示的基础范式和 CoT、自洽采样。但实际工作中你可能还会听到思维树(Tree of Thoughts)、ReAct、反思(Reflection)这些更花哨的技术名词。每篇论文都宣称自己效果更好,但真到线上用,是不是越复杂的技术越好?
显然不是。技术越复杂,通常代价也越高——调用次数更多、延迟更长、实现更难维护。一个朴素的 CoT 可能用 10% 的成本拿到 80% 的效果提升,而思维树可能再多花 5 倍成本只再提 5%。工程上要的是性价比,不是论文里的 SOTA(最优)数字。
这一节的目的就是把这张"效果-成本"账算清楚。我们把主流的推理增强技术排在一起,看它们各自在什么复杂度段位最划算,以及什么时候该停下来换思路。
把前面讲过和没讲过的推理增强技术排成一个谱系,按复杂度递增:
| 技术 | 核心做法 | 效果 | 成本 | 适合任务复杂度 |
|---|---|---|---|---|
| 直接问(zero-shot) | 直接给指令要答案 | 基准 | 1x | 低(单步事实/格式) |
| 少样本 | 给几个示范 | 略升 | 1x(提示长一点) | 低到中 |
| CoT | 让模型一步步思考 | 显著升 | 1x(输出长一点) | 中到高(多步推理) |
| 自洽采样 | 多次 CoT 加投票 | 再升一档 | 5-20x(多次调用) | 高(关键决策) |
| 思维树 | 探索多条推理路径并评估剪枝 | 极高(复杂任务) | 10-100x | 极高(规划、搜索) |
| ReAct | 推理与工具调用交替 | 高(需外部信息时) | 数x(多次调用工具) | 中高(需查资料/算数) |
效果和成本基本同步上升,但边际收益递减——从直接问到 CoT 是质的飞跃,从自洽采样到思维树的提升就小得多,而成本却指数级涨。
前面讲过 CoT 和自洽采样,这里补上思维树和 ReAct 的原理。
思维树(Tree of Thoughts,ToT) 把 CoT 的"一条链"扩展成"一棵树"。CoT 是线性推理(一步接一步),ToT 在每个推理节点生成多个分支(多种可能的下一步),用一个评估器给每个分支打分,剪掉差的、保留好的,像下棋搜索一样往前推进。它适合解空间巨大、需要回溯的复杂任务(如数学证明、创意规划、博弈),但实现复杂、成本极高。
ReAct(Reasoning and Acting) 让模型在推理和行动之间交替——思考一步、调一个工具(如搜索、计算器、查数据库)、拿到结果、再思考下一步。它解决了"模型不知道的事实怎么办"——边想边查。ReAct 常和 RAG 配合(工具就是检索),是 Agent(智能体)的基础范式。它的循环过程是这样的:
下面这张图把五种技术的效果提升和成本增长画在一起,直观显示边际收益递减的规律——这是选型的核心依据。

这张图的核心信息在"甜点区"——CoT 是性价比最高的跃升点,再往上每多花的钱换来的提升越来越小。多数业务场景,停在 CoT 或自洽采样就够了,思维树只在极少数高价值复杂任务上才划算。
ReAct 和 CoT 都涉及"推理",但侧重不同。CoT 是纯推理(模型只在脑子里/文本里想),ReAct 是推理加行动(边想边调外部工具)。它们的适用场景截然分开:
强行用 CoT 处理需要外部信息的任务,模型会幻觉(编一个答案);强行用 ReAct 处理纯推理任务,会多此一举地调工具、增加延迟。区分关键看"模型缺不缺信息"。
把选型浓缩成一套决策框架:
| 任务特征 | 推荐策略 | 理由 |
|---|---|---|
| 单步事实、格式转换 | 直接问或少样本 | CoT 多余,徒增延迟 |
| 多步推理、数学逻辑 | CoT | 性价比最高的跃升 |
| 关键决策、对准确率极敏感 | CoT + 自洽采样 | 用算力换可靠 |
| 需要外部信息/计算 | ReAct | 边推理边查工具 |
| 巨大解空间、需回溯的规划 | 思维树 | 极少用,成本极高 |
💡 关键直觉:选型永远从最简单的开始试。先用直接问跑基线,不够加少样本,还不够加 CoT,再不够才上自洽采样或 ReAct。每升一级都要量化评估"提升多少、代价多少",别跳跃式升级。我见过太多团队一上来就上思维树,结果成本爆炸效果还不如朴素 CoT。
工程上选型本质是在三个目标间权衡:
准确率(效果) /\ / \ / \ / 甜点 \ / 区 \ /__________\ 延迟 成本
三个目标互相牵制,没有全占的方案。选型的关键是先确定哪个目标是硬约束——如果是实时对话,延迟是硬约束,那再想要准确率也不能上自洽采样;如果是离线数据分析,成本不是问题,可以放心上自洽采样甚至思维树。
一个法律咨询机器人的选型过程值得参考。它的任务特征是:需要查法条(外部信息)+ 多步推理(法条怎么适用到具体案情)。团队一开始想用思维树追求最高准确率,但实测发现:思维树在法条检索这一步不稳定(多次采样检索结果不一致),反而拉低了效果;而且延迟高达 30 秒,用户根本等不了。
最后的选择是 ReAct 加 CoT:ReAct 负责查法条(一次检索就够,稳定),CoT 负责基于法条做多步推理(单次调用,延迟可控)。整体延迟降到 5 秒,准确率反而比思维树高(因为避开了多次检索的不一致)。这个案例说明,不是越复杂越好,而是越匹配任务结构越好。
提示优化有天花板。出现下面这些信号,说明该停止调提示、换思路了:
⚠️ 常见坑:在提示层面死磕太久。提示工程的回报是递减的——前 20% 的努力拿到 80% 的收益,后 80% 的努力只拿 20%。当你发现改提示的边际收益已经很小时,果断判断瓶颈是知识(上 RAG)、是行为(上微调)、还是能力(换模型),别在提示里打转。
实际系统里,这些技术常组合使用。几个典型组合:
组合时注意别过度叠加——每加一层都有延迟和成本代价,要量化评估每层的贡献。
讲一个我见过的真实案例,说明"技术越复杂越好"是个陷阱。一个做金融研报分析的团队,任务是从财报里提取关键指标做趋势判断。团队读了几篇论文后,决定上思维树加自洽采样加 ReAct 的组合,追求最高准确率。
结果上线后一塌糊涂。思维树在每步生成多个分支并评估,对一篇研报要调用模型几十次,单次分析耗时几分钟,用户根本等不了。自洽采样叠加进来后成本翻了几十倍,月账单爆炸。更糟的是,因为研报里的数据是精确数字,多次采样的推理路径经常得出略有不同的数字,多数表决反而选了个折中的错误值。
后来他们回归朴素方案:RAG 检索相关段落加 CoT 让模型一步步算,遇到精确计算调一次计算器工具(轻量版 ReAct,只调计算不调别的)。准确率比那套复杂组合还高(因为避开了多次采样的数字漂移),延迟从几分钟降到十几秒,成本降了一个数量级。这个案例的教训是:技术的复杂度要匹配任务的实际难度,过犹不及。金融指标提取本质是个"检索加计算"的任务,用最对症的 RAG 加 CoT 加计算器就够了,硬上思维树是把简单问题复杂化。
💡 关键直觉:选型的反面不是"选错技术",而是"过度选型"。看到一篇论文说某技术效果好就盲目上,不考虑自己任务的匹配度和代价,是工程上的大忌。永远从最简方案起步,用 bad case 驱动升级,每一步都问"这一层带来的提升,值它增加的延迟和成本吗"。
入门:对同一批多步推理题,分别用直接问、CoT、自洽采样三种方式跑,记录准确率和平均延迟,体会"效果-成本"权衡。
进阶:找一个需要外部信息的任务(如查实时数据再推理),实现一个简单的 ReAct——让模型推理一步、调一次检索、再推理,对比它和纯 CoT 的效果差距。
挑战:为你的业务画一张"准确率-延迟-成本"三角的约束图,确定哪个是硬约束,据此选出推理增强策略,并量化评估性价比。
第三章收尾。我们讲清了不动模型也能提升效果的提示工程。下一章把前面的能力扩展到多模态和对话系统——怎么让模型看懂图片、怎么构建多轮对话。