4.1 ReAct 原理:Reasoning + Acting 的循环结构 ReAct 这个名字本身点明了一切:Reasoning + Acting,推理加行动。它不是新发明一个算法,而是把两件原本分开的事——「想」和「做」——拧成一股绳,让它们在每一步里交替进行。这个交替的循环,就是 LLM Agent 的运转内核。 4.1.1 从「纯推理」和「纯行动」说起 在 ReAct 之前,LLM 有两种典型的使用方式,各有明显短板: 方式一:纯推理(Reasoning Only) LLM 只在内部推理(如 CoT),不调用任何工具。 短板:信息受限——LLM 只能用训练时的知识,不知道当下、查不到外部数据。这就是第 1.1 节讲的「知识截止」。