源文件:book/introduction.md 引言 {.unnumbered} 2025 年 8 月至 10 月,我在图灵《AI Agent 实战营》上进行了一系列技术讲座。讲座的初衷很简单:把 AI Agent 的设计从 “感觉驱动” 变成 “原则驱动”:不只是教大家跑通一个 Demo,而是深入理解 Agent 为什么要这样设计,每一个架构决策背后的取舍是什么。这本书正是从那些讲座的讲稿和实验中整理、扩展而来的。 值得一提的是,这本书从最初的想法到最终成书,本身就是用一种可以称为 whisper coding(口述式协作)的方式做出来的——而我用来口述的,正是我们 Pine 自己的语音 Agent。
源文件:book/introduction.md
2025 年 8 月至 10 月,我在图灵《AI Agent 实战营》上进行了一系列技术讲座。讲座的初衷很简单:把 AI Agent 的设计从 “感觉驱动” 变成 “原则驱动”:不只是教大家跑通一个 Demo,而是深入理解 Agent 为什么要这样设计,每一个架构决策背后的取舍是什么。这本书正是从那些讲座的讲稿和实验中整理、扩展而来的。
值得一提的是,这本书从最初的想法到最终成书,本身就是用一种可以称为 whisper coding(口述式协作)的方式做出来的——而我用来口述的,正是我们 Pine 自己的语音 Agent。每次准备讲稿,我都会先向它口述一个大致的提纲,让它去做调研(survey),再由它整理出一份初稿;讲完课后,我再结合 AI Agent 实战营里同学们的反馈,与它反复讨论、打磨,如此迭代,最终把这些讲稿扩写、编排成了今天这本书。整个过程里,我多数时候并不打字,而是把想法口述给它——语音的带宽远高于打字(正常说话的速度约为打字的四倍),“口述—调研—讨论—修改”的循环因此转得很快。某种意义上,这本书既是在讲 Agent,也是一件由 Agent 参与做成的作品。
从 2025 年初 DeepSeek R1 发布至今,AI 领域已经从单纯的基座模型(即通用的大语言模型底座)演进,进入了工程落地的深水区。模型层的进展可以从两个方向看到:一方面,模型通过在智能体环境中的强化学习(Agentic Reinforcement Learning)把工具调用能力训进了模型参数,使模型掌握了在编程(coding)、数学、图形界面操作(computer use)等领域的通用能力。模型的迭代速度也越来越快,GPT-5.2 到 GPT-5.5、Claude Opus 4.5 到 4.8,都仅仅经过了半年。产品层则有 Manus、Claude Code、OpenClaw 等通用 Agent 重新定义了人机交互方式,把 “代码生成 + 文件系统” 这一架构范式推到了主流视野。
当我回头审视近一年前在课程中总结的那些 Agent 架构设计原则时,有一个发现让我既欣慰又惊讶:这些原则非但没有过时,反而变得越来越经典了。 虽然 Agent 业界后来陆续出现了 Skill、harness、loop engineering 等新名词,但真实的顺序恰恰是反的:并不是 Anthropic 这些公司先发明了这些概念、众多 Agent 才跟着用起来;相反,是大量 Agent 早就在这么做了,Anthropic 才把它们提炼、总结成了架构设计原则。实践在前,命名在后。
这些原则的底气,来自把 Agent 真正推进长流程、高风险场景的实战。作为 Pine AI 的首席科学家,我和团队打造了 Pine。据我所知,它是第一个能够自主与真人交互、并可靠地独立处理涉及金钱的敏感、复杂、长程任务的通用 Agent:它替用户打电话与运营商协商账单、与商家交涉退款和投诉、取消订阅,全程无需人工接管。这类任务动辄几十轮交涉,任何一步出错都会造成真金白银的损失。正是这种对可靠性近乎苛刻的要求,把本书反复强调的架构原则一条条倒逼了出来。下面几个例子,就来自这段实践。
而且这并不是我们的独家发明,据我所知,大多数头部模型和 Agent 公司都自己摸索出了类似的方法。这是我在 2025 年 8 月在图灵开设《AI Agent 实战营》课程和 2024-2026 年持续在国科大开设 AI Agent 实践课程的原因。我选择把这本书开源发布,而不是封闭起来收版税,也是希望这些知识能传播给更多从业者。
实践在前,命名在后,这个顺序对企业级 Agent 开发有一个很实际的含义:如果你每次都要等到业界开始流行某个 Agent 名词才去实践,就已经慢了一步。 名词流行的时候,头部公司往往早已把对应的问题趟过一遍了。那么,怎样才能赶在名词流行之前就知道该怎么做?我认为最关键的有两点。
第一,拥有一个对 Agent 能力上限有极高要求的真实业务,并能持续获得真实的业务反馈。 以 Pine 为例,处理一件事往往耗时数小时甚至数周,过程中可能要跟多个利益相关方反复沟通:其间可能要打好几个小时的电话,在电脑上操作并填写好几页复杂的表单,还要来回发送数封邮件;全程既不能在任何数字上出错,又要在沟通中时刻保持谨慎,维护用户的利益。只有置身于这样足够复杂的场景,实践才会自然地把你倒逼着去构建 harness,去解决那些模型本身当下还做不到、业务上却必须完成的事。反过来,如果业务对能力上限的要求不高、模型稍一升级就够用,你也就没有动力去打磨这些架构原则。
第二,必须建立评估(Evaluation)机制。 这也是本书反复强调的一点:没有评估,就没有进步。评估让你能分辨一次改动究竟是真的变好了,还是只是运气,从而让 Agent 的迭代方向不再依赖直觉。说到底,我们主张的是用科学的方法论去做工程、去做 Agent,而评估正是这套方法论的地基。第六章会专门展开这套方法。
不管底层模型如何升级,不管产品形态如何创新,几乎所有成功的 Agent 系统都遵循着相同的架构模式。这并非巧合:好的设计原则本就应该穿越模型的迭代周期,因为它们描述的不是某个模型的用法,而是智能系统与世界交互的基本模式。
图灵奖得主、强化学习之父 Richard Sutton 曾说,宇宙演化经历了从尘埃到恒星、从恒星到生命、从生命到智能体(原文为设计实体,designed entities)的 4 个阶段。生物进化是盲目的:随机变异,自然选择。大多数生物并不理解自己的工作原理,也无法自主设计和改造生物。而智能体(Agent)是宇宙演化史上一种全新的存在:它能通过生成代码实现自举(bootstrap)和自我进化,就像一个程序员编写了另一个程序员,然后新的程序员又能继续编写下一个。也就是说,Agent 能够理解自身的运作机制,并根据目标创造全新的智能体,甚至改进自己。本书的使命,就是帮助你理解和掌握这种创造的原则。
本书的核心公式只有一句话:Agent = LLM + 上下文 + 工具。三者缺一不可。
更直观地说,就是大脑 + 眼睛 + 手脚。大脑(LLM)负责思考和决策,眼睛(上下文)决定 Agent 能看到什么信息,手脚(工具)决定 Agent 能做什么事情。(严格来说,“眼睛”只是一个粗略的类比:上下文不仅包含环境信息和对话历史,还包含工具定义等内容,也就是说 Agent “看到”的信息中也包括了“有哪些手脚可用”。这个隐喻旨在传达核心直觉:上下文是模型能感知到的一切信息。)
对熟悉强化学习的读者,这三者也可以映射到 RL 的形式化语言。具体来说,LLM 对应 Policy(策略),上下文对应 Observation Space(观察空间),工具对应 Action Space(动作空间)。三种说法对应同一个对象,只是表达层次不同。
但这三个词各自的含义远比字面意思丰富得多,第一章将从实践出发逐一拆解,并建立从直觉理解到学术概念的完整映射。
本书共十章,分为三个部分(图0-1、图0-2):第一章是基础,建立对 Agent 的全局认知;第二至七章依次展开三大支柱:上下文(第二至三章)、工具(第四至五章)与模型(第六至七章,评估与后训练);第八至十章是进阶与应用,展示 Agent 的自我进化、多模态与实时交互,以及多 Agent 协作。
本书的各章节相对独立,你可以根据自己的需求选择不同的阅读路径:
每章都包含大量的实验和思考题,编号格式为“实验 X-Y”(X 为章节号,Y 为章节内序号)。实验和思考题的标题中用星级标注难度:★ 表示入门级,适合所有读者;★★ 表示中等难度,需要一定的工程实践基础;★★★ 表示进阶挑战,通常涉及开放性问题或复杂的系统设计。大部分实验配有完整的可运行代码,组织在配套的开源仓库中:
仓库中的项目名称与书中的实验一一对应,每个项目都包含完整的运行说明和依赖配置。我强烈建议你动手跑一遍这些实验。AI Agent 是一个实践性极强的领域,很多设计上的直觉需要在动手调试的过程中才能真正建立起来。
一个术语约定:有些英文技术词直译成中文会产生歧义,本书对两个高频词做了特别区分:把 reasoning(模型展开中间推导、“想”的过程)统一译为“思考”,把 inference(模型的前向计算与部署运行)统一译为“推理”。用两个不同的中文词,是为了避免“推理”一词同时承载两个概念、让读者无法区分。因此,凡是指模型思维链(Chain-of-Thought)、思考型模型(如 OpenAI o 系列、DeepSeek-R1,本书称“思考模型”“思考者”)、思考 token、思考过程的地方,本书一律用“思考”;凡是指模型运行部署(推理时、推理成本、推理栈、推理时扩展等)的地方,用“推理”。一个例外是几个已在中文里固化的复合词:逻辑推理、多跳推理、空间推理、时序推理,以及“推理游戏”这类日常用法,本书沿用习惯译法保留“推理”二字,请读者根据语境理解,它们指的是演绎推断的一般含义,而非上述 inference 的技术义。其他关键术语,正文会在首次出现处给出中英文对照。
本书面向有一定技术背景的读者,但不要求你是某个特定领域的专家。以下按“必需”和“推荐”两个层次列出前置知识,帮助你评估自己的准备程度。
必需:阅读全书的基础
推荐:提升特定章节的阅读体验
如果你在某些前置知识上有所欠缺,不必因此却步。本书的核心价值在于架构设计原则和工程实践的方法论,而非某个具体的算法或技巧。除第七章后训练以外,全书对数学和机器学习的要求很低,完全可以作为起点。
Agent 技术仍在快速演进,但好的架构设计原则具有穿越时间的力量。掌握了“为什么要这样设计”,你就能在技术浪潮的变化中保持清醒的判断力。希望这本书能成为你构建 AI Agent 的可靠指南。
感谢图灵的梦鸽老师和刘美英老师的辛勤编辑,以及为组织图灵《AI Agent 实战营》课程付出的努力;感谢刘俊明老师在国科大开设 AI Agent 实战课程。也要特别感谢图灵《AI Agent 实战营》的所有学员,以及国科大 AI Agent 实战课程的所有同学——在我讲授这些课程的过程中,大家给了我许多有价值的反馈与建议,也让我对这些概念本身有了更清晰的理解。
感谢 Pine AI 的所有同事。如果没有 Pine AI 这样优秀的产品,以及它所带来的种种挑战,我不可能在 Agent 领域获得如此深入的理解与实践;在一次次思想碰撞中,同事们也贡献了大量宝贵的思想输入。
也要感谢 AI 业界的许多朋友(在此不一一具名)。在各种行业讨论中,大家对我的观点给予了坦诚的反馈,纠正了我不少错误的判断,提升了我对模型与 Agent 的认知。
最要感谢的,是我的家人,特别是我的太太孟佳颖。她始终支持我完成本书的写作,还为本书提出了许多宝贵的意见。