03 · 实验教程:76 个可动手实验,按章组织
本书全部配套实验的中文版,覆盖 10 章共 76 个项目,每个都可独立阅读和修改。
每章子目录下都有一个 README 支柱页,列出该章全部实验、难度星级、类型标识和阅读建议。本页是它们的总入口。
怎么用这一卷
- 按章进入:从下面的「各章入口」表格,点进对应章节的支柱页,挑感兴趣的实验动手。
- 配正文读:每章实验与「02-正文」的章节一一对应,建议「读一章正文 → 做一章实验」。
- 看类型选:标 ✅ 的配好 API Key 即可独立运行;标 📖 的需先
git clone 外部仓库(克隆脚本见「00-门面 / 项目首页」的附录)。
类型与难度说明
| 标记 |
含义 |
| ✅ |
可独立运行:自带完整代码,配好 API Key 即可跑 |
| 📖 |
复现指南:依赖需自行 git clone 的外部仓库 |
| 🚧 |
设计文档:仅含架构方案,可运行代码仍在完善 |
| ★ ~ ★★★ |
从易到难,★ 为入门级、★★★ 为进阶挑战 |
各章入口
| 章 |
实验目录 |
数量 |
核心命题 |
| 1 |
第 1 章支柱页(01-第1章/README.md) |
4 |
「模型即 Agent」新范式 + Agent = LLM + 上下文 + 工具 |
| 2 |
第 2 章支柱页(02-第2章/README.md) |
8 |
上下文决定能力上限:KV Cache、提示工程、上下文压缩 |
| 3 |
第 3 章支柱页(03-第3章/README.md) |
14 |
跨会话记住用户、接入外部知识:记忆、RAG、结构化索引 |
| 4 |
第 4 章支柱页(04-第4章/README.md) |
7 |
工具是 Agent 的双手:MCP 协议、感知/执行/协作三类工具 |
| 5 |
第 5 章支柱页(05-第5章/README.md) |
12 |
代码是「能创造新工具的工具」,生产级 Coding Agent 全景 |
| 6 |
第 6 章支柱页(06-第6章/README.md) |
6 |
把表现变成可比较信号:评估环境、指标、统计显著性 |
| 7 |
第 7 章支柱页(07-第7章/README.md) |
13 |
预训练/SFT/RL 三阶段:何时选 SFT、何时选 RL |
| 8 |
第 8 章支柱页(08-第8章/README.md) |
6 |
不改权重也能成长:经验学习、从工具使用者到创造者 |
| 9 |
第 9 章支柱页(09-第9章/README.md) |
5 |
从文本扩展到语音、GUI、物理世界 |
| 10 |
第 10 章支柱页(10-第10章/README.md) |
5 |
群体智能高于个体:协作框架、上下文共享/隔离 |
|
合计 |
76 |
|
全部实验速查
按章排列。难度星级取自各章支柱页;📖 类型需先克隆外部仓库。
第 1 章 · Agent 基础知识
| 实验 |
类型 |
难度 |
一句话说明 |
learning-from-experience.md |
✅ |
★★ |
对比 Q-learning 与 LLM 上下文学习,复现 The Second Half:LLM 以 250–400 倍样本效率超越传统 RL |
web-search-agent.md |
✅ |
★ |
基于 Kimi K3 的智能搜索 Agent,演示「模型即 Agent」 |
search-codegen.md |
✅ |
★★ |
GPT-5 原生工具集成,综合利用网络搜索与代码沙盒 |
context.md |
✅ |
★★★ |
系统性消融实验,展示 Agent 上下文各组件的重要性 |
第 2 章 · 上下文工程
| 实验 |
类型 |
难度 |
一句话说明 |
local_llm_serving.md |
✅ |
★ |
跨平台本地 LLM 部署,0.6B 小模型也能出色工具调用 |
attention_visualization.md |
✅ |
★★ |
可视化 token 序列与注意力权重,理解模型如何处理上下文 |
kv-cache.md |
✅ |
★★ |
探索上下文管理模式对 KV Cache 的影响,错误模式如何破坏缓存 |
context-compression.md |
✅ |
★★ |
实现并对比多种压缩策略,保持能力的同时减少 token |
prompt-engineering.md |
✅ |
★★ |
扩展 Tau-Bench,量化语气/指令/工具描述对完成率的影响 |
system-hint.md |
✅ |
★★ |
研究系统提示对 Agent 行为的影响,五种状态栏技术 |
log-sanitization.md |
✅ |
★★ |
智能日志脱敏,保留调试信息同时保护敏感数据 |
prompt-injection.md |
✅ |
★★ |
3×4 攻防矩阵,逐层叠加防御后注入成功率下降 |
第 3 章 · 用户记忆和知识库
| 实验 |
类型 |
一句话说明 |
user-memory.md |
✅ |
长期用户记忆系统,记住偏好与历史交互、提供个性化服务 |
mem0.md / 03-第3章/memobase.md |
✅ |
用 mem0、Memobase 两框架各实现一版用户记忆作对照 |
user-memory-evaluation.md |
✅ |
系统化评估用户记忆系统的准确性、相关性和有效性 |
dense-embedding.md |
✅ |
对比 ANNOY(树)与 HNSW(图)两种 ANN 算法的权衡 |
sparse-embedding.md |
✅ |
从零实现基于 BM25 的稀疏向量搜索,可视化内部机制 |
retrieval-pipeline.md |
✅ |
稠密+稀疏+神经重排序的完整流水线,展示混合检索互补 |
multimodal-agent.md |
✅ |
对比原生多模态/提取为文本/工具化分析三种策略 |
structured-index.md |
✅ |
对比 RAPTOR(递归抽象树)与 GraphRAG(知识图谱) |
agentic-rag.md |
✅ |
对比 Non-Agentic 与 Agentic RAG,ReAct 迭代检索 |
agentic-rag-for-user-memory.md |
✅ |
用 Agentic RAG 管理用户对话历史,跨会话记忆检索 |
contextual-retrieval.md |
✅ |
上下文感知检索,提升检索精度 |
contextual-retrieval-for-user-memory.md |
✅ |
上下文感知检索用于用户记忆 |
structured-knowledge-extraction.md |
✅ |
结构化知识抽取 |
第 4 章 · 工具
| 实验 |
类型 |
一句话说明 |
perception-tools.md |
✅ |
感知工具 MCP:网络搜索、多模态、文件系统、公共数据源,大多无需 Key |
execution-tools.md |
✅ |
执行工具 MCP:文件操作、代码解释器、虚拟终端,LLM 二次审批 |
collaboration-tools.md |
✅ |
协作工具 MCP:浏览器自动化、HITL、通知、定时器 |
agent-with-event-trigger.md |
✅ |
FastAPI 事件驱动 Agent,原生异步集成前三组 MCP 工具 |
active-tool-selection.md |
✅ |
让 Agent 根据任务主动选择最合适的工具组合 |
active-tool-discovery.md |
✅ |
对比全量注入 schema 与 discover_tools 按需检索 |
async-agent.md |
✅ |
asyncio 事件驱动框架 Flux:队列分派、并行、打断、取消 |
第 5 章 · Coding Agent 与代码生成
| 实验 |
类型 |
一句话说明 |
coding-agent.md |
✅ |
基于 Claude 的生产级编码助手,纯 Python 实现 17 个工具 |
code-for-math.md |
✅ |
同题集对比纯思维链与代码辅助,代码准确率显著更高 |
code-for-logic.md |
✅ |
把逻辑谜题转化为 CSP 用 python-constraint 求解 |
small-model-codified-rules.md |
✅ |
把规则从提示词搬进代码后,小模型成功率大幅提升 |
paper-to-ppt.md |
✅ |
把「做 PPT」重构为代码生成:Slidev + Vision LLM 迭代 |
paper-to-video.md |
✅ |
在「论文→PPT」基础上生成讲解词、TTS、ffmpeg 合成视频 |
video-edit.md |
✅ |
自然语言需求 + Vision 定位,剪出片段并抽帧核对 |
adaptive-log-parser.md |
✅ |
遇新格式让代码 Agent 生成 parse 函数并热更新 |
log-diagnosis.md |
✅ |
诊断 Agent 定位根因、生成回归测试、重放框架验证 |
dynamic-form.md |
✅ |
动态生成含级联逻辑的 HTML 表单让用户补全信息 |
erp-agent.md |
✅ |
自然语言转 SQL,artifact 模式省 token 又防错 |
conversational-ui.md |
✅ |
自然语言提 UI 定制需求,改 React 源码借 Vite HMR 生效 |
第 6 章 · Agent 的评估
| 实验 |
类型 |
一句话说明 |
elo-leaderboard.md |
✅ |
基于 ELO 评分的 Agent 性能排行榜,通过对战比较相对能力 |
model-benchmark.md |
✅ |
横向压测多家 API 的 TTFT、延迟、吞吐与成功率 |
agent-cost-analysis.md |
✅ |
多轮任务全链路成本拆解 + KV-cache/压缩 A/B 节省量化 |
tts-quality-eval.md |
✅ |
LLM-as-a-Judge 按 Rubric 逐维度给 TTS 打分 |
public-health-reporting-eval.md |
✅ |
评估公共卫生报告 Agent 的工具调用与计算准确性 |
android-world.md |
📖 |
评估 Agent 在 Android 环境的 UI 交互与任务完成(需克隆) |
第 6 章另有 terminal-bench、SWE-bench、GAIA、OSWorld、tau2-bench 共 5 个 📖 外部评测基准,克隆命令见「00-门面 / 项目首页」附录。
第 7 章 · 模型后训练
| 实验 |
类型 |
一句话说明 |
continued-pretraining.md |
✅ |
在特定领域数据上持续预训练,提升目标领域表现 |
Intuitor.md |
✅ |
训练模型的直觉推理,快速做出合理判断 |
MultilingualReasoning.md |
✅ |
训练模型在多语言环境下的推理能力 |
sesame.md |
✅ |
专注于序列建模任务的训练和评估方法 |
orpheus.md |
✅ |
训练模型的音乐生成与理解能力 |
cot-distillation.md |
✅ |
调用前沿模型蒸馏 CoT 轨迹,规则验证后生成 SFT 数据 |
AdaptThink.md |
📖 |
按难度自适应选 Thinking/NoThinking,降成本 45–69% |
retool.md |
📖 |
多轮对话+代码沙箱提升数学推理,SFT→RL 两阶段 |
AWorld-train.md |
📖 |
基于 AWorld 框架训练具身 Agent |
SpatialReasoning.md |
📖 |
训练模型的空间推理能力 |
SimpleVLA-RL.md |
📖 |
视觉-语言-动作 RL |
MiniMind-pretrain.md |
📖 |
从零预训练小型 LLM/VLM |
RLVP.md |
📖 |
RLVP 论文代码 |
第 7 章另有 SFTvsRL、verl、tinker-cookbook 共 3 个 📖 外部训练框架,克隆命令见「00-门面 / 项目首页」附录。
第 8 章 · Agent 的自我进化
| 实验 |
类型 |
一句话说明 |
gaia-experience.md |
✅ |
「学习-应用」闭环:总结成功轨迹为结构化经验,新任务检索应用 |
browser-use-rpa.md |
✅ |
浏览器工作流录制,把重复操作封装为参数化工具,3–5 倍加速 |
prompt-distillation.md |
✅ |
把复杂提示的效果蒸馏进模型参数 |
prompt-auto-optimization.md |
✅ |
Coding Agent 读/改 prompt → 重新评测 → 验证闭环 |
self-evolving-tools.md |
✅ |
Alita 式「最小预定义,最大自我进化」,五个通用元工具 |
self-evolution-eval.md |
✅ |
20 个跨领域任务 + 分层验证 harness,考察发现/创造/复用质量 |
第 9 章 · 多模态与实时交互
| 实验 |
类型 |
一句话说明 |
live-audio.md |
✅ |
实时语音聊天,VAD+ASR+LLM+TTS,WebSocket 低延迟 |
phone-agent.md |
✅ |
标准 ReAct Agent 想清号码与目标,调用电话语音 API 通话 |
end-to-end-speech.md |
✅ |
端到端语音思考「听→想→说」,与级联方案对比 |
streaming-speech.md |
✅ |
音频分块喂 ASR 降首包延迟,对比整句识别 |
controllable-tts.md |
✅ |
LLM 输出控制标记映射到参考语音库风格再合成 |
第 9 章另有 browser-use、claude-quickstarts 共 2 个 📖 外部仓库,克隆命令见「00-门面 / 项目首页」附录。
第 10 章 · 多 Agent 协作
| 实验 |
类型 |
一句话说明 |
staged-system-prompt.md |
✅ |
同一 Agent 在澄清/实现/审查三阶段加载不同提示词与工具 |
multi-role-transfer.md |
✅ |
共享上下文下的链式 handoff,多角色自主切换 |
book-translation.md |
✅ |
管理者模式拆分翻译给术语/翻译/审校专职 Agent |
parallel-web-research.md |
✅ |
N 个子 Agent 并行搜索,命中即级联终止 |
voice-werewolf.md |
✅ |
多 Agent 狼人杀演示「上下文不共享」的信息权限 |
第 10 章另有 use-computer-while-calling(已独立为 TalkAct)、generative_agents(斯坦福 AI 小镇)共 2 个 📖 外部仓库。
上手第一个实验
刚来想 10 分钟跑通一个 Agent?推荐第 1 章的 web-search-agent——配置最简单,最能直观体会「模型 + 工具 = Agent」。
想理解 Agent 各组件的价值?做 context 消融实验——它会一个个去掉上下文组件,让你看到 Agent 是怎么一步步「变笨」的。
← 返回主目录 · 📖 进入正文 · 📑 看章节索引 · 📚 系统学习看学习建议