03 · 实验教程:76 个可动手实验,按章组织


文档摘要

03 · 实验教程:76 个可动手实验,按章组织 本书全部配套实验的中文版,覆盖 10 章共 76 个项目,每个都可独立阅读和修改。 每章子目录下都有一个 README 支柱页,列出该章全部实验、难度星级、类型标识和阅读建议。本页是它们的总入口。 怎么用这一卷 按章进入:从下面的「各章入口」表格,点进对应章节的支柱页,挑感兴趣的实验动手。 配正文读:每章实验与「02-正文」的章节一一对应,建议「读一章正文 → 做一章实验」。 看类型选:标 ✅ 的配好 API Key 即可独立运行;标 📖 的需先 外部仓库(克隆脚本见「00-门面 / 项目首页」的附录)。

03 · 实验教程:76 个可动手实验,按章组织

本书全部配套实验的中文版,覆盖 10 章共 76 个项目,每个都可独立阅读和修改。

每章子目录下都有一个 README 支柱页,列出该章全部实验、难度星级、类型标识和阅读建议。本页是它们的总入口。

怎么用这一卷

  • 按章进入:从下面的「各章入口」表格,点进对应章节的支柱页,挑感兴趣的实验动手。
  • 配正文读:每章实验与「02-正文」的章节一一对应,建议「读一章正文 → 做一章实验」。
  • 看类型选:标 ✅ 的配好 API Key 即可独立运行;标 📖 的需先 git clone 外部仓库(克隆脚本见「00-门面 / 项目首页」的附录)。

类型与难度说明

标记 含义
可独立运行:自带完整代码,配好 API Key 即可跑
📖 复现指南:依赖需自行 git clone 的外部仓库
🚧 设计文档:仅含架构方案,可运行代码仍在完善
★ ~ ★★★ 从易到难,★ 为入门级、★★★ 为进阶挑战

各章入口

实验目录 数量 核心命题
1 第 1 章支柱页(01-第1章/README.md 4 「模型即 Agent」新范式 + Agent = LLM + 上下文 + 工具
2 第 2 章支柱页(02-第2章/README.md 8 上下文决定能力上限:KV Cache、提示工程、上下文压缩
3 第 3 章支柱页(03-第3章/README.md 14 跨会话记住用户、接入外部知识:记忆、RAG、结构化索引
4 第 4 章支柱页(04-第4章/README.md 7 工具是 Agent 的双手:MCP 协议、感知/执行/协作三类工具
5 第 5 章支柱页(05-第5章/README.md 12 代码是「能创造新工具的工具」,生产级 Coding Agent 全景
6 第 6 章支柱页(06-第6章/README.md 6 把表现变成可比较信号:评估环境、指标、统计显著性
7 第 7 章支柱页(07-第7章/README.md 13 预训练/SFT/RL 三阶段:何时选 SFT、何时选 RL
8 第 8 章支柱页(08-第8章/README.md 6 不改权重也能成长:经验学习、从工具使用者到创造者
9 第 9 章支柱页(09-第9章/README.md 5 从文本扩展到语音、GUI、物理世界
10 第 10 章支柱页(10-第10章/README.md 5 群体智能高于个体:协作框架、上下文共享/隔离
合计 76

全部实验速查

按章排列。难度星级取自各章支柱页;📖 类型需先克隆外部仓库。

第 1 章 · Agent 基础知识

实验 类型 难度 一句话说明
learning-from-experience.md ★★ 对比 Q-learning 与 LLM 上下文学习,复现 The Second Half:LLM 以 250–400 倍样本效率超越传统 RL
web-search-agent.md 基于 Kimi K3 的智能搜索 Agent,演示「模型即 Agent」
search-codegen.md ★★ GPT-5 原生工具集成,综合利用网络搜索与代码沙盒
context.md ★★★ 系统性消融实验,展示 Agent 上下文各组件的重要性

第 2 章 · 上下文工程

实验 类型 难度 一句话说明
local_llm_serving.md 跨平台本地 LLM 部署,0.6B 小模型也能出色工具调用
attention_visualization.md ★★ 可视化 token 序列与注意力权重,理解模型如何处理上下文
kv-cache.md ★★ 探索上下文管理模式对 KV Cache 的影响,错误模式如何破坏缓存
context-compression.md ★★ 实现并对比多种压缩策略,保持能力的同时减少 token
prompt-engineering.md ★★ 扩展 Tau-Bench,量化语气/指令/工具描述对完成率的影响
system-hint.md ★★ 研究系统提示对 Agent 行为的影响,五种状态栏技术
log-sanitization.md ★★ 智能日志脱敏,保留调试信息同时保护敏感数据
prompt-injection.md ★★ 3×4 攻防矩阵,逐层叠加防御后注入成功率下降

第 3 章 · 用户记忆和知识库

实验 类型 一句话说明
user-memory.md 长期用户记忆系统,记住偏好与历史交互、提供个性化服务
mem0.md / 03-第3章/memobase.md 用 mem0、Memobase 两框架各实现一版用户记忆作对照
user-memory-evaluation.md 系统化评估用户记忆系统的准确性、相关性和有效性
dense-embedding.md 对比 ANNOY(树)与 HNSW(图)两种 ANN 算法的权衡
sparse-embedding.md 从零实现基于 BM25 的稀疏向量搜索,可视化内部机制
retrieval-pipeline.md 稠密+稀疏+神经重排序的完整流水线,展示混合检索互补
multimodal-agent.md 对比原生多模态/提取为文本/工具化分析三种策略
structured-index.md 对比 RAPTOR(递归抽象树)与 GraphRAG(知识图谱)
agentic-rag.md 对比 Non-Agentic 与 Agentic RAG,ReAct 迭代检索
agentic-rag-for-user-memory.md 用 Agentic RAG 管理用户对话历史,跨会话记忆检索
contextual-retrieval.md 上下文感知检索,提升检索精度
contextual-retrieval-for-user-memory.md 上下文感知检索用于用户记忆
structured-knowledge-extraction.md 结构化知识抽取

第 4 章 · 工具

实验 类型 一句话说明
perception-tools.md 感知工具 MCP:网络搜索、多模态、文件系统、公共数据源,大多无需 Key
execution-tools.md 执行工具 MCP:文件操作、代码解释器、虚拟终端,LLM 二次审批
collaboration-tools.md 协作工具 MCP:浏览器自动化、HITL、通知、定时器
agent-with-event-trigger.md FastAPI 事件驱动 Agent,原生异步集成前三组 MCP 工具
active-tool-selection.md 让 Agent 根据任务主动选择最合适的工具组合
active-tool-discovery.md 对比全量注入 schema 与 discover_tools 按需检索
async-agent.md asyncio 事件驱动框架 Flux:队列分派、并行、打断、取消

第 5 章 · Coding Agent 与代码生成

实验 类型 一句话说明
coding-agent.md 基于 Claude 的生产级编码助手,纯 Python 实现 17 个工具
code-for-math.md 同题集对比纯思维链与代码辅助,代码准确率显著更高
code-for-logic.md 把逻辑谜题转化为 CSP 用 python-constraint 求解
small-model-codified-rules.md 把规则从提示词搬进代码后,小模型成功率大幅提升
paper-to-ppt.md 把「做 PPT」重构为代码生成:Slidev + Vision LLM 迭代
paper-to-video.md 在「论文→PPT」基础上生成讲解词、TTS、ffmpeg 合成视频
video-edit.md 自然语言需求 + Vision 定位,剪出片段并抽帧核对
adaptive-log-parser.md 遇新格式让代码 Agent 生成 parse 函数并热更新
log-diagnosis.md 诊断 Agent 定位根因、生成回归测试、重放框架验证
dynamic-form.md 动态生成含级联逻辑的 HTML 表单让用户补全信息
erp-agent.md 自然语言转 SQL,artifact 模式省 token 又防错
conversational-ui.md 自然语言提 UI 定制需求,改 React 源码借 Vite HMR 生效

第 6 章 · Agent 的评估

实验 类型 一句话说明
elo-leaderboard.md 基于 ELO 评分的 Agent 性能排行榜,通过对战比较相对能力
model-benchmark.md 横向压测多家 API 的 TTFT、延迟、吞吐与成功率
agent-cost-analysis.md 多轮任务全链路成本拆解 + KV-cache/压缩 A/B 节省量化
tts-quality-eval.md LLM-as-a-Judge 按 Rubric 逐维度给 TTS 打分
public-health-reporting-eval.md 评估公共卫生报告 Agent 的工具调用与计算准确性
android-world.md 📖 评估 Agent 在 Android 环境的 UI 交互与任务完成(需克隆)

第 6 章另有 terminal-bench、SWE-bench、GAIA、OSWorld、tau2-bench 共 5 个 📖 外部评测基准,克隆命令见「00-门面 / 项目首页」附录。

第 7 章 · 模型后训练

实验 类型 一句话说明
continued-pretraining.md 在特定领域数据上持续预训练,提升目标领域表现
Intuitor.md 训练模型的直觉推理,快速做出合理判断
MultilingualReasoning.md 训练模型在多语言环境下的推理能力
sesame.md 专注于序列建模任务的训练和评估方法
orpheus.md 训练模型的音乐生成与理解能力
cot-distillation.md 调用前沿模型蒸馏 CoT 轨迹,规则验证后生成 SFT 数据
AdaptThink.md 📖 按难度自适应选 Thinking/NoThinking,降成本 45–69%
retool.md 📖 多轮对话+代码沙箱提升数学推理,SFT→RL 两阶段
AWorld-train.md 📖 基于 AWorld 框架训练具身 Agent
SpatialReasoning.md 📖 训练模型的空间推理能力
SimpleVLA-RL.md 📖 视觉-语言-动作 RL
MiniMind-pretrain.md 📖 从零预训练小型 LLM/VLM
RLVP.md 📖 RLVP 论文代码

第 7 章另有 SFTvsRL、verl、tinker-cookbook 共 3 个 📖 外部训练框架,克隆命令见「00-门面 / 项目首页」附录。

第 8 章 · Agent 的自我进化

实验 类型 一句话说明
gaia-experience.md 「学习-应用」闭环:总结成功轨迹为结构化经验,新任务检索应用
browser-use-rpa.md 浏览器工作流录制,把重复操作封装为参数化工具,3–5 倍加速
prompt-distillation.md 把复杂提示的效果蒸馏进模型参数
prompt-auto-optimization.md Coding Agent 读/改 prompt → 重新评测 → 验证闭环
self-evolving-tools.md Alita 式「最小预定义,最大自我进化」,五个通用元工具
self-evolution-eval.md 20 个跨领域任务 + 分层验证 harness,考察发现/创造/复用质量

第 9 章 · 多模态与实时交互

实验 类型 一句话说明
live-audio.md 实时语音聊天,VAD+ASR+LLM+TTS,WebSocket 低延迟
phone-agent.md 标准 ReAct Agent 想清号码与目标,调用电话语音 API 通话
end-to-end-speech.md 端到端语音思考「听→想→说」,与级联方案对比
streaming-speech.md 音频分块喂 ASR 降首包延迟,对比整句识别
controllable-tts.md LLM 输出控制标记映射到参考语音库风格再合成

第 9 章另有 browser-use、claude-quickstarts 共 2 个 📖 外部仓库,克隆命令见「00-门面 / 项目首页」附录。

第 10 章 · 多 Agent 协作

实验 类型 一句话说明
staged-system-prompt.md 同一 Agent 在澄清/实现/审查三阶段加载不同提示词与工具
multi-role-transfer.md 共享上下文下的链式 handoff,多角色自主切换
book-translation.md 管理者模式拆分翻译给术语/翻译/审校专职 Agent
parallel-web-research.md N 个子 Agent 并行搜索,命中即级联终止
voice-werewolf.md 多 Agent 狼人杀演示「上下文不共享」的信息权限

第 10 章另有 use-computer-while-calling(已独立为 TalkAct)、generative_agents(斯坦福 AI 小镇)共 2 个 📖 外部仓库。

上手第一个实验

刚来想 10 分钟跑通一个 Agent?推荐第 1 章的 web-search-agent——配置最简单,最能直观体会「模型 + 工具 = Agent」。

想理解 Agent 各组件的价值?做 context 消融实验——它会一个个去掉上下文组件,让你看到 Agent 是怎么一步步「变笨」的。

← 返回主目录 · 📖 进入正文 · 📑 看章节索引 · 📚 系统学习看学习建议


发布者: 作者: bojieli 转发
评论区 (0)
U