第 2 章 · 实验教程:上下文工程 本章对应正文:第 2 章 · 上下文工程 核心命题:上下文决定能力上限——KV Cache、提示工程、Agent Skills、上下文压缩,把"喂给模型什么"做到极致。 模型的能力再强,最终都受限于"它实际看到了什么"。这一章把上下文拆成可工程化的对象:用 KV Cache 把重复前缀的算力省下来,用提示工程把指令、风格、工具描述调到最优,用上下文压缩在能力不打折的前提下砍 token,再把安全和状态信息也纳入上下文管理。 本章 8 个实验覆盖了从底层缓存到上层安全的全链路:既能看到"一行微小改动如何毁掉 KV Cache 命中",也能看到 3×4 攻防矩阵下防御如何逐层生效。
本章对应正文:第 2 章 · 上下文工程
核心命题:上下文决定能力上限——KV Cache、提示工程、Agent Skills、上下文压缩,把"喂给模型什么"做到极致。
模型的能力再强,最终都受限于"它实际看到了什么"。这一章把上下文拆成可工程化的对象:用 KV Cache 把重复前缀的算力省下来,用提示工程把指令、风格、工具描述调到最优,用上下文压缩在能力不打折的前提下砍 token,再把安全和状态信息也纳入上下文管理。
本章 8 个实验覆盖了从底层缓存到上层安全的全链路:既能看到"一行微小改动如何毁掉 KV Cache 命中",也能看到 3×4 攻防矩阵下防御如何逐层生效。建议先读正文建立"上下文是一种工程对象"的直觉,再按兴趣挑实验动手——多数实验配好 API Key 即可独立运行。
| 实验 | 类型 | 难度 | 说明 |
|---|---|---|---|
| local_llm_serving | ✅ | ★ | 跨平台本地 LLM 部署,自动选 vLLM/Ollama 后端,展示 0.6B 小模型也能有出色工具调用 |
| attention_visualization | ✅ | ★★ | 可视化 LLM 完整 token 序列与注意力权重分布,理解模型如何处理上下文、推理与调用工具 |
| kv-cache | ✅ | ★★ | 探索不同上下文管理模式对 KV Cache 的影响,演示错误模式如何破坏缓存效率 |
| context-compression | ✅ | ★★ | 实现并对比 6 种上下文压缩策略,保持能力的同时减少 token |
| prompt-engineering | ✅ | ★★ | 扩展 Tau-Bench,量化语气风格、指令组织、工具描述等因素对任务完成率的影响 |
| system-hint | ✅ | ★★ | 研究系统提示对 Agent 行为的影响,探索五种 Agent 状态栏技术如何提升性能 |
| log-sanitization | ✅ | ★★ | 智能日志脱敏系统,离线正则 + 本地小模型双引擎,保留调试信息的同时保护敏感数据 |
| prompt-injection | ✅ | ★★ | 3 种攻击场景 × 4 种防御配置的对照实验,直观展示逐层叠加防御后注入成功率下降 |
| 标记 | 含义 |
|---|---|
| ✅ | 可独立运行:自带完整代码,配好 API Key 即可跑 |
| 📖 | 复现指南:依赖需自行 git clone 的外部仓库 |
| 🚧 | 设计文档:仅含架构方案,可运行代码仍在完善 |
| ★ ~ ★★★ | 从易到难,★ 为入门级、★★★ 为进阶挑战 |
--mode preview 离线直观看到状态栏如何改变模型看到的上下文。← 返回总目录 · 📖 读本章正文 · 📑 本章索引