第 2 章 · 实验教程:上下文工程


文档摘要

第 2 章 · 实验教程:上下文工程 本章对应正文:第 2 章 · 上下文工程 核心命题:上下文决定能力上限——KV Cache、提示工程、Agent Skills、上下文压缩,把"喂给模型什么"做到极致。 模型的能力再强,最终都受限于"它实际看到了什么"。这一章把上下文拆成可工程化的对象:用 KV Cache 把重复前缀的算力省下来,用提示工程把指令、风格、工具描述调到最优,用上下文压缩在能力不打折的前提下砍 token,再把安全和状态信息也纳入上下文管理。 本章 8 个实验覆盖了从底层缓存到上层安全的全链路:既能看到"一行微小改动如何毁掉 KV Cache 命中",也能看到 3×4 攻防矩阵下防御如何逐层生效。

第 2 章 · 实验教程:上下文工程

本章对应正文:第 2 章 · 上下文工程

核心命题:上下文决定能力上限——KV Cache、提示工程、Agent Skills、上下文压缩,把"喂给模型什么"做到极致。

模型的能力再强,最终都受限于"它实际看到了什么"。这一章把上下文拆成可工程化的对象:用 KV Cache 把重复前缀的算力省下来,用提示工程把指令、风格、工具描述调到最优,用上下文压缩在能力不打折的前提下砍 token,再把安全和状态信息也纳入上下文管理。

本章 8 个实验覆盖了从底层缓存到上层安全的全链路:既能看到"一行微小改动如何毁掉 KV Cache 命中",也能看到 3×4 攻防矩阵下防御如何逐层生效。建议先读正文建立"上下文是一种工程对象"的直觉,再按兴趣挑实验动手——多数实验配好 API Key 即可独立运行。

实验列表

实验 类型 难度 说明
local_llm_serving 跨平台本地 LLM 部署,自动选 vLLM/Ollama 后端,展示 0.6B 小模型也能有出色工具调用
attention_visualization ★★ 可视化 LLM 完整 token 序列与注意力权重分布,理解模型如何处理上下文、推理与调用工具
kv-cache ★★ 探索不同上下文管理模式对 KV Cache 的影响,演示错误模式如何破坏缓存效率
context-compression ★★ 实现并对比 6 种上下文压缩策略,保持能力的同时减少 token
prompt-engineering ★★ 扩展 Tau-Bench,量化语气风格、指令组织、工具描述等因素对任务完成率的影响
system-hint ★★ 研究系统提示对 Agent 行为的影响,探索五种 Agent 状态栏技术如何提升性能
log-sanitization ★★ 智能日志脱敏系统,离线正则 + 本地小模型双引擎,保留调试信息的同时保护敏感数据
prompt-injection ★★ 3 种攻击场景 × 4 种防御配置的对照实验,直观展示逐层叠加防御后注入成功率下降

类型与难度说明

标记 含义
可独立运行:自带完整代码,配好 API Key 即可跑
📖 复现指南:依赖需自行 git clone 的外部仓库
🚧 设计文档:仅含架构方案,可运行代码仍在完善
★ ~ ★★★ 从易到难,★ 为入门级、★★★ 为进阶挑战

阅读建议

  • 入门读者:从 local_llm_serving 开始,最快在本地跑通一个工具调用 Agent;再用 system-hint 的 --mode preview 离线直观看到状态栏如何改变模型看到的上下文。
  • 关注性能与成本:重点做 kv-cache 与 context-compression,前者揭示缓存如何被错误模式破坏,后者给出省 token 的实战方案。
  • 关注安全:prompt-injection 的攻防矩阵和 log-sanitization 的脱敏引擎,回答了"上下文里混进恶意指令或敏感数据怎么办"。

← 返回总目录 · 📖 读本章正文 · 📑 本章索引


作者与出处
原作者: bojieli
来源:bojieli
许可证:Apache-2.0
整理: 灏天文库整理
由灏天文库结构化整理,提供目录导航、全文检索与在线阅读,便于系统化学习
发布者: 作者: bojieli 转发
评论区 (0)
U