第 7 章 · 03 token 精确前向验证与 faithful DSA 本节摘要:本节是第 7 章的收口节,把前两节的机制升到 Colibrì 的元规则——优化必须绑定正确性。 (逐 token 前向验证)是 Colibrì 给所有压缩/复用优化的硬约束; 把 DeepSeek 的稀疏注意力索引和压缩 KV 一起忠实落盘。本节也会讲清楚 Colibrì 反复强调的边界:压缩状态不是"另一个模型"——这些机制换来的是内存/延迟/正确性属性,不是 blanket throughput claim。 内容来源:原项目源码 、 、 ⚠️ 注意:本节不引入新的源码细节,而是把第 7 章三件事(MLA 压缩 + KV 持久化 + KV 前缀复用)放在 Colibrì 的"诚实研究"框架下读。
本节摘要:本节是第 7 章的收口节,把前两节的机制升到 Colibrì 的元规则——优化必须绑定正确性。
token-exact forward validation(逐 token 前向验证)是 Colibrì 给所有压缩/复用优化的硬约束;faithful DSA把 DeepSeek 的稀疏注意力索引和压缩 KV 一起忠实落盘。本节也会讲清楚 Colibrì 反复强调的边界:压缩状态不是"另一个模型"——这些机制换来的是内存/延迟/正确性属性,不是 blanket throughput claim。
内容来源:原项目源码
c/kv_persist.h、c/kv_prefix.h、c/quant.h
⚠️ 注意:本节不引入新的源码细节,而是把第 7 章三件事(MLA 压缩 + KV 持久化 + KV 前缀复用)放在 Colibrì 的"诚实研究"框架下读。请把它当成机制深潜的总结节,而不是新 API 节。
token-exact forward validation 为什么是 Colibrì 一切优化绑定的正确性契约。faithful DSA 与压缩 KV 的关系,以及它在 .coli_kv 文件里的落盘形式。Colibrì 里有大量优化——KV 前缀复用、MLA 压缩、量化格式、磁盘驻留、CPU/GPU 异构。每一条单独看都像"加速",但 Colibrì 反复强调一条铁律:任何优化都不能改变 token 序列的输出。
token-exact forward validation 就是这套契约的操作形式:
参考实现可看 c/ref_glm.json、c/ref_olmoe_real.json——这些是 Colibrì 仓库内固定下来的"金标准 token 序列",tests/ 里的回归测试会拉引擎跑同一 prompt,把输出和金标准对账。
把这条契约套回第 7 章前两节:
kv_prefix_reuse() 复用前 N 个 token 的状态——前置条件是 fed[0..len-1] 与新 prompt 开头 memcmp 完全相等,这本质就是"复用前的 token 级验证"。.coli_kv 的 kv_disk_load() 写回状态后,引擎从 position nrec 继续生成——前置条件是文件头的几何指纹 + 魔数完全匹配,这保证装回的就是同一模型同一几何下的同一状态。💡 深潜要点:
token-exact不是"输出大致接近"或"BLEU 不掉",而是逐 token 严格相等。LLM 推理一旦在任何位置偏差一个 token,后续发散会以指数速度放大。"近似正确"对生成模型没有意义。
第 7 章 01 节我们看到 kv_rec_bytes() 末尾有一段:
21 if(m->has_dsa) for(int i=0;i<c->n_layers;i++) if(m->Ic[i]) rec+=(int64_t)c->index_hd*4;
DSA = DeepSeek 的稀疏注意力(DeepSeek Sparse Attention)。Ic[i] 是第 i 层的稀疏索引张量,index_hd 是索引宽度。has_dsa=1 的层,每条 KV 记录里多带 index_hd × 4 字节的索引数据。
faithful(忠实)这个词的含义就在这里:Colibrì 不"省略"或"重算"这份索引,而是把它原封不动地和压缩 KV 一起写盘、一起读回。这意味着:
把第 7 章三件事拼起来,得到一条完整的"压缩状态"链:
| 维度 | 机制 | 节省 | 边界 |
|---|---|---|---|
| KV 张量体量 | MLA 压缩(kv_lora + qk_rope) |
约 57× | 信息瓶颈,无二次量化 |
| 稀疏注意力索引 | faithful DSA(Ic[i]/index_hd) |
与原模型等价 | 索引原样落盘 |
| 跨重启 | .coli_kv 持久化 |
省首句 prefill | nrec 最后写 crash-safe |
| 跨 turn | kv_prefix 复用 |
省第 N+1 轮重 prefill | token-exact + tainted |
这一段是 Colibrì 文档反复强调的边界。读到本节为止,Colibrì 把模型状态做了三件事:
这三件事都没有"创造另一个模型":
这层边界是 Colibrì 区别于"蒸馏/裁剪"路线的核心:优化的是搬运与放置,不是模型本身。所以第 1 章的命题——"权重 JIT,只加载热点专家"——到第 7 章末尾依然成立:压缩状态只是让"搬运"更便宜,从来不改变"哪些参数被激活、激活参数做什么运算"。
第 7 章支柱页说"MLA KV 状态 57× 压缩",本节必须把"57×"读准——它是状态体量属性,不是"引擎快 57 倍":
.coli_kv 暖启动 + kv_prefix 复用让"已经算过的部分不再算",首句 / 后续 turn 延迟显著降低;这三条都是可测量、可证伪的属性。而"快多少倍 throughput"是强声明——它依赖硬件(PCIe 带宽、NVMe 速度、CPU/GPU 驻留)、依赖 workload(prompt 长度、对话轮数、专家分布)、依赖配置(镜像、量化、VRAM 预算)。Colibrì 的工作方式是把这些声明拆开做 A/B:format and quantization ablations with correctness/quality gates——格式与量化的消融实验,每一条都挂一道正确性 / 质量门。
⚠️ 注意:这是 Colibrì 的"诚实研究"心法在压缩状态上的具体落地——压缩本身不是目的,减少权重搬运够用即可。如果 int4 已经让 CPU 上的 decode 内存带宽不成为瓶颈,那再往下压到 int2 的边际收益可能为负(质量门不过)。所以每一档量化格式都要和正确性门一起评估,见
quant.h与第 2 章。
Colibrì 的设计取向可以这样总结:压缩服务于搬运,搬运服务于"有限高速内存只改速度不改语义"。
.coli_kv 落盘 + kv_prefix 复用——压缩省的是"重复 prefill 的算 + IO"。到某一点之后,继续压缩带来的质量损失就超过搬运节省的收益。Colibrì 的做法是留门:g_kvsave 可关、kv_prefix 失败优雅退化、quant.h 的 FORMATS 注册表可挂多种格式按模型选——这些门让用户和研究者可以逐项验证、逐项取舍。
把这三节读完后,你应该能复述这条线索:Colibrì 把模型状态当成可以分多个层级搬运的有界质量表示,优化的是搬运和放置的成本,正确性用 token-exact 前向验证硬约束。这就是第 7 章的全部精华。
token-exact forward validation 是 Colibrì 一切优化绑定的正确性契约——tests/ 用 ref_glm.json 等金标准对账,逐 token 严格相等。faithful DSA 把稀疏注意力索引和 MLA 压缩 KV 一起原样落盘,不省略不重算,保证暖启动 / 推理与原模型等价。下一章我们离开压缩状态,深潜 Colibrì 的异构执行——CPU + CUDA + Metal + Vulkan 共享一个运行时,从
backend_loader.c的动态后端加载开始。