第 7 章 · 03 token 精确前向验证与 faithful DSA


文档摘要

第 7 章 · 03 token 精确前向验证与 faithful DSA 本节摘要:本节是第 7 章的收口节,把前两节的机制升到 Colibrì 的元规则——优化必须绑定正确性。 (逐 token 前向验证)是 Colibrì 给所有压缩/复用优化的硬约束; 把 DeepSeek 的稀疏注意力索引和压缩 KV 一起忠实落盘。本节也会讲清楚 Colibrì 反复强调的边界:压缩状态不是"另一个模型"——这些机制换来的是内存/延迟/正确性属性,不是 blanket throughput claim。 内容来源:原项目源码 、 、 ⚠️ 注意:本节不引入新的源码细节,而是把第 7 章三件事(MLA 压缩 + KV 持久化 + KV 前缀复用)放在 Colibrì 的"诚实研究"框架下读。

第 7 章 · 03 token 精确前向验证与 faithful DSA

本节摘要:本节是第 7 章的收口节,把前两节的机制升到 Colibrì 的元规则——优化必须绑定正确性token-exact forward validation(逐 token 前向验证)是 Colibrì 给所有压缩/复用优化的硬约束;faithful DSA 把 DeepSeek 的稀疏注意力索引和压缩 KV 一起忠实落盘。本节也会讲清楚 Colibrì 反复强调的边界:压缩状态不是"另一个模型"——这些机制换来的是内存/延迟/正确性属性,不是 blanket throughput claim。

内容来源:原项目源码 c/kv_persist.hc/kv_prefix.hc/quant.h

⚠️ 注意:本节不引入新的源码细节,而是把第 7 章三件事(MLA 压缩 + KV 持久化 + KV 前缀复用)放在 Colibrì 的"诚实研究"框架下读。请把它当成机制深潜的总结节,而不是新 API 节。

学习目标

  1. 解释 token-exact forward validation 为什么是 Colibrì 一切优化绑定的正确性契约。
  2. 理解 faithful DSA 与压缩 KV 的关系,以及它在 .coli_kv 文件里的落盘形式。
  3. 读懂"压缩状态不是另一个模型"这句话的两层含义。
  4. 区分"内存/延迟/正确性属性"与"吞吐声明",避免误读 Colibrì 的承诺。
  5. 把"format and quantization ablations with correctness/quality gates"翻译成可执行的研究动作。

一、token 精确前向验证:优化的正确性契约

Colibrì 里有大量优化——KV 前缀复用、MLA 压缩、量化格式、磁盘驻留、CPU/GPU 异构。每一条单独看都像"加速",但 Colibrì 反复强调一条铁律:任何优化都不能改变 token 序列的输出

token-exact forward validation 就是这套契约的操作形式:

  • 取一个固定 prompt,用未优化的参考路径(reference)跑出 token 序列 A;
  • 被测优化路径(optimized)跑出 token 序列 B;
  • 逐 token 比对 A 和 B 必须完全相等。

参考实现可看 c/ref_glm.jsonc/ref_olmoe_real.json——这些是 Colibrì 仓库内固定下来的"金标准 token 序列",tests/ 里的回归测试会拉引擎跑同一 prompt,把输出和金标准对账。

把这条契约套回第 7 章前两节:

  • kv_prefix_reuse() 复用前 N 个 token 的状态——前置条件是 fed[0..len-1] 与新 prompt 开头 memcmp 完全相等,这本质就是"复用前的 token 级验证"。
  • .coli_kvkv_disk_load() 写回状态后,引擎从 position nrec 继续生成——前置条件是文件头的几何指纹 + 魔数完全匹配,这保证装回的就是同一模型同一几何下的同一状态。

💡 深潜要点:token-exact 不是"输出大致接近"或"BLEU 不掉",而是逐 token 严格相等。LLM 推理一旦在任何位置偏差一个 token,后续发散会以指数速度放大。"近似正确"对生成模型没有意义。

二、faithful DSA:把稀疏注意力索引也忠实落盘

第 7 章 01 节我们看到 kv_rec_bytes() 末尾有一段:

21 if(m->has_dsa) for(int i=0;i<c->n_layers;i++) if(m->Ic[i]) rec+=(int64_t)c->index_hd*4;

DSA = DeepSeek 的稀疏注意力(DeepSeek Sparse Attention)。Ic[i] 是第 i 层的稀疏索引张量,index_hd 是索引宽度。has_dsa=1 的层,每条 KV 记录里多带 index_hd × 4 字节的索引数据。

faithful(忠实)这个词的含义就在这里:Colibrì 不"省略"或"重算"这份索引,而是把它原封不动地和压缩 KV 一起写盘、一起读回。这意味着:

  • 暖启动时,引擎恢复的不只是 MLA 潜向量,还有稀疏注意力的索引结构;
  • 推理时,稀疏注意力的 top-k 选 block 路径与原模型逐位一致;
  • 任何精度损失(即便有)来自 MLA 表示本身,而非 Colibrì 的二次近似。

把第 7 章三件事拼起来,得到一条完整的"压缩状态"链:

维度 机制 节省 边界
KV 张量体量 MLA 压缩(kv_lora + qk_rope) 约 57× 信息瓶颈,无二次量化
稀疏注意力索引 faithful DSA(Ic[i]/index_hd) 与原模型等价 索引原样落盘
跨重启 .coli_kv 持久化 省首句 prefill nrec 最后写 crash-safe
跨 turn kv_prefix 复用 省第 N+1 轮重 prefill token-exact + tainted

三、压缩状态不是另一个模型

这一段是 Colibrì 文档反复强调的边界。读到本节为止,Colibrì 把模型状态做了三件事:

  1. 量化(int4/int8/FP8/MXFP4)——权重精度的有界损失表示;
  2. 压缩(MLA KV、faithful DSA)——架构原生的低秩 + 稀疏;
  3. 持久化 / 复用——把上述压缩状态落盘、跨 turn 复用。

这三件事都没有"创造另一个模型":

  • 量化是同一模型的低精度表示,Colibrì 不改路由、不改专家选择;
  • MLA/DSA 是模型架构本身就有的设计,Colibrì 只是把它们的压缩形式原样用、原样存;
  • 持久化和复用是同一模型状态的搬运,不改语义。

这层边界是 Colibrì 区别于"蒸馏/裁剪"路线的核心:优化的是搬运与放置,不是模型本身。所以第 1 章的命题——"权重 JIT,只加载热点专家"——到第 7 章末尾依然成立:压缩状态只是让"搬运"更便宜,从来不改变"哪些参数被激活、激活参数做什么运算"。

四、内存/延迟/正确性属性 vs blanket throughput

第 7 章支柱页说"MLA KV 状态 57× 压缩",本节必须把"57×"读准——它是状态体量属性,不是"引擎快 57 倍":

  • 内存属性:同样上下文长度下,KV 占用降到 1/57,长对话不再撑爆 RAM;
  • 延迟属性:.coli_kv 暖启动 + kv_prefix 复用让"已经算过的部分不再算",首句 / 后续 turn 延迟显著降低;
  • 正确性属性:token-exact forward validation 保证输出序列与参考路径逐 token 一致。

这三条都是可测量、可证伪的属性。而"快多少倍 throughput"是强声明——它依赖硬件(PCIe 带宽、NVMe 速度、CPU/GPU 驻留)、依赖 workload(prompt 长度、对话轮数、专家分布)、依赖配置(镜像、量化、VRAM 预算)。Colibrì 的工作方式是把这些声明拆开做 A/B:format and quantization ablations with correctness/quality gates——格式与量化的消融实验,每一条都挂一道正确性 / 质量门。

⚠️ 注意:这是 Colibrì 的"诚实研究"心法在压缩状态上的具体落地——压缩本身不是目的,减少权重搬运够用即可。如果 int4 已经让 CPU 上的 decode 内存带宽不成为瓶颈,那再往下压到 int2 的边际收益可能为负(质量门不过)。所以每一档量化格式都要和正确性门一起评估,见 quant.h 与第 2 章。

五、压缩不是目的:够用即停

Colibrì 的设计取向可以这样总结:压缩服务于搬运,搬运服务于"有限高速内存只改速度不改语义"

  • 权重在 NVMe 上 int4 存,搬进 RAM 时按需解码——压缩省的是磁盘读;
  • KV 状态 MLA 57× 压缩存——压缩省的是 RAM 占用;
  • .coli_kv 落盘 + kv_prefix 复用——压缩省的是"重复 prefill 的算 + IO"。

到某一点之后,继续压缩带来的质量损失就超过搬运节省的收益。Colibrì 的做法是留门:g_kvsave 可关、kv_prefix 失败优雅退化、quant.hFORMATS 注册表可挂多种格式按模型选——这些门让用户和研究者可以逐项验证、逐项取舍

把这三节读完后,你应该能复述这条线索:Colibrì 把模型状态当成可以分多个层级搬运的有界质量表示,优化的是搬运和放置的成本,正确性用 token-exact 前向验证硬约束。这就是第 7 章的全部精华。

本节要点回顾

  • token-exact forward validation 是 Colibrì 一切优化绑定的正确性契约——tests/ref_glm.json 等金标准对账,逐 token 严格相等。
  • faithful DSA 把稀疏注意力索引和 MLA 压缩 KV 一起原样落盘,不省略不重算,保证暖启动 / 推理与原模型等价。
  • 压缩状态不是另一个模型:量化是低精度表示,MLA/DSA 是架构原生,持久化和复用是状态搬运——优化的是搬运和放置,不改模型语义。
  • MLA KV 状态 57× 压缩是内存/延迟/正确性属性,不是吞吐声明;吞吐必须分硬件/workload/配置做 A/B。
  • 压缩不是目的,减少权重搬运够用即可;每档量化都要配 correctness/quality gates 一起评估,边际收益为负即停。

下一章我们离开压缩状态,深潜 Colibrì 的异构执行——CPU + CUDA + Metal + Vulkan 共享一个运行时,从 backend_loader.c 的动态后端加载开始。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U