Colibrì · 第 7 章 量化与压缩状态


文档摘要

Colibrì · 第 7 章 量化与压缩状态 章节摘要:本章深潜 Colibrì 的压缩状态机制——KV 持久化(kvpersist.h)、MLA KV 状态 57× 压缩、KV 前缀复用(kvprefix.h)。对话跨引擎重启暖启动:压缩 MLA KV-cache 每 turn 增量追加,crash-safe(nrec 最后写)。KV 前缀复用——聊天客户端每 turn 重发全文,如果新 prompt 以之前的状态对应的 token 序列开头,跳过重置只 prefill 尾部。实测 DeepSeek V4 第二 turn 复用 82% prompt 从 320s 降到 61s。token 精确前向验证保证语义。本章共 3 节,前置依赖为第 1-6 章。

Colibrì · 第 7 章 量化与压缩状态

章节摘要:本章深潜 Colibrì 的压缩状态机制——KV 持久化(kv_persist.h)、MLA KV 状态 57× 压缩、KV 前缀复用(kv_prefix.h)。对话跨引擎重启暖启动:压缩 MLA KV-cache 每 turn 增量追加,crash-safe(nrec 最后写)。KV 前缀复用——聊天客户端每 turn 重发全文,如果新 prompt 以之前的状态对应的 token 序列开头,跳过重置只 prefill 尾部。实测 DeepSeek V4 第二 turn 复用 82% prompt 从 320s 降到 61s。token 精确前向验证保证语义。本章共 3 节,前置依赖为第 1-6 章。

深潜坐标

学习目标

  1. 理解 kv_persist.h 的 .coli_kv 磁盘持久化。
  2. 说清 MLA KV 状态 57× 压缩。
  3. 理解 crash-safe(nrec 最后写)。
  4. 读懂 kv_prefix.h 的前缀复用机制。
  5. 理解 token 精确前向验证与 tainted 标记。

子章节导航

01 kv_persist.h KV 持久化与 MLA 压缩

.coli_kv on-disk KV cache;对话跨重启暖启动;KV_MAGIC "COLIKV1\0";kv_hdr(n_layers/kv_lora/qk_rope/index_hd/nic/vocab/nrec);kv_rec_bytes(MLA压缩记录字节);kv_disk_open/kv_disk_truncate;crash-safe(nrec最后写);MLA 57×压缩KV状态。

02 kv_prefix.h KV 前缀复用

聊天每turn重发全文;如果新prompt以之前状态token序列开头则跳过重置只prefill尾部;为什么用record不用counter(per-engine不变量不同);INVARIANT fed[0..len-1]恰好是当前状态token;TAINT(inkling音频帧同id不同mel→tainted不复用);实测DeepSeek V4 320s→61s。

03 token精确前向验证与faithful DSA

token-exact forward validation;faithful DSA;优化必须绑定正确性;压缩状态是无损或有界质量表示;不是为了吞吐而是内存/延迟/正确性属性。

前置知识与后续延伸

前置:第1-6章。后续:第8章深潜CPU/GPU异构执行。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U