Colibrì · 第 4 章 多层级存储放置 章节摘要:本章深潜 Colibrì 的核心系统设计——多层级存储放置(tier.h)。VRAM、RAM、NVMe 不是"能不能装下"的三选一,而是"放在哪层最快"的放置问题。稠密部分(attention/shared/embedding 17B)常驻 RAM(int4 9.9GB),路由专家放磁盘按需流式,可选 VRAM 层(CUDAEXPERTGB=auto PINGB=all 全驻留时磁盘退出)。tier.h 实现了两种替换策略:tierpickswap(25% 滞后防乒乓)和 tierpicklfru(LFRU 频率优先近期破平)。NUMA 跨内存控制器交错。本章共 2 节,前置依赖为第 1-3 章。
章节摘要:本章深潜 Colibrì 的核心系统设计——多层级存储放置(tier.h)。VRAM、RAM、NVMe 不是"能不能装下"的三选一,而是"放在哪层最快"的放置问题。稠密部分(attention/shared/embedding ~17B)常驻 RAM(int4 ~9.9GB),路由专家放磁盘按需流式,可选 VRAM 层(CUDA_EXPERT_GB=auto PIN_GB=all 全驻留时磁盘退出)。tier.h 实现了两种替换策略:tier_pick_swap(25% 滞后防乒乓)和 tier_pick_lfru(LFRU 频率优先近期破平)。NUMA 跨内存控制器交错。本章共 2 节,前置依赖为第 1-3 章。

VRAM/RAM/NVMe同一层级;稠密17B常驻RAM int4 ~9.9GB;专家磁盘按需流式;CUDA_EXPERT_GB=auto PIN_GB=all全驻留磁盘退出;有限高速内存只改速度不改语义。
tier_pick_swap(cold找最冷/resident检查/25%+4滞后防乒乓);tier_lfru_score(频率<<8|近期,频率256>近期255);tier_pick_lfru;tier_decay(heat>>=1衰减);NUMA COLI_NUMA=1跨内存控制器交错。
前置:第1-3章。后续:第5章深潜双SSD带宽翻倍与I/O重叠。