Colibrì · 第 4 章 多层级存储放置


文档摘要

Colibrì · 第 4 章 多层级存储放置 章节摘要:本章深潜 Colibrì 的核心系统设计——多层级存储放置(tier.h)。VRAM、RAM、NVMe 不是"能不能装下"的三选一,而是"放在哪层最快"的放置问题。稠密部分(attention/shared/embedding 17B)常驻 RAM(int4 9.9GB),路由专家放磁盘按需流式,可选 VRAM 层(CUDAEXPERTGB=auto PINGB=all 全驻留时磁盘退出)。tier.h 实现了两种替换策略:tierpickswap(25% 滞后防乒乓)和 tierpicklfru(LFRU 频率优先近期破平)。NUMA 跨内存控制器交错。本章共 2 节,前置依赖为第 1-3 章。

Colibrì · 第 4 章 多层级存储放置

章节摘要:本章深潜 Colibrì 的核心系统设计——多层级存储放置(tier.h)。VRAM、RAM、NVMe 不是"能不能装下"的三选一,而是"放在哪层最快"的放置问题。稠密部分(attention/shared/embedding ~17B)常驻 RAM(int4 ~9.9GB),路由专家放磁盘按需流式,可选 VRAM 层(CUDA_EXPERT_GB=auto PIN_GB=all 全驻留时磁盘退出)。tier.h 实现了两种替换策略:tier_pick_swap(25% 滞后防乒乓)和 tier_pick_lfru(LFRU 频率优先近期破平)。NUMA 跨内存控制器交错。本章共 2 节,前置依赖为第 1-3 章。

深潜坐标

学习目标

  1. 理解三级层级 VRAM/RAM/NVMe 的放置哲学。
  2. 读懂 tier_pick_swap 的 25% 滞后防乒乓。
  3. 读懂 tier_pick_lfru 的 LFRU(频率优先近期破平)。
  4. 理解 tier_decay 衰减。
  5. 理解 NUMA 交错与全驻留模式。

子章节导航

01 三级层级与放置哲学

图:三级存储层级
VRAM/RAM/NVMe同一层级;稠密17B常驻RAM int4 ~9.9GB;专家磁盘按需流式;CUDA_EXPERT_GB=auto PIN_GB=all全驻留磁盘退出;有限高速内存只改速度不改语义。

02 tier.h 替换策略 LFRU 与 NUMA

tier_pick_swap(cold找最冷/resident检查/25%+4滞后防乒乓);tier_lfru_score(频率<<8|近期,频率256>近期255);tier_pick_lfru;tier_decay(heat>>=1衰减);NUMA COLI_NUMA=1跨内存控制器交错。

前置知识与后续延伸

前置:第1-3章。后续:第5章深潜双SSD带宽翻倍与I/O重叠。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U