Colibrì · 第 8 章 CPU/GPU 异构执行 章节摘要:本章深潜 Colibrì 的异构执行——CPU + CUDA + Metal + Vulkan 共享一个运行时。backendloader.c 动态后端加载(运行时按需加载 .so/.dll/.dylib);backendcuda.cu(CUDA 层)/backendmetal.mm(Metal 层)/backendvulkan.c(Vulkan 层)三个可选后端,各自编译开关(CUDA=1/METAL=1/VULKAN=1)。GPU shaders(attentionabsorb.comp/qmatmul.comp/rmsnorm.comp)。CPU/GPU 重叠隐藏传输而非移动瓶颈。omptune.
章节摘要:本章深潜 Colibrì 的异构执行——CPU + CUDA + Metal + Vulkan 共享一个运行时。backend_loader.c 动态后端加载(运行时按需加载 .so/.dll/.dylib);backend_cuda.cu(CUDA 层)/backend_metal.mm(Metal 层)/backend_vulkan.c(Vulkan 层)三个可选后端,各自编译开关(CUDA=1/METAL=1/VULKAN=1)。GPU shaders(attention_absorb.comp/qmatmul.comp/rmsnorm.comp)。CPU/GPU 重叠隐藏传输而非移动瓶颈。omp_tune.h OpenMP 调优。本章共 3 节,前置依赖为第 1-7 章。
运行时按需加载后端(.so/.dll/.dylib);可选编译(CUDA=1/METAL=1/VULKAN=1);统一后端接口;无GPU也能跑(纯CPU);backend_gpu_compat.h 兼容层。
backend_cuda.cu(CUDA专家驻留+CUDA_EXPERT_GB=auto+PIN_GB);backend_metal.mm(Metal MTLHeap/MTLResidencySet实验E5);backend_vulkan.c(Vulkan跨平台.qmatmul.spv预编译);GPU shaders(attention_absorb/qmatmul/qmatmul_gate_up/rmsnorm .comp);运行时编译vs预编译spv。
CPU/GPU重叠隐藏传输而非移动瓶颈(诚实假设:快CPU+低驻留可能抹平GPU收益);omp_tune.h OpenMP线程调优;NUMA内存;partial/full expert residency;per-stage profiles与one-variable A/B。
前置:第1-7章。后续:第9章深潜CLI/服务/Web全栈。