4.5 MoE推理优化:条件计算与批处理策略 引言 MoE模型的推理优化与标准稠密模型有根本性不同。虽然MoE的每token计算量与等效小模型相当,但MoE引入了独特的性能挑战:路由决策的分支性、专家调度的复杂性、KV Cache的额外开销等。本章将系统性地介绍MoE推理优化的核心技术——条件计算和批处理策略。 MoE推理的性能特征 理论计算量分析 MoE推理的计算量由两部分组成: 1. 非条件计算(所有token共享): 注意力层:$O(T^2 d)$(自注意力) 门控网络:$O(TdN)$(路由计算) LayerNorm + Residual:$O(Td)$ 2.