附录C:MoE训练与推理常见问题FAQ 训练相关 Q1: MoE训练时出现严重的负载不均衡怎么办? A: 这是一个多层次的解决方案: 首先检查辅助损失系数:如果 $\alpha 10B 且推理是成本主要来源时,MoE通常更优 Q12: 共享专家(Shared Expert)有必要吗? A: DeepSeek-V2/V3的经验表明共享专家非常有价值: 处理所有token都需要的通用知识 避免路由到特定专家时丢失通用信息 推荐配置:1个共享专家 + N个路由专家 Q13: MoE可以用于非NLP任务吗? A: 可以!