附录B:MoE常用数据集与基准测试
预训练数据集
通用预训练语料
| 数据集 |
规模 |
语言 |
使用模型 |
说明 |
| C4 (Colossal Clean Crawled Corpus) |
750GB |
英文 |
T5-MoE, Switch Transformer |
清洗后的网页文本 |
| The Pile |
825GB |
多语言 |
GPT-J系列MoE变体 |
学术、代码、网页等多领域 |
| RedPajama |
1.2TB |
多语言 |
多种开源模型 |
包含CommonCrawl、C4等子集 |
| FineWeb |
15T tokens |
多语言 |
多种开源模型 |
HuggingFace的高质量清洗语料 |
| StarCoder Data |
1-6T tokens |
多语言代码 |
代码MoE模型 |
代码预训练专用 |
| SkyPile-150B |
150B tokens |
中文 |
中文MoE模型 |
高质量中文语料 |
中文预训练语料
| 数据集 |
规模 |
说明 |
| CLUECorpus |
100GB+ |
中文语言理解语料库 |
| Wudao |
2.3TB |
中文大规模预训练语料 |
| SkyPile-150B |
150B tokens |
清洗后的高质量中文语料 |
| Chinese-ROOTS |
300GB |
多样化中文语料 |
下游任务评测基准
语言理解
| 基准 |
任务类型 |
规模 |
说明 |
| GLUE/SuperGLUE |
NLU |
多任务 |
经典NLU基准 |
| CLUE |
中文NLU |
多任务 |
中文NLU基准 |
| MMLU |
知识问答 |
57个学科 |
多学科知识评测 |
| C-Eval |
中文知识 |
52个学科 |
中文版MMLU |
| CMMLU |
中文多学科 |
多学科 |
中文多学科评测 |
| AGIEval |
综合推理 |
多任务 |
包含中国考试题 |
生成与对话
| 基准 |
任务类型 |
说明 |
| MATH |
数学推理 |
数学问题求解 |
| GSM8K |
数学推理 |
小学数学应用题 |
| HumanEval |
代码生成 |
函数级代码生成 |
| MBPP |
代码生成 |
基础Python编程 |
| MT-Bench |
对话质量 |
多轮对话评估 |
| AlpacaEval |
指令遵循 |
指令跟随能力 |
长文本评测
| 基准 |
最大长度 |
说明 |
| LongBench |
32K |
长文本理解与生成 |
| Needle-in-a-Haystack |
128K+ |
检索大海捞针 |
| SCROLLS |
多种长度 |
长文本摘要与问答 |
| L-Eval |
多种长度 |
长文本生成评测 |
效率评测
| 基准 |
评测指标 |
说明 |
| lm-evaluation-harness |
多任务分数 |
标准LLM评测框架 |
| OpenCompass |
多维度 |
支持MoE效率评测 |
| LM Eval |
多任务分数 |
EleutherAI的评测框架 |
| MoE-Score |
负载均衡+任务 |
MoE专用评测指标 |
MoE模型性能对比表
通用基准对比
| 模型 |
参数量 |
MMLU |
GSM8K |
HumanEval |
MT-Bench |
| Mixtral 8x7B |
46.7B |
70.6 |
52.2 |
40.2 |
8.30 |
| Mixtral 8x22B |
141B |
77.8 |
74.0 |
45.0 |
8.60 |
| Qwen2.5-MoE-A57B |
37.7B |
72.8 |
65.2 |
63.6 |
8.80 |
| DeepSeek-V2 |
236B |
78.5 |
73.8 |
— |
— |
| Grok-1 |
314B |
73.0 |
62.9 |
39.5 |
— |
效率对比
| 模型 |
活跃参数 |
推理FLOPS/token |
相对吞吐量 |
| LLaMA-2 7B |
7B |
14T |
1.0x |
| Mixtral 8x7B |
12.9B |
~14T |
~0.7x |
| LLaMA-2 70B |
70B |
140T |
0.1x |
| Mixtral 8x22B |
39B |
~40T |
~0.25x |
数据集获取
HuggingFace Datasets
from datasets import load_dataset
# 加载评测数据
mmlu = load_dataset("cais/mmlu", "all")
gsm8k = load_dataset("openai/gsm8k", "main")
humaneval = load_dataset("openai_humaneval")
# 加载训练语料
c4 = load_dataset("allenai/c4", "en", split="train",
streaming=True) # 流式加载大语料
自建评测
建议MoE研究者建立以下评测维度:
- 任务性能:标准NLU/生成基准分数
- 负载均衡:Gini系数、闲置专家比率
- 路由质量:路由一致性、专家特化程度
- 推理效率:吞吐量(tokens/s)、延迟(ms/token)
- 鲁棒性:分布外数据的性能保持