附录B:MoE常用数据集与基准测试


文档摘要

附录B:MoE常用数据集与基准测试 预训练数据集 通用预训练语料 数据集 | 规模 | 语言 | 使用模型 | 说明 C4 (Colossal Clean Crawled Corpus) | 750GB | 英文 | T5-MoE, Switch Transformer | 清洗后的网页文本 The Pile | 825GB | 多语言 | GPT-J系列MoE变体 | 学术、代码、网页等多领域 RedPajama | 1.

附录B:MoE常用数据集与基准测试

预训练数据集

通用预训练语料

数据集 规模 语言 使用模型 说明
C4 (Colossal Clean Crawled Corpus) 750GB 英文 T5-MoE, Switch Transformer 清洗后的网页文本
The Pile 825GB 多语言 GPT-J系列MoE变体 学术、代码、网页等多领域
RedPajama 1.2TB 多语言 多种开源模型 包含CommonCrawl、C4等子集
FineWeb 15T tokens 多语言 多种开源模型 HuggingFace的高质量清洗语料
StarCoder Data 1-6T tokens 多语言代码 代码MoE模型 代码预训练专用
SkyPile-150B 150B tokens 中文 中文MoE模型 高质量中文语料

中文预训练语料

数据集 规模 说明
CLUECorpus 100GB+ 中文语言理解语料库
Wudao 2.3TB 中文大规模预训练语料
SkyPile-150B 150B tokens 清洗后的高质量中文语料
Chinese-ROOTS 300GB 多样化中文语料

下游任务评测基准

语言理解

基准 任务类型 规模 说明
GLUE/SuperGLUE NLU 多任务 经典NLU基准
CLUE 中文NLU 多任务 中文NLU基准
MMLU 知识问答 57个学科 多学科知识评测
C-Eval 中文知识 52个学科 中文版MMLU
CMMLU 中文多学科 多学科 中文多学科评测
AGIEval 综合推理 多任务 包含中国考试题

生成与对话

基准 任务类型 说明
MATH 数学推理 数学问题求解
GSM8K 数学推理 小学数学应用题
HumanEval 代码生成 函数级代码生成
MBPP 代码生成 基础Python编程
MT-Bench 对话质量 多轮对话评估
AlpacaEval 指令遵循 指令跟随能力

长文本评测

基准 最大长度 说明
LongBench 32K 长文本理解与生成
Needle-in-a-Haystack 128K+ 检索大海捞针
SCROLLS 多种长度 长文本摘要与问答
L-Eval 多种长度 长文本生成评测

效率评测

基准 评测指标 说明
lm-evaluation-harness 多任务分数 标准LLM评测框架
OpenCompass 多维度 支持MoE效率评测
LM Eval 多任务分数 EleutherAI的评测框架
MoE-Score 负载均衡+任务 MoE专用评测指标

MoE模型性能对比表

通用基准对比

模型 参数量 MMLU GSM8K HumanEval MT-Bench
Mixtral 8x7B 46.7B 70.6 52.2 40.2 8.30
Mixtral 8x22B 141B 77.8 74.0 45.0 8.60
Qwen2.5-MoE-A57B 37.7B 72.8 65.2 63.6 8.80
DeepSeek-V2 236B 78.5 73.8
Grok-1 314B 73.0 62.9 39.5

效率对比

模型 活跃参数 推理FLOPS/token 相对吞吐量
LLaMA-2 7B 7B 14T 1.0x
Mixtral 8x7B 12.9B ~14T ~0.7x
LLaMA-2 70B 70B 140T 0.1x
Mixtral 8x22B 39B ~40T ~0.25x

数据集获取

HuggingFace Datasets

from datasets import load_dataset # 加载评测数据 mmlu = load_dataset("cais/mmlu", "all") gsm8k = load_dataset("openai/gsm8k", "main") humaneval = load_dataset("openai_humaneval") # 加载训练语料 c4 = load_dataset("allenai/c4", "en", split="train", streaming=True) # 流式加载大语料

自建评测

建议MoE研究者建立以下评测维度:

  1. 任务性能:标准NLU/生成基准分数
  2. 负载均衡:Gini系数、闲置专家比率
  3. 路由质量:路由一致性、专家特化程度
  4. 推理效率:吞吐量(tokens/s)、延迟(ms/token)
  5. 鲁棒性:分布外数据的性能保持

作者与出处
原作者: 灏天文库智能体
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库智能体 转发
评论区 (0)
U