返回资源中心

Common Voice

数据集
机器学习
2 次浏览
0 个赞
AudioOpen SourceML

资源描述

Common Voice 是 Mozilla 主导的开源多语言语音数据集,涵盖100+语言、数百万条带文本转录的众包录音,支持语音识别(ASR)、声学建模、方言研究与低资源语言NLP开发。数据经匿名化处理并提供CC-0许可,适用于学术研究、开源模型训练(如Whisper、Wav2Vec 2.0)及教育实践,是构建公平、包容性语音AI的关键基础设施。

详细内容

## Common Voice 数据集详细介绍 ### 数据集背景与来源 Common Voice 是由 Mozilla 发起并持续维护的开源语音数据收集项目,旨在构建大规模、多样化、可自由使用的语音语料库,以推动开放、透明、包容的语音技术发展。数据完全来自全球志愿者贡献——用户通过官网朗读句子、验证他人录音,形成闭环式众包采集流程。所有数据均遵循隐私优先原则,经自动与人工审核后发布,原始录音与文本转录均采用 CC-0 公共领域许可。 ### 数据规模与标注信息 截至2024年,Common Voice 已覆盖超100种语言(含濒危与低资源语言),累计收录超 **15,000 小时** 的高质量语音数据(具体规模随版本更新,详见各语言子集 release 页面)。每条样本包含: - 原始 WAV 音频(16-bit PCM,16kHz 单声道) - 对应文本转录(经拼写标准化与标点清洗) - 元数据:说话人年龄/性别/口音(自愿提供,非强制)、录音设备、验证状态(validated/unvalidated) - 每语言子集提供 train/dev/test 划分(部分语言含预划分,其余需用户自行切分) ### 典型应用场景 - **语音识别(ASR)模型训练与评估**:广泛用于 Whisper、DeepSpeech、Wav2Vec 2.0、ESPnet 等开源框架的基准训练 - **低资源语言建模**:为非洲、南亚等地区缺乏商业语音数据的语言提供关键训练资源 - **发音/口音多样性研究**:支持声学特征分析、说话人适应、鲁棒性增强实验 - **教育与社区项目**:高校课程实践、黑客松(Hackathon)语音任务、本地化语音助手开发 ### 使用注意事项 - 数据不含音频情感、说话人身份标签或生物特征信息,**不可用于声纹识别或身份追踪** - 部分语言子集存在标注不均衡问题(如某些口音样本稀疏),建议结合数据采样策略或领域适配 - 下载前需确认所用语言版本号(如 v14.0),不同版本在清洗规则与划分方式上存在差异 - Mozilla 官方推荐使用 `cv-corpus-*` 命名的数据包,并通过 [Common Voice 下载页](https://commonvoice.mozilla.org/datasets) 获取最新校验和(SHA256)以确保完整性