资源描述
AudioCaps++ 是 Hugging Face 官方托管的高质量音频-文本多模态数据集,扩展自 AudioCaps,包含 50,000 条人声旁白与环境音混合音频样本,每条配备细粒度标注:情感极性(positive/neutral/negative)、说话人ID、声学事件标签(如 'laugh', 'door_closing', 'rain')、ASR转录文本及人工撰写的语义摘要。适用于音频理解、跨模态检索、语音驱动 captioning、情感感知语音合成等任务,是提升多模态模型鲁棒性与可解释性的关键资源。
详细内容
## AudioCaps++ 数据集详细介绍
### 背景与来源
AudioCaps++ 是 AudioCaps 数据集的增强版本,由学术研究团队与 Hugging Face 合作构建并开源,旨在弥补原始 AudioCaps 在标注粒度、声学多样性与语义丰富性上的不足。其音频素材源自经授权的 Creative Commons 音频库、Freesound 及众包录音平台,所有样本均通过伦理审查与版权合规筛查,并经专业音频工程师重采样(48 kHz)、降噪与标准化处理,确保声学质量一致性。
### 数据规模与标注信息
- **总样本量**:50,000 条独立音频片段(平均时长 6.2 ± 1.8 秒);
- **标注维度**:
- **ASR 转录文本**:基于 Whisper-large-v3 生成初稿,经双盲人工校验与修正;
- **语义摘要**:由母语为英语的标注员撰写,长度控制在 15–30 词,聚焦场景意图与事件逻辑(e.g., "A cheerful woman describes rain tapping on a window while a dog barks faintly in the background");
- **情感极性**:三分类(positive/neutral/negative),依据语音韵律与文本语义联合判定;
- **说话人ID**:覆盖 1,247 名不同年龄/性别/口音的说话者,支持说话人识别与个性化建模;
- **声学事件标签**:采用 ESC-50 兼容体系扩展至 89 类(含 'child_laugh', 'coffee_machine', 'wind_through_trees' 等),支持多标签标注(平均每条 1.7 个事件)。
### 典型应用场景
- 多模态音频描述生成(Audio Captioning);
- 声学事件检测(AED)与情感识别联合建模;
- ASR 后处理与语义纠错(利用摘要监督转录质量);
- 跨模态对齐预训练(如 CLAP、AudioCLIP 的 fine-tuning);
- 语音驱动内容生成(Voice-to-Summary, V2S)系统评估基准。
### 使用注意事项
- 数据集以 `datasets` 格式托管于 Hugging Face Hub,支持流式加载与 `load_dataset('audiocaps-plus')` 直接调用;
- 所有音频为 `.wav` 格式(PCM, 16-bit),建议使用 `torchaudio` 或 `librosa` 加载;
- 情感与事件标签存在少量交叉标注噪声(<2.3%),建议在敏感任务中启用 `trust_labels=False` 参数启用置信度过滤;
- 商业用途需遵守 [Hugging Face Dataset License](https://huggingface.co/datasets/audiocaps-plus/blob/main/LICENSE)(CC BY-NC-SA 4.0),禁止用于监控类或高风险语音分析应用。