返回资源中心

TinyStories Dataset

数据集
机器学习
1 次浏览
0 个赞
DatasetSLMNLP

资源描述

TinyStories 是一个专为小型语言模型(SLM)训练与评估设计的合成数据集。该数据集由 GPT-3.5/4 生成,包含数百万篇词汇量限制在儿童水平(约 1000-3000 常用词)的英文短篇故事。其核心价值在于剥离模型规模干扰,专注研究语言理解能力与涌现现象。适用于 SLM 预训练、NLP 基础研究、低算力环境下的模型 benchmark 及教育类 AI 应用开发。数据纯净、结构统一,可显著降低训练门槛,是探索轻量化大模型技术的理想起点。

详细内容

## 数据集背景与来源 TinyStories 由微软研究院学者提出,旨在探索“模型参数量”与“数据集复杂度”对语言理解能力的独立影响。为排除真实网络文本中的噪声与复杂语法干扰,研究团队利用 GPT-3.5 和 GPT-4 生成了一系列语法简单、逻辑清晰的合成短篇故事。该数据集通过严格控制词汇难度,为小型语言模型(SLM)的语言能力研究提供了标准化、低噪声的实验环境。 ## 数据规模与标注信息 - **数据规模**:包含超过 200 万篇英文短篇故事,总文本量达数 GB 级别,充分满足轻量级模型的预训练与迭代需求。 - **词汇约束**:严格限制在儿童常用词汇范围内(约 1000~3000 个基础英语单词),句式简短,语义直白,大幅降低语言建模难度。 - **标注情况**:纯合成数据,无人工标注标签。数据以纯文本格式提供,每篇故事独立成段,部分版本保留了生成时的 Prompt 或词汇约束条件,便于研究者进行可控对比实验。 ## 典型应用场景 - **SLM 预训练与微调**:专为参数量在 10M~100M 级别的小型语言模型设计,可在单卡或消费级 GPU 上快速完成训练验证。 - **语言理解与涌现能力研究**:用于 benchmark 模型在词汇受限条件下的语法掌握、逻辑推理及上下文记忆能力,探究能力涌现的临界点。 - **低算力/边缘端 NLP 开发**:适合教育类 AI、儿童互动应用、轻量级文本生成工具的底层模型训练。 - **算法对比实验**:作为标准化基线数据集,广泛用于测试不同架构(如 Transformer、RWKV、Mamba)在简单语料上的收敛效率与数据利用率。 ## 使用注意事项 - **合成数据局限性**:故事由 LLM 生成,可能存在重复模式、常识性偏差或逻辑断层,建议训练前进行去重、困惑度(Perplexity)过滤等质量清洗。 - **领域与语言限制**:仅包含基础英语词汇,不适用于多语言、专业领域(如医疗、代码、法律)或复杂长文本任务。 - **预处理建议**:需根据目标模型架构进行分词(Tokenization)处理,建议搭配因果语言建模(CLM)目标进行训练,并合理设置序列长度(通常 256~512 token 即可)。 - **学术引用**:用于研究或公开发布模型时,请遵循 Hugging Face 数据集协议,并引用原始论文《TinyStories: How Small Can Language Models Be and Still Speak Coherent English?》。