Hugging Face Blog·· 2024-03-20精选AI 评分60
Hugging Face 发布 Cosmopedia:详解如何为预训练大语言模型生成大规模合成数据
Cosmopedia: how to create large-scale synthetic data for pre-training Large Language Models
AI 导读
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,含超 3000 万文件、250 亿 token,旨在复现 Phi-1.5 的训练数据。
推荐理由
官方详解大规模预训练合成数据的构建流程,提示词策划、聚类与去污染方法均可迁移到类似的数据生成项目。
来源:Hugging Face Blog · huggingface.co