登录社区云,与社区用户共同成长
邀请您加入社区
本文介绍了如何预训练一个小型LLM(约2亿参数)的完整流程,包括数据准备、预训练和微调。主要内容: 数据下载与处理:使用出门问问序列猴子数据集(10B tokens)作为预训练数据,BelleGroup中文对话数据集(350万条)作为SFT数据。提供了数据下载脚本和预处理代码,包括文本切分和格式转换。 构建预训练数据集:详细介绍了PretrainDataset类的实现,用于自回归语言建模任务,包含