尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

大模型训练数据工程指南:从清洗、配比到合规治理的落地实践

发布时间:2026/9/29 12:45:00

资讯中心
01
ARTICLE

大模型训练数据工程指南:从清洗、配比到合规治理的落地实践

大模型训练数据工程指南:从清洗、配比到合规治理的落地实践
简介阿里研究院发布的《2024大模型训练数据白皮书》是一份系统分析大模型训练数据现状、难点与演进方向的专业报告面向AI算法工程师、数据治理研究者、企业数字化负责人及关注大模型合规的从业者。报告从训练数据对大模型发展的重要性切入逐一梳理大语言模型与多模态模型所需的数据类型澄清“大模型依赖用户个人信息”“中文语料短缺制约发展”等常见疑问继而以三重不确定性解释高质量数据的评估标准并重点剖析合成数据的定义、必要性、生成方法与分类以及其在预训练语料和对齐语料场景中的实际作用。报告还延伸到训练数据治理与政府社会协同生态的思考并单独对比美国与中国的训练数据现状为读者呈现从理论到实践的完整脉络。整套资源仅含1个PDF文件压缩包大小15.12MB版式精炼、便于通读与留存。已有1499人学习该资源适合需要全面把握大模型数据体系、质量判定与供给策略的读者高效获取核心观点。1. 这份白皮书解决的不只是数据不够而是数据怎么用2024大模型训练数据白皮书是阿里研究院在2024年面向行业发布的研究报告主题集中在大模型训练数据的现状、质量评估、配比策略、版权治理和后续趋势。这两年做预训练和大模型微调的团队普遍有个体感公开网页语料的总量早就够了但真正能放心喂给模型的数据并不多。卡住进度的从来不是硬盘装不下而是清洗、去重、配比、合规这些环节缺少一套公开可参考的基线。白皮书的价值就是把散在各团队内部的经验拉到台面上给数据工程一个公共坐标系。适合正在搭数据管线、做领域预训练、准备微调数据集或上线商用模型的算法工程师和数据团队精读。2. 训练数据全景白皮书里拆出的五层框架大模型训练数据在磁盘上看起来就是一堆文本文件但工程上必须把它拆成五层来看来源、规模、质量、配比、生命周期。白皮书大量篇幅讨论的是这五件事之间的联动关系而不是孤立地讲数据越多越好。先把这层框架立住后面写过滤脚本、调采样权重、做审计表才有依据否则任何参数调整都像在碰运气。2.1 数据来源通用文本、代码、多模态与合成数据的占比逻辑训练数据的来源大致分成四类通用网页文本、代码语料、多模态数据、合成数据。通用网页文本提供世界知识和语言表达的多样性是底座代码语料提供逻辑结构、函数调用和指令遵循能力对模型推理能力的提升贡献明显多模态数据让模型学会把视觉、音频和语言对齐合成数据用来补充前三类覆盖不到的长尾场景比如特定领域的问答对、罕见格式的文档。白皮书讨论来源时的核心观点是不要只追求单一来源的量而要追求来源的多样性和可追溯性。模型在过度单一的数据上训练会记住该来源的句式模板而不是学到可迁移的知识。我一般把初始配比定在通用文本 70%、代码 20%、其余 10%但这不是终点只是起点。每个大类里还要继续分二级标签比如通用文本里分清百科、新闻、社区问答、论坛帖子代码语料里分清 Python、Java、C、汇编多模态里分清图文对、视频字幕、语音转写。二级标签的作用是让配比实验能精细到子类否则你只知道代码太多但不知道是哪种代码太多。来源管理在工程上要落到两个动作。第一个动作是给每个数据来源建立字段至少包括来源标识、抓取时间、语言、内容类型、许可标签。第二个动作是保留来源的版本快照每批原始数据压缩包要留存不能因为清洗后就删掉原始文件。原始数据占磁盘但它是排查问题的最后手段除非实在没空间否则不建议丢。2.2 数据规模与配比预训练、微调、对齐阶段各要多少数据规模要分阶段看。预训练阶段通常需要万亿 token 级别知识密度高、覆盖面广继续预训练或领域适配阶段需要百亿到千亿 token微调阶段要看任务类型分类任务几十万样本足够生成式任务通常要百万级指令样本RLHF 或 DPO 这类对齐阶段偏好对数据一般在十万到百万级。白皮书提醒的重点不是绝对值而是相对关系每个阶段的数据量与模型参数、训练轮数要匹配。这里有个常见误区以为微调阶段数据越多越好。实际上面向特定任务的微调数据量超过某个阈值后收益会快速饱和反而稀释预训练学到的通用能力。我见过团队把 500 万条旧任务数据一股脑塞进微调跑出来模型变偏科的情况。微调数据的质量排序通常优于数量尤其在指令数据上一条经过人工校验的高质量样本抵得上几十条爬来的问答。配比是整个数据工程里最需要实验的地方。白皮书给出的思路是按任务贡献度分配采样权重而不是按数据量分配。举例来说代码数据只占总量的 20%但代码任务对模型逻辑能力贡献高采样权重可以调到 30%。实操时要把数据分桶每个桶对应一类来源训练时按桶的权重决定采样概率而不是把所有数据混在一起随机抽。权重改完必须做小规模预演观察验证 loss 和任务分数权重不能拍脑袋定。2.3 数据质量评估从人工抽检到指标驱动质量评估是数据工程里最容易被当成玄学的环节。白皮书把质量拆成可测维度之后落地方案就有了。业界常用三层过滤启发式规则、模型打分、任务反馈。启发式规则先做物理拦截处理长度、重复率、字符占比这类硬指标模型打分用一个训练好的质量分类器给文本打分任务反馈最贵也最可靠拿过滤后的数据去训练小模型看下游任务跑分。三层过滤的定位要分清。启发式规则负责砍掉明显垃圾比如短文本、纯乱码、模板噪音质量分类器负责语法正确但内容空洞的软垃圾任务反馈负责最终验证因为前面两层都可能有偏差。很多团队只做到前两层效果不稳定时才想到第三层我建议从第一天就把任务反馈纳入流程哪怕只跑两三个任务也能让过滤效果有个量化结果。质量的定义高度依赖任务场景。面向编程问答的语料希望保留异常堆栈和报错信息哪怕句子不通顺面向中文创作的数据更看重文风和多样性术语密度反而不重要。所以质量过滤参数不建议全局一套强烈建议按数据来源分别配置。配置项至少包括最小文档长度、最大重复片段比例、是否保留代码块、语言占比下限、URL 占比上限。每次修改配置记录改动原因和过滤比例变化否则过两周就忘了当初为什么这么设。2.4 数据生命周期采集、清洗、标注、版本管理数据生命周期管理在工程里的地位相当于代码管理在软件开发里的地位。一个典型的数据生命周期包括抓取或采购、格式解析、清洗去重、质量过滤、配比采样、标注、版本快照。每个环节都应该有输入输出记录否则管道就是一个输入好数据、输出烂结果的黑匣子出了问题只能靠猜。白皮书在治理层面的建议落地下来就是三张表。来源表记录每批原始数据的出处、抓取时间、许可状态处理日志表记录每一步用了什么脚本、什么参数、过滤掉多少版本表记录某次训练用的数据版本、文件 hash、token 统计。三张表不复杂但能在模型效果异常时帮你快速定位是数据问题还是训练问题。我的习惯是每个处理步骤结束都生成一个 manifest 文件里面写清输入路径、脚本版本、参数、输出统计。训练时先打印 manifest 再开始跑步骤这样日志里永远有数据指纹。数据版本号建议用日期加序号比如 clean_20241201_v2避免final_v3这类名字三个月后你根本分不清哪个是真正的最终版本。注意数据版本管理不是做完再补的文档而是每次清洗跑完后顺手生成。批量脚本里加三行写 manifest 的操作成本几乎为零。3. 从白皮书到生产线一套可复用的数据工程基线框架有了接着是能抄作业的落地路径。这一章的流程在单机上就能跑通换到集群只是把单机步骤并行化。无论数据量是几万条还是几十亿条流程骨架都一样差别只在资源调度。无论你是要训练自己的数据集还是拿公开语料做领域预训练这套基线都可以直接套用。3.1 清洗与去重从原始语料到干净语料的最小流程清洗的最小流程建议按五步走。格式统一把 HTML、PDF、DOCX、Markdown 全转成纯文本转的时候保留段落结构不要无脑拼接。编码修正处理乱码和 mojibake中英文语料里多尤其要检查 GBK 和 UTF-8 混存的情况。噪音过滤删掉导航栏、版权声明、Cookie 弹窗等模板文本。正文抽取对网页数据用正文抽取算法拿正文而不是整页 DOM 文本。句子切分按语言分别切分中文按句号和段落英文按句子边界为后续去重和采样做准备。去重分两级。精确去重用 hash 或 Bloom Filter 找出完全相同的文档通常能删掉 5% 到 10% 的冗余。近似去重用 MinHash 生成文档签名识别大部分相同但有少量噪音的重复通常能再删 20% 到 30%。近似去重的阈值控制相似度判定常见做法是阈值设为 0.8含义是两篇文档 80% 以上特征相同就算重复但上线前必须抽样验证因为不同领域的重复特征分布差异很大。去重顺序很关键必须先做精确去重再做近似去重最后做质量过滤。顺序反了垃圾文本先被过滤、再拿去去重会让近似去重误判大量合法文档。每次去重后记录删除比例比如原始 1000 万条精确去重后 800 万近似去重后 550 万这些数字是调整抓取策略和过滤器的重要信号。3.2 质量过滤三个必须调的参数质量过滤有三个参数几乎每个项目都要碰。最小长度阈值按文档级设置一般短于 50 个字符的文档直接丢弃但短对话和搜索日志类语料阈值要降到 20长文类可以提到 100。建议先算语料的长度分布取 P20 分位数作为初始阈值再根据任务反馈微调而不是拍脑袋定。困惑度阈值按句子级设置用来识别语法通顺但语义混乱的文本。中文网页语料的困惑度范围常见在 50 到 150超过 300 的句子需要格外警惕。困惑度过滤绝对不能用在代码语料上代码的分布和自然语言差异太大同一个模型打分会把合法代码当异常文本。如果语料混着自然语言和代码务必按来源分流各跑各的过滤。质量分类器得分阈值是最灵活也最容易翻车的一层。分类器输出 0 到 1 分0.7 是常见初始阈值但分类器受训练标注分布影响很大标注集合里中文样本少同样的阈值就会误杀高质量中文。每次更新标注版本都要抽样回看阈值附近的样本确认误差方向是过杀还是漏放。建议在日志里记录阈值 0.7过滤掉 32%抽样 200 条误杀率 12%这样的明细而不是只记一个结果。三个参数的联动关系也要注意。最小长度阈值加大会让短文本和低质量长文本的比例失衡困惑度阈值收紧会让语料往过于常见的方向内卷分类器阈值调高则可能把长尾领域知识全部过滤掉。所以每次只动一个参数动完跑一次任务反馈减少变量干扰。3.3 配比实验小规模预演确定混合比例配比是数据工程里最需要实验支撑的部分。推荐的做法是准备 5 到 6 个候选配比方案每个方案用相同的数据总量跑一轮固定参数的小模型预训练对比验证分数。总量固定是为了让效果差异来自配比而不是来自数据量小模型选 1B 左右是因为它能在有限显存里跑更多训练步数配比差异更容易暴露。验证任务要覆盖语料的主要来源。至少要有知识问答、代码生成、指令跟随、长文本理解四个方向再多加一个领域任务比如金融、医疗或法律问答看你业务倾向。每个任务选 3 到 5 个子指标记录到一个对比表里配比实验结束后按加权平均排序。如果最优方案与初始方案差距小于 1 个点说明初始配比已经够用不必再烧一轮更大的实验去追那 0.5 个点如果差距明显要往回看是哪个来源拖了后腿针对性调整。配比实验有一个隐含坑过度拟合验证任务。如果验证任务本身不够多样实验可能找到一个只在验证集上占优势的配比。缓解办法是保留一份留出任务集只在最终决胜轮使用平时不参与配比比较。这样选出来的配比才更接近真实上线表现。3.4 数据版本管理一张表记录九个字段版本管理建议至少记录九个字段数据集名称、版本号、创建时间、来源描述、token 总数、文件数、清洗参数 hash、过滤阈值、备注。token 总数用于规划训练时长文件数用于估算加载效率清洗参数 hash 用来确认这次数据经过的每一步处理。版本号规则用日期加序号比如 train_common_20241201_v2。目录名就叫这个版本号数据文件放在里面训练脚本从 manifest 读路径而不是把路径硬编码在脚本里。manifest 文件就是上面说的九个字段的 JSON 或 YAML和脚本一起进 git。数据文件太大不进 git但 manifest 必须进这样任何人 checkout 代码后都能知道要到哪里找数据。旧版本数据不要覆盖。清洗会迭代但上一版数据至少要保留到下一版验证通过之后再清理。磁盘再紧张也要留最近两个版本因为翻车的时候你最需要的就是那个你觉得有问题的旧版本。4. 版权、隐私与合规白皮书划了方向落地清单在这白皮书在版权和治理上会给出方向性的建议但不会替你把合规动作写进制度。实际操作中版权清洗、隐私脱敏、合规审计这三件事必须变成训练流程里的固定工序否则模型上线前会有一堆不确定风险。这一章给出可执行的落地清单按顺序做。4.1 版权风险分级三档标签和一套清洗动作把语料打上版权标签是第一步分三档已经够用。第一档明确许可包括开源代码仓库、开放数据集、作者声明 CC 协议的内容第二档需确认包括网页文章、学术论文、新闻稿这些内容在特定用途下可能有合理使用空间但需要人工确认使用方式第三档高风险包括电子书全文、付费订阅内容、数据库打包导出。执行时我跟团队的方法是来源表里加一个 license_level 字段打标用脚本加抽检。先用一个来源名单自动给大部分数据打标覆盖不到的按域名规则映射到默认档然后抽检 1% 到 2% 的样本人工复核修正误标。高风险档的数据直接不进训练集或者只进内部评估集需确认档的数据限制在非商用场景。这里有一个容易踩的边界从某个开源数据集下载的数据不代表它的所有子集都开源。很多聚合数据集只整理了文本本身原始版权仍在原作者手里。所以拿到外部数据集第一件事是把它的许可证链条理清楚不是看首页写了 free download 就算完。版权清洗对数据量的影响要提前预估。常见做法是先用关键词列表标记高风险来源再看命中比例。如果按来源删掉 30% 以上的数据就需要检查是不是名单太宽改用来源加内容类型的复合条件比如只删电子书全文保留同一网站的新闻报道。4.2 隐私识别与脱敏检测节点和替换策略隐私数据检测建议放在质量过滤之后独立执行。原因是隐私识别对文本干净程度敏感垃圾文本里的电话和邮箱误报率远高于干净语料先清洗再检测识别准确率会高很多。脱敏的最小方案包含三步识别实体、替换实体、记录日志。识别优先覆盖这些类型手机号、座机号、身份证号、银行卡号、邮箱、地址、车牌号、微信号、网盘链接。正则表达式是第一步但中文语料里手机号格式不统一有 1 开头带空格、带横杠、带区号前缀建议先做格式归一化再匹配。身份证号更长建议配合校验位判断避免把一长串数字误判。替换不是删掉而是用占位符替换。手机号替换成 [PHONE]地址替换成 [ADDR]。这样做的好处是保留句子结构和语义位置模型学到的是这里有一个实体而不是把隐私原文背下来。日志要记录每类实体的替换次数方便评估覆盖率和误触发率发现某些来源的替换率异常高就回到该来源单独检查。一个容易漏掉的场景是 OCR 文本和语音转写文本里面的人名、公司名、地址经常是连续字符串没有空格和标点常规正则会漏检。对这类来源建议用命名实体识别补充一层再用规则判断是否包含敏感信号比如身份证号前后出现姓名“住址”等关键词。多模态数据的隐私处理同样是这个思路先把图像和音频转成文本再走同一套流程。4.3 合规审计表上线前逐项核对合规审计不是一次性动作建议每次训练前都过一次。审计表至少包含十项数据来源清单、许可标签统计、高风险数据占比、隐私检测版本、脱敏覆盖率、抽检比例、过滤参数 hash、数据 hash、审批人、审批日期。表格用在线文档或表格工具就能维护重点是要强制执行。审计的目的不是卡进度而是让每个操作可追溯。等模型效果出问题需要归因时审计表能快速锁定是数据环节出的岔子还是训练环节的问题不需要靠我记得当时……。这个习惯在白皮书里体现为治理框架落地就是这张表。每次训练前花二十分钟填完长期看是省时间不是费时间。审计表的执行粒度建议按数据集批次走而不是按整个训练任务走。一批新数据进来独立审计一次打上批次号。同一批次复用多次训练不需要重复审计只需在训练配置里引用批次号。这样既不会漏也不会因为流程繁琐导致大家应付了事。4.4 数据采购与外部数据集引入的合规步骤如果你的数据涉及采购或外部数据交换需要额外的合规步骤。第一步是收集对方的主体资质和许可证明确权链条完整第二步是明确授权范围是仅内部研究还是可以用于商业发布第三步是要求对方提供数据来源说明避免买到二手转包数据。合同条款要写清楚数据来源、用途、期限、违约责任这几项缺一不可。引入外部数据集后建议先做一轮本地扫描把大文件按来源拆分再走一遍上面说到的打标、检测、脱敏工序不能因为对方说是干净的就跳过。很多团队在这里翻车数据是从正规渠道买来的但中间混入了第三方抓取内容版权归属实际不清晰用完才知道出事。5. 训练数据实战常见问题与避坑五条踩坑记录数据工程里的问题往往不是一次性的而是反复踩。这五条是我和团队翻车频率最高的每一条都按现象、原因、解决三个层次写清楚读者可以直接对号入座。每条都是真实工作里撞过的墙写出来是希望你不用再撞一遍。5.1 去重过度重复文本泄漏到验证集现象训练 loss 一直降验证 loss 却在中途反弹下游任务分数始终上不去模型看起来像是过拟合了。原因去重时只对训练集执行了流程验证集是从原始数据直接抽的没有走同一套去重。验证集里大量样本和训练集重复模型其实是在记忆验证集真实泛化能力很差。解决验证集必须从去重完成后的数据里抽取。划分完成后抽样比较训练集与验证集的 MinHash 相似度重复率超过 0.5% 就重新划分。这个检查写进数据管道每次划分强制跑一遍不要省。5.2 质量过滤误删领域语料现象过滤后总数据量下降 40%下游代码生成任务分数明显变差。打开过滤日志发现大量技术问答被当成了垃圾文本。原因质量分类器是在通用中文语料上训练的对代码问答这类领域的分布不熟悉打分系统性偏低。困惑度过滤器同样对专业术语不友好技术文档里的术语组合在通用模型看来很陌生被判为异常。解决把代码语料从通用管道里拆出来单独设一套过滤规则保留含代码块的文档调低困惑度权重调高长度和代码标记占比的权重。改完之后用任务反馈对比而不是只看过滤比例。5.3 配比直接照抄开源模型翻车现象照抄某开源模型的配比训练整体 loss 降得很快但中文知识问答分数很差模型输出的中文句子很生硬。原因开源模型语料里英文占大头它的配比是围绕英文和代码任务调的。直接套用后中文语料在训练里被英文稀释相当于采样权重被压低。解决配比必须按自己的任务重设。先做语料占比分析统计中文、代码、英文、多模态的 token 占比再通过配比实验确认。目标如果是中文场景初始配比建议中文不低于 50%再用小规模预演验证。5.4 版权清洗后可用数据骤减现象加入版权过滤后可用数据从 100 亿 token 掉到 30 亿团队开始争论是不是过滤器太极端。原因版权过滤按来源域名删数据时是一刀切某些垂直领域的优质语料集中在高风险来源导致按比例看删得不多但按领域看几乎删光了。解决把过滤条件从来源细化成来源加内容类型。比如电子书全文删除但同一来源下的新闻报道保留。每个高风险类别处理完统计该类别覆盖的任务指标是否归零如果归零立即补充替代来源。5.5 数据版本混乱导致复现失败现象三个月前跑出很好效果现在想复现发现数据目录已被覆盖脚本里的路径指向了新数据集所有对比结论都失效。原因数据管线没有版本管理脚本直接读固定路径每次清洗输出覆盖上一批。不同成员各存各的目录连 token 总数都对不上。解决数据目录改成版本号命名训练脚本从 manifest 读路径日志里打印 manifest 内容。manifest 至少包含 hash、清洗参数、过滤阈值、统计数字。这个习惯能保证任何一次训练都有完整的数据指纹复现失败的概率会大幅下降。注意复现问题不是训练框架背锅九成是数据环节没留痕。先把数据指纹打进日志再谈复现。6. 把白皮书读成检查单三个验证方法与一个习惯白皮书是 PDF直接铺开读很容易变成读过就忘。第一步先做解析常见做法是用 PDF 解析工具拆成按页的文本再按关键词检索配比质量版权合成数据治理把与自己业务相关的段落摘出来整理成一张两列的表左侧是白皮书的建议右侧是对应到自家数据管线的动作。这样报告就从行业趋势陈述变成了待办清单放在项目文档里随时对照。第二个验证方法是把每条建议改造成训练前检查项。比如每批数据是否按来源记录许可标签质量过滤是否分来源配阈值验证集是否从去重后数据抽取。这些检查项都来自公开报告对内推行时容易被接受不会因为流程繁琐遭到抵触。第三个验证方法是每次数据清洗后跑一个固定的小模型基线。任务选 3 到 5 个有代表性的覆盖问答、代码、指令跟随记录分数变化。清洗的好坏不再靠感觉而是靠分数对比。调整过滤阈值时也依据分数而不是依据直觉这样每一次数据改动都有可量化的反馈。最后一个习惯每次训练开始前先把数据版本、清洗参数、检查单夹进训练日志。我翻车最多的几次事后追根溯源都败在没有留下数据指纹。现在我把这套流程做成固定动作数据工程才真正从玄学变成了工程。白皮书这类报告最好的用法不是读完写笔记而是把它变成项目里每个人都会定期打开的操作清单。希望帮到你。本文还有配套的精品资源点击获取
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。