尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

数据效率突破:UltraX如何用16B Token击败原始数据20B Token的训练效果

发布时间:2026/9/26 2:28:07

资讯中心
01
ARTICLE

数据效率突破:UltraX如何用16B Token击败原始数据20B Token的训练效果

数据效率突破:UltraX如何用16B Token击败原始数据20B Token的训练效果
数据效率突破UltraX如何用16B Token击败原始数据20B Token的训练效果【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-PreviewUltraX 是 OpenBMB 社区推出的大规模预训练数据精炼框架通过函数调用式的程序化编辑对网页语料逐条打磨。本仓库 UltraX-Preview 收录了 5 个经 UltraX 精炼的英文预训练语料各约 20B Token实验显示UltraX 精炼数据在 16B Token 时即超越原始数据 20B Token 的训练效果用更少 Token 换来更强模型。为什么数据效率是大模型预训练的核心难题大模型预训练的成本主要消耗在 Token 量上但更多数据 ≠ 更好模型原始网页语料信息密度低——导航栏、页脚、登录墙、错误页等样板内容占了大量篇幅粗暴过滤会误伤——按规则整篇丢弃容易连带删掉有价值的段落LLM 端到端改写——质量不可控、成本高且可能悄悄改变原文事实。UltraX 给出了第三条路训练一个轻量精炼模型为每条样本预测一组结构化编辑操作插入、删除、修改再在原文上确定性执行。既不是整篇丢弃也不是自由改写而是外科手术式的逐行编辑。五大编辑操作让每条样本被精准处理操作作用keep_all()文档无需修改remove_all()整篇无价值错误页、登录墙remove_lines(start, end)删除指定连续行replace_str(line, old, new)在指定行内替换子串add_line(base, sub_idx, content)在指定位置插入新行底层由LAM DCR 流水线支撑行级对齐映射LAM先对齐原文与精炼文本的行动态上下文替换DCR再把字符级编辑转成带唯一上下文锚点的可靠操作配合滑动窗口推理、歧义过滤、同行操作合并等机制保证在十亿级样本上稳定执行。更多技术细节见 README_ZH.md。五大精炼数据集每个约 20B Token 的预训练语料数据集源语料说明数据位置UltraX-FineWebFineWeb大规模 Common Crawl 网页语料data/UltraX-FineWeb/UltraX-RedPajama-V2RedPajama-v2多源网页语料data/UltraX-RedPajama-V2/UltraX-AICCAICCHTML 解析的高保真网页语料data/UltraX-AICC/UltraX-Ultra-FineWebUltra-FineWeb质量过滤的 FineWeb 语料data/UltraX-Ultra-FineWeb/UltraX-FineWeb-ProX-DocFineWeb-ProX-Doc文档级精炼语料data/UltraX-FineWeb-ProX-Doc/每个数据集由若干 Parquet 分片组成如 UltraX-FineWeb-en-part-0001-of-0104.parquet可直接用于大规模训练。实验证据16B Token 如何打赢 20B Token评估设置非常硬核使用1B 参数的 MiniCPM 模型从零预训练每个语料喂 20B Token在 10 个知识基准ARC-C、ARC-E、CSQA、HellaSwag、MMLU、OBQA、PIQA、SIQA、WinoGrande、SciQ上零样本评估直接对比 UltraX 精炼数据 vs 原始数据Rawvs ProX-C 文档级精炼 UltraX 在全部 5 个语料上取得最高平均分50 个任务×语料组合中拿下 34 个最佳 相比原始数据平均相对提升约2.00%相比 ProX-C 约1.53%多个数据集提升超 2%⚡ 最有说服力的数据效率结论在 FineWeb 上UltraX 训练到 16B Token 时平均分 45.49已超越原始数据与 ProX-C 训练满 20B Token 的结果45.08 / 45.05——相当于用约 80% 的 Token 预算打赢了对手直接省下约 1/5 的训练算力。背后的逻辑很直观精炼后的文本去掉了样板噪声每个 Token 承载的有效信息更多模型的学习速度自然更快。数据格式与快速上手每个 Parquet 文件包含 5 列结构清晰、便于审计列名说明uid唯一标识符raw_content的 MD5 哈希raw_content精炼前的原始文本cleaned_content经 UltraX 精炼后的文本processed_functions实际应用的编辑操作source源语料名称得益于processed_functions列你可以逐条核对模型到底改了什么这是规则过滤和端到端改写都做不到的可解释性。加载数据集只需几行代码from datasets import load_dataset ds load_dataset(openbmb/UltraX, UltraX-FineWeb, splittrain)总结UltraX 适合谁预算有限的预训练团队数据效率提升意味着更短的算力周期研究数据精炼的团队可复现的函数式编辑 完整的操作审计列想要开箱即用精炼语料的工程师5 个 20B Token 级语料即取即用。使用注意项目基于 Apache 2.0 协议 发布但语料源自多个上游数据集二次使用需自行核对各源语料的许可证。完整数据集说明请查阅 README.md英文与 README_ZH.md中文。【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-Preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。