UltraX-Preview数据格式实战指南:raw_content与cleaned_content对照解析5列设计
UltraX-Preview数据格式实战指南raw_content与cleaned_content对照解析5列设计【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-PreviewUltraX-Preview是 OpenBMB 开源社区发布的大规模预训练数据精炼数据集合集基于自适应程序化编辑Adaptive Programmatic Editing对 5 个英文语料逐例精炼每个语料约 20B tokens。它的 UltraX 数据格式采用简洁的5 列设计uid、raw_content、cleaned_content、processed_functions、source其中raw_content与cleaned_content的原始 vs 精炼对照是整个数据格式的核心价值。本文带你快速看懂每一列的含义与实战用法。一、30 秒认识 UltraX 数据集 UltraX 不是端到端地改写文本而是训练一个轻量精炼模型预测结构化编辑操作插入、删除、修改再在原始文本上确定性地执行。最终产出的每个样本都完整保留了修改前和修改后两个版本——这正是 5 列设计的由来。仓库内置 5 个精炼后的英文语料数据集目录源语料说明分片数data/UltraX-FineWeb/FineWeb大规模 Common Crawl 网页语料104data/UltraX-RedPajama-V2/RedPajama-v2多源网页语料110data/UltraX-AICC/AICCHTML 解析的高保真网页语料61data/UltraX-Ultra-FineWeb/Ultra-FineWeb质量过滤的 FineWeb 语料104data/UltraX-FineWeb-ProX-Doc/FineWeb-ProX-Doc文档级精炼语料100每个目录下的文件都是标准 parquet 分片命名规则为数据集名-en-part-序号-of-总数.parquet例如 UltraX-FineWeb-en-part-0001-of-0104.parquet。二、5 列设计总览每一列都在回答一个问题 UltraX 数据格式中每个 parquet 文件都包含且仅包含 5 列均为 string 类型列定义可在 README.md 的元数据中核对列名类型回答的问题uidstring这条样本是谁——唯一标识raw_contentstring原文长什么样——精炼前的原始文本cleaned_contentstring精炼后长什么样——UltraX 处理后的文本processed_functionsstring具体改了哪里——应用的编辑操作sourcestring它从哪来——源语料名称 记忆口诀谁(uid) → 原来什么(raw) → 现在什么(cleaned) → 怎么改的(functions) → 哪来的(source)。三、raw_content 与 cleaned_content 对照解析 这是 UltraX 数据格式中最重要的两列直接构成一组天然的对照实验数据。raw_content原始文本的底稿内容UltraX 精炼之前的原始网页文本角色一切对照与审计的基准uid就是它的 MD5 哈希值用途需要复现原始训练效果如对比基线、或研究精炼前有哪些噪声时使用。cleaned_content精炼后的定稿内容经 UltraX 预测编辑操作并执行后的文本角色正式用于预训练的目标列——实验证明用cleaned_content训练的 1B 模型在 10 项基准上取得全部 5 个语料的最高平均分50 个任务-语料组合中赢下 34 个效果示例在 FineWeb 上UltraX 只用 16B tokens 即超过 Raw 与 ProX-C 用 20B tokens 的最终性能数据效率更高。如何理解两者的差异 两列的差异完全由processed_functions决定是确定性的编辑结果而非模糊的LLM 改写。典型差异形态删减型广告、导航栏、登录墙、版权声明等低价值段落被整段移除替换型行内噪声如乱码、模板占位符被就地替换为干净文本整篇处理型无价值页面错误页、登录墙被remove_all()整篇丢弃无操作型高质量文档执行keep_all()此时两列内容一致——这也是评估数据本底质量的便捷信号。想验证这一点只需在任意样本上对比raw_content与cleaned_content再用processed_functions逐条操作复原即可每一步都可复现、可审计。四、processed_functions从底稿到定稿的编辑脚本 ✂️该列记录了精炼模型预测并执行的操作序列函数空间详见 README.md只有 5 个函数含义keep_all()文档无需修改remove_all()整篇无价值如错误页、登录墙remove_lines(start, end)删除 start 到 end 的连续行含首尾replace_str(line, old, new)在指定行内替换子串add_line(base, sub_idx, content)在指定位置附近插入新行这种行级定位 小范围编辑的设计让 20B tokens 级别的精炼在工程上可靠执行滑动窗口推理、重叠感知聚合、歧义过滤等机制保障也让每条样本的改动逐行可追溯。五、uid 与 source让百万级样本可追溯、可筛选 ️uidraw_content的 MD5 哈希。天然去重键——若两个数据集分片中出现相同uid说明原始文本相同做数据配比、跨语料查重时直接用它即可。source源语料名称。把 5 个语料合并成一个大 parquet 训练时无需记文件名按source过滤/抽样/动态配比即可。六、实战上手两种加载方式 方式一直接从模型仓库加载推荐免下载大文件from datasets import load_dataset ds load_dataset(openbmb/UltraX, UltraX-FineWeb, splittrain) print(ds.column_names) # [uid, raw_content, cleaned_content, processed_functions, source]其余 4 个语料只需替换 config 名UltraX-RedPajama-V2、UltraX-AICC、UltraX-Ultra-FineWeb、UltraX-FineWeb-ProX-Doc完整配置见 README_ZH.md。方式二本地读取 parquet 分片克隆仓库后每个分片即一个标准 parquet 文件如 data/UltraX-AICC/UltraX-AICC-en-part-0001-of-0061.parquet用pandas.read_parquet或pyarrow.parquet均可直接读取按分片并行加载即可。七、使用建议与注意事项 ⚠️训练默认用cleaned_content需要与原始语料做消融对比时再切到raw_contentremove_all()样本的cleaned_content为空构建训练集前建议先过滤避免空文本进入 tokenize许可合规仓库基于 Apache 2.0 发布见 LICENSE但数据源自多个上游语料商用前请逐一核对各源数据集的许可条款更多细节管线流程、评测方法可查阅官方说明 README.md 与中文文档 README_ZH.md。掌握这套 5 列设计后你既能直接训练也能用raw_content/cleaned_content对照对精炼质量做抽样审计——UltraX 数据格式最贴心的地方就是把改了什么和为什么值得改都明明白白留给了你。【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-Preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考