🖼️ 图文卡片 🏠 返回首页
前沿科技洞见 · 2026-05-30

面壁智能联合清华开源 600B Token 中文合成数据集,MiniCPM5-1B 以 0.5GB 重量登顶 Artificial Analysis

资料提供:前沿科技研究部
正在发生的事很多,这件帮你看过了

面壁智能联合清华开源 600B Token 中文合成数据集,MiniCPM5-1B 以 0.5GB 重量登顶 Artificial Analysis

面壁智能与清华大学、OpenBMB 社区联合开源了两个数据集:Ultra-FineWeb-L3(全球最大规模中文合成预训练数据,总量 600B Token,中文超 200B)和 UltraData-SFT-2605(国内首次开源的千万级 SFT 数据)。同步发布的 MiniCPM5-1B 以 17.9 分登顶 Artificial Analysis 1B 级排行榜,INT4 权重约 0.5GB,可在手机和浏览器上运行。

一个模型能力边界取决于数据治理精度的实验

面壁智能在这次发布中公开了一个名为 L0-L4 的数据分级治理体系,将训练数据按加工深度分为五级:L0 是原始网页数据(PB 级,含大量噪声),L3 是经过合成和增强的高质量结构化数据(适用于退火和微调阶段),L4 是针对 RAG 应用编排的数据。

关键论点来自文章:不同训练阶段需要的数据类型根本不同——预训练前期需要广撒网注入常识,但退火和微调阶段需要高密度、逻辑强的数据才能激发推理能力。此前大部分团队的数据处理流程是"爬取→去重→过滤→训练",不区分训练阶段对数据质量的不同需求,本质上是对数据价值的浪费。

文章公布了验证数据:在数学领域,仅使用 100B Token 训练量,UltraData-Math 在 MATH 基准上比当时领先的 Nemotron-CC 4plus 高出 3.62 分,同时在 GSM8K、Math-Bench 全面领先。

L3 数据是怎么做出来的

Ultra-FineWeb-L3 的核心加工方法:使用 MiniCPM4 和 Qwen3 对已有 L2 精筛网页进行大规模 Q&A 生成和多风格改写,把原始的叙述性文本转化为结构化对话、多轮讨论和解释性问答形态。

文章用一个具体描述来解释这个转化的价值:原来的网页是"能看懂"的文本,转化后的数据变成了"能教会模型推理"的数据,因为它被重构为"提问—思考—回答"形式,使知识以可激活推理链条的方式存储。

600B Token 中,中文部分超 200B,英文部分超 400B。

SFT 数据开源,把推理秘方摆上台面

UltraData-SFT-2605 是千万级的通用 SFT 数据,覆盖数学、代码、知识和指令遵循四个领域,同时包含"深思考"(带完整推理链)和"非思考"两类样本。

文章特别指出其透明度价值:公开了从 Query 筛选、Answer 质量校验到与主流评测集全面去重的完整流程。以往,很多高性能端侧模型的 SFT 数据被视为商业机密,这次将千万级数据开放,是国内大模型领域少见的全流程透明化举措。

MiniCPM5-1B:0.5GB 登顶的具体机制

MiniCPM5-1B 使用 UltraData 系列数据从预训练到退火到 SFT 全链路验证。以 17.9 分登顶 Artificial Analysis 排行榜,全面超越 Qwen3.5-0.8B 和 LFM2.5-1.2B-Thinking。INT4 权重约 0.5GB,可在手机、浏览器甚至单片机上流畅运行。

文章将这个结果描述为数据分级治理体系的试金石:相同参数规模下,数据处理深度(L1→L3)的差异直接决定了模型能力边界,不是靠更大算力而是靠更精准的训练配方。


参考资料

图文卡片 ⬇️ 一键下载图文卡片