🖼️ 图文卡片 🏠 返回首页
前沿科技洞见 · 2026-07-20

腾讯混元 HiLS-Attention 把长上下文稀疏选择纳入语言模型训练

正在发生的事很多,这件帮你看过了

腾讯混元 HiLS-Attention 把长上下文稀疏选择纳入语言模型训练

2026/07/20

截至 7 月 20 日,腾讯混元 HiLS-Attention 的论文、代码入口和 7B checkpoint 已可检索。它把块级检索分数放进分层注意力的前向计算,让语言模型损失直接训练“该看哪些块”;公开的 7B checkpoint 采用 OLMo3 风格骨干,并继续训练约 500 亿 token。[S1][S2]

当前更稳妥的判断是:HiLS 推进了长上下文稀疏注意力从推理时删减计算,走向训练时学习选择,但没有证明训练期路线已经胜出。作者给出的极长检索和速度数据足以支持有针对性的复现;在独立复现、真实任务与统一成本测试完成前,它们不能被写成 4M 通用理解能力或生产服务承诺。对基础模型与推理平台团队,眼下的决策应是是否安排受控架构试验,而不是据此设定产品上下文上限或 SLA。

HiLS 的增量是让语言模型自己学习该看哪些块

长上下文的计算负担来自注意力需要处理大量 token 之间的关系。稀疏注意力的思路是只计算其中一部分;真正困难的并非“少算”,而是如何选出不能丢掉的信息。

HiLS 让块摘要、检索分数和块内注意力进入同一个分层计算过程。这样,语言模型预测错误产生的梯度可以直接调整块摘要与选择器,检索质量不再只由模型外部的固定规则决定。[S1] 这也是它相对于纯推理期优化的主要增量:模型团队可以用继续训练换取更贴近语言建模目标的选择方式。

代价同样明确。公开的 7B checkpoint 约用 500 亿 token 继续训练,并依赖自定义注意力代码与内核。[S2] 因而 HiLS 更适合能控制模型训练和服务栈的团队;只想在既有模型上快速降低推理成本的团队,迁移门槛会更高。

稀疏选择从服务时规则扩展到训练时学习,但路线尚未收敛

2024 年的 MInference 把优化重点放在推理阶段:它无需修改预训练或微调,而是为不同注意力头分配稀疏模式,并在线建立索引,主要加速 prefill,也就是模型读取整段输入的阶段。[S5] 同年的 SeerAttention 向训练侧迈进一步,用可学习 gate 预测块级稀疏;对已有模型,可以只训练这个 gate。[S4]

到 2025 年,Native Sparse Attention 把压缩、细粒度选择和局部窗口组合成可原生训练、与硬件执行协同设计的注意力机制。[S3] HiLS 随后把块检索质量更直接地交给语言模型损失学习。[S1] 这组独立事件说明,稀疏注意力的竞争对象已从“推理时怎样删减计算”扩展到“选择器怎样训练,以及训练目标如何与执行内核配合”。

这不是单一路线取代其他路线。MInference 无需继续训练,SeerAttention 只训练轻量 gate,NSA 和 HiLS 对注意力路径改动更深,各自对应不同的训练权限、迁移成本和服务条件。[S1][S3][S4][S5] 这些论文采用的骨干模型、训练预算、GPU、序列长度、任务和内核并不一致,论文中的速度数字不能拿来跨论文直接排名。

8K 到 4M 与 512K 加速是复现起点,不是生产承诺

HiLS 最醒目的质量结果来自作者对 345M 参数模型的实验。该模型训练长度为 8K,稀疏激活预算为 2K,局部窗口为 512 token,训练数据中还混入 5% 的 RULER 风格样本。作者把它测试到 4M,并报告 RULER 三项合成任务在 4M 时的得分:Single Needle 为 96,Multi-Key Multi-Query 为 89,Variable Tracking 为 43。[S1] 这三个数字说明模型在特定检索与追踪任务上能远超训练长度保留和调用信息,也同时显示不同任务的难度差异。

速度结果来自另一组条件严格限定的作者对照:345M 模型、单张 NVIDIA H800、batch size 1、bf16、chunk size 64、top-k 32、512-token 局部窗口、SGLang,HiLS 与全注意力双方都使用 Triton 注意力内核。在 512K 输入的 warm run 中,prefill 用时为 5.0 秒对 67.0 秒,即 13.5 倍;启用 CUDA graphs 后,单步 decode 中位延迟为 5.5 毫秒对 85.9 毫秒,即 15.7 倍。[S1] 对照中的全注意力没有采用厂商优化的 paged-attention,这也限制了数字向其他服务栈的外推。

上述质量和效率结果均为作者报告,尚无独立复现。RULER 的研究表明,模型在针检索上接近满分,仍可能随着长度增加和任务转向多跳、聚合而明显下降;合成评测本身也不能覆盖真实长文档、代码库和生产请求。[S6] 因此,8K 训练后在 4M 测得 96、89、43,不等于模型具备 4M 通用理解;512K 下的 13.5 倍 prefill 和 15.7 倍 decode,也不能跨论文、模型、硬件、并发或服务框架直接比较,更不构成生产 SLA 承诺。模型卡还明确把安全关键部署排除在适用范围之外。[S2]

下一季度应验证净收益,而不是追逐最长上下文数字

对负责长文档、代码库和研究检索模型的团队,HiLS 已具备进入受控实验的条件:论文说明了机制,7B checkpoint、代码和评测入口已经公开。[S1][S2] 但实验需要把比较口径锁定。较有决策价值的做法,是在同一 7B 骨干、相同训练 token 与硬件上,对 HiLS、无需训练的推理期稀疏方法和全注意力进行对照,同时记录复杂长程任务质量、prefill、decode、显存、内核兼容性以及继续训练成本。[S1][S2][S3][S4][S5][S6]

当前证据支持的只是“训练期可学习选择值得复现”,不支持 HiLS 已替代全注意力、RAG 或推理期稀疏优化。若统一条件下,无训练方法能保持相同质量与速度,或继续训练成本无法由服务节省回收,训练期选择的实际架构价值就会削弱。反过来,只有独立团队在非检索型长文档、代码、多跳和聚合任务中复现质量,并在不同硬件与并发下达到端到端成本门槛,极长上下文结果才有条件进入产品容量与 SLA 规划。

参考资料

图文卡片 ⬇️ 一键下载图文卡片