🖼️ 图文卡片 🏠 返回首页
前沿科技洞见 · 2026-07-16

Thinking Machines 发布 Inkling,将自研开放模型接入 Tinker 与主流推理运行时

正在发生的事很多,这件帮你看过了

Thinking Machines 发布 Inkling,将自研开放模型接入 Tinker 与主流推理运行时

2026/07/16

Thinking Machines 于 7 月 15 日发布首个自研开放权重模型 Inkling。它采用稀疏混合专家架构,总参数 9750 亿,但每次推理只激活其中 410 亿;最长上下文为 100 万 token,预训练使用了 45 万亿个文本、图像、音频和视频 token。模型发布当天已经可以在 Tinker 中微调。[S1][S2][S3]

Inkling 采用 Apache 2.0 许可,提供 BF16 和 NVFP4 两种检查点,并列出 Transformers、SGLang、vLLM、TokenSpeed、Unsloth 等运行方式。这里的“开放权重”意味着企业可以取得检查点并选择自己的运行环境,不必只能调用厂商 API;它不等于部署门槛低。Hugging Face 估算,BF16 检查点约需 2TB 显存,体积较小的 NVFP4 版本仍约需 600GB,通常需要多卡服务器或集群。[S3][S4]

当前可以确认的是,Thinking Machines 已从替其他开放模型提供微调服务,扩展为同时提供自研模型、托管后训练和外部运行路径。还不能确认的是 Inkling 已适合企业生产:现有能力数据主要来自厂商,部分评测使用的检查点与发布版不同,也没有第三方同口径性能、持续负载成本或客户运行结果。对金融机构更合理的动作是安排限定范围的技术验证,而不是按参数规模直接替换现有模型。

Tinker 先搭好定制入口,Inkling 再把自研模型放进去

这次变化要从 Tinker 的起点看。2025 年 10 月,Thinking Machines 推出 Tinker 微调 API,平台负责分布式训练中的调度、资源分配和失败恢复,服务对象主要是 Qwen-235B-A22B 等第三方开放权重模型。两个月后,Tinker 全面开放,增加 OpenAI API 兼容采样,并把微调范围扩展到 Kimi K2 Thinking 和 Qwen3-VL 等文本、视觉模型。[S5][S6]

因此,Inkling 不是一个孤立的模型发布。Tinker 已经具备监督微调、强化学习、采样和视觉输入接口,Inkling 才能在发布当天直接进入现成的后训练流程。企业做概念验证时,可以在同一套环境中比较基础模型与业务数据微调后的版本,少搭一套分布式训练基础设施。[S2][S5][S6]

这也改变了 Thinking Machines 的产品边界。此前它控制的是定制接口,基础模型来自其他机构;现在它同时控制基础模型和托管定制入口,并让外部开源运行时承接自托管。这个组合已经形成,但并非完全本地的一体化平台:Tinker 仍是托管服务,自托管路径则依赖企业自己的硬件和运行工具。定制后的检查点能否完整导出,并在 SGLang、vLLM 等环境中保持模板、工具调用和多模态能力一致,仍需端到端验证。[S3][S5][S6]

开放权重增加了部署控制权,也把基础设施责任交给采用者

Apache 2.0 权重和多套运行配方给了企业更多选择。重视数据边界的机构可以把模型放在自有环境中,自己决定容量、日志和访问控制;如果只需要快速微调,则可以使用 Tinker 承担训练调度。开放在这里首先改变的是控制权,而不是自动降低总成本。[S2][S3]

600GB 至 2TB 的显存要求说明了这一区别。模型能够被下载和加载,只回答“能不能运行”;企业真正需要回答的还有目标上下文和并发下的吞吐、延迟、单位请求成本、故障恢复与日常运维。发布日的兼容配方没有提供这些结果,也不能当作生产服务等级承诺。[S3][S4]

现有材料同样不能支持模型强弱排名。Thinking Machines 明确表示 Inkling 并非发布时最强的开放或闭源模型,且部分官方评测使用了不同于发布版的检查点。缺少第三方对发布版的统一测试时,9750 亿总参数、100 万 token 上下文和多模态输入只能说明模型的设计与可测试范围,不能直接换算成金融业务质量或投资回报。[S2]

现阶段应验证定制增益和总成本,不应直接做生产替换

这套组合目前处于技术探索阶段:权重、定制入口和运行配方都已产品化,足以开始评估;第三方复现、企业后训练收益、生产稳定性和付费采用数据仍然缺失。判断 Inkling 是否适合某个机构,关键不是它是否开放,而是业务任务的质量提升能否覆盖训练、推理和运维成本。[S2][S3][S4]

AI 平台与模型工程团队可以做一个边界清楚的 PoC:使用同一份封闭业务数据集,比较 Inkling 基础版、Tinker 后训练版和当前在用模型;同时记录任务质量、显存、吞吐、延迟和运维复杂度。这个试验只适合已经具备至少约 600GB 显存测试资源,并完成敏感数据、模型权重和输出留存审查的团队。[S2][S3][S4][S5][S6]

技术采购和模型治理负责人则应暂缓把 Inkling 作为现有生产模型的直接替代。下一次决策更新至少需要两类信号:第三方在发布版检查点上复现能力、吞吐和长上下文结果,并给出 Tinker 后训练前后的同任务变化;Thinking Machines 明确定制检查点的导出、生产推理和服务等级边界,或出现可核验的企业部署。若这些结果同时证明质量提升和单位成本达到内部要求,再进入长期负载与合规验证;若无法复现,则不应扩大试验范围。

参考资料

图文卡片 ⬇️ 一键下载图文卡片