前沿科技洞见 · 2026-06-10
字节Lance 3B、小米MiMo、云知声U2同日发布:端侧AI轻量化模型突破三重门槛
正在发生的事很多,这件帮你看过了
2026/06/10
一、事件:三家公司同一天发布轻量化模型
2026年6月9日,字节跳动、小米、云知声三家公司各自发布了轻量化AI模型,参数规模集中在3B到10B区间:
- 字节跳动发布 Lance 3B,3B激活参数实现图像/视频理解、生成、编辑三合一,开源后冲上Hugging Face Trending第一(量子位)
- 小米披露 MiMo 推理数据,通用8卡GPU服务器上实现1000+ tokens/s,峰值1200 tokens/s,8秒生成网站(AI异类弗兰克)
- 云知声发布 U2 并提出"智能密度"指标,10B激活参数实现行业顶级任务表现,思考Token消耗降低约25%(甲子光年)
三家公司选择的路径不同,但共同指向同一个趋势:3B-10B参数区间的模型正在同时突破多模态、推理速度、任务质量三重门槛。
二、字节 Lance 3B:用3B参数做多模态统一
量子位的报道指出,Lance 3B的核心能力是在3B激活参数规模下,把图像和视频的理解、生成、编辑整合进同一个体系。开源后迅速登上Hugging Face Trending榜首。
关键事实:
- 参数规模:3B激活参数
- 能力范围:图像/视频理解、生成、编辑三合一
- 开源状态:已开源,Hugging Face Trending第一
- 核心意义:轻量模型不再只做单点能力裁剪,开始覆盖完整多模态工作流
三、小米 MiMo:推理速度破千tokens/s
AI异类弗兰克援引的数据显示,MiMo在通用8卡GPU服务器上实现了1000+ tokens/s的推理速度,峰值达到1200 tokens/s,且能在8秒内生成完整网站。
关键事实:
- 推理速度:1000+ tokens/s(峰值1200 tokens/s)
- 部署环境:通用8卡GPU服务器
- 实测表现:8秒生成网站
- 核心意义:把模型交互从"等待结果"推向"接近即时反馈",对端侧Agent和实时UI生成至关重要
四、云知声 U2:10B参数做到顶级表现,Token消耗降25%
甲子光年的报道提到,云知声U2以10B激活参数实现了行业顶级任务表现,同时把思考Token消耗降低了约25%。云知声为此提出了"智能密度"指标,把"单位参数产出多少有效智能"变成可比较的标准。
关键事实:
- 参数规模:10B激活参数
- 任务表现:行业顶级水平
- Token效率:思考Token消耗降低约25%
- 新指标:"智能密度"——单位参数的有效智能产出
五、三种路径的共同指向:端侧AI门槛正在降低
字节、小米、云知声三家公司的路线不重复,但互补:
| 公司 | 路径 | 降低的门槛 | |------|------|-----------| | 字节 | 能力统一 | 多模态模型部署成本 | | 小米 | 速度体验 | 实时交互的硬件要求 | | 云知声 | Token效率 | 推理成本与单位任务成本 |
行业竞争重心正在从"参数规模"转向"效率指标"。接下来需要观察的是:这些轻量化模型能否在真实商业场景中转化为持续付费——端侧多模态助手的用户留存、超高速推理的调用频率、智能密度提升对企业成本的影响。
参考来源