前沿科技日报 · 2026-07-23
模型评测开始同时衡量交付正确性与呈现质量;端侧模型备案和量产数据让 AI 从演示走向设备;开发工具继续向 Agent 可直接调用的命令行接口迁移
2026-07-23 前沿科技洞见 · 日报
📊 今日关键数据
- 20%:阿里团队基于 DiT 模板 Token 的因果作用提出免训练剪枝规则,可减少 20% 注意力 FLOPs(来源:X · HuggingPapers)
- 836 Elo / 19.3%:Inkling 在 AA-Briefcase 的综合 Elo 为 836,规则得分为 19.3%(来源:X · ArtificialAnlys)
- 4200 万台:阶跃星辰披露 Step Edge 端侧轻量化模型累计装机量(来源:钛媒体)
- 7 个主要都市区:特斯拉披露 Robotaxi 在美国的覆盖范围(来源:X · elonmusk)
- 100 亿 Tokens:讯飞 MaaS 阶梯返利的全额代金券档位对应日均 Qwen 调用量(来源:AI信息Gap-公众号)
🔍 今日值得深读
阿里团队发现 DiT 模板 Token 维持对象身份,免训练剪枝减少 20% 注意力计算
阿里研究人员用因果可解释性方法分析扩散 Transformer(DiT),发现文本模板中的 Token 会充当隐式语义寄存器,在生成过程中维持对象身份。团队据此提出无需重新训练的剪枝规则,可削减 20% 的注意力 FLOPs,把机制解释直接转化为推理优化。
- 关键事实:模板 Token 对对象身份具有因果作用,基于这一发现的剪枝规则无需训练即可减少 20% 注意力计算。
- 为什么值得深读:这项工作把生成模型内部表征与算力开销连接起来,为不改参数的 DiT 推理优化提供了可验证路径。
- 后续看点:论文代码公开后,这一剪枝规则能否在不同 DiT 架构和复杂多对象生成任务中复现同等计算收益。
Inkling 在 AA-Briefcase 获 836 Elo,分析质量明显落后于呈现质量
Artificial Analysis 用 AA-Briefcase 测试 Thinking Machines Lab 的 Inkling。该基准要求模型处理数千个输入文件并交付表格、演示文稿和界面原型,再分别检查事实正确性、分析质量与呈现质量。Inkling 总 Elo 为 836,规则得分 19.3%;其呈现质量 Elo 为 863,分析质量仅 764,且在非 Excel、PowerPoint、PDF、Word 的“其他”文件类型上表现最弱。
- 关键事实:Inkling 的规则得分低于 MiMo-V2.5-Pro 的 21.4%,高于 DeepSeek V4 Flash max 的 18.7%;呈现与分析 Elo 相差 99 点。
- 为什么值得深读:面向知识工作的 Agent 评测正在拆分“做对”“分析好”和“交付得体”,单一总分会掩盖模型在不同工作环节的短板。
- 后续看点:Inkling 后续版本能否缩小分析质量与呈现质量的差距,并改善对非标准文件类型的处理能力。
手机端侧大模型首批备案落地,Step Edge 累计装机 4200 万台
国家网信办公布首批 7 款手机端侧大模型备案名单,苹果、华为、小米、三星等终端品牌在列,面壁智能是其中唯一以端侧模型能力参与备案的大模型企业。WAIC 期间,荣耀发布 Agentic OS,阶跃星辰披露轻量化 Step Edge 模型累计装机量已达 4200 万台。端侧 AI 的竞争对象已从模型演示扩展到备案、装机与软硬件协同。
- 关键事实:首批备案覆盖 7 款手机端侧大模型;Step Edge 累计装机 4200 万台。
- 为什么值得深读:备案资格与实际装机量开始成为端侧模型进入消费设备的硬约束,实时性、隐私和设备算力需要在同一产品里权衡。
- 后续看点:首批备案模型会把哪些推理能力留在设备端,以及 4200 万台装机中有多少转化为稳定的本地 Agent 使用。
来源:钛媒体
特斯拉启动 Cybercab 生产,Optimus 产线转入工厂建设阶段
特斯拉披露 Cybercab 已在得州超级工厂开始生产,Robotaxi 已进入美国 7 个主要都市区。公司还在停用 Model S 与 Model X 产线后,于弗里蒙特工厂启动 Optimus 生产设施建设,计划今年晚些时候投产;电池包产能仍是近期提高车辆产量的主要限制因素。
- 关键事实:Cybercab 已开始生产,Robotaxi 覆盖 7 个主要都市区,Optimus 计划于今年晚些时候投产。
- 为什么值得深读:自动驾驶和人形机器人都进入产线与区域部署阶段,软件能力能否转化为稳定产能和现场运营将接受同一套制造约束。
- 后续看点:Optimus 工厂能否按计划在今年投产,以及电池包产能限制会如何影响 Cybercab 的放量节奏。
来源:X · elonmusk
Unity 发布免费 CLI,Grok Build 直接调用工具生成可运行 3D 应用
Unity 推出面向编码 Agent、持续集成和自定义工具的免费命令行接口,并保留 MCP 支持;CLI 内置 MCP Mode,可接入现有 MCP Agent,材料称其 MCP 服务不设并发限制。一次公开演示中,Grok 4.5 通过 Grok Build 安装 CLI、创建 3D 场景并导出视频,同一会话还生成了可运行的 macOS 探索应用,并在场景负载过高后完成一次性能缩减。
- 关键事实:Unity CLI 与 MCP 均免费,CLI 可被编码 Agent 和 CI 直接调用;演示完成了场景构建、视频导出和可运行应用交付。
- 为什么值得深读:专业创作软件把能力暴露为命令行与 MCP 接口后,Agent 可以操作项目、执行构建并根据性能反馈修改产物。
- 后续看点:Unity CLI 在大型项目中的状态管理、构建稳定性和资产许可处理能否达到持续集成要求。
来源:X · elonmusk
📰 独立报道
🤖 AGI 前沿
Flova 把视频 Agent 设计对齐 Codex 与 Manus 的协作方式
视频 Agent 创业团队 Flova 首次公开介绍产品思路。创始人郭列称,团队重点研究 Codex、Manus 等通用与编码 Agent 的产品设计,核心工作是持续观察用户与 Agent 如何共同完成创作,再据此改进 Agent。郭列此前用 Midjourney、可灵和剪映制作一段三分多钟 AI 短片,耗时两周,这段经历促使团队尝试把多工具视频流程交给 Agent。
- 关键事实:Flova 从一段耗时两周的多工具短片制作经历出发,按用户与 Agent 的共同创作过程设计视频工作流。
- 后续看点:Flova 是否会公开其多工具编排方式,以及用户介入点能否随视频项目复杂度稳定收敛。
来源:BAAI 智源
Travis Kalanick 披露 Atoms 已低调建设近八年,目标是工业 AI
Travis Kalanick 在 a16z 访谈中首次系统介绍其重返公众视野前的工作:他用近八年建设 Atoms,把下一阶段技术机会放在软件之外的物理产业。其讨论范围覆盖机器人、自主系统、采矿、食品生产,核心设想是把软件、制造、地产与运输放入同一工业系统中。
- 关键事实:Kalanick 披露 Atoms 已建设近八年,方向集中在机器人、自主系统和实体产业数字化。
- 后续看点:Atoms 首批产品会落在哪个工业场景,以及公司将公开哪些可核验的部署与运行指标。
来源:a16z Podcast
🏢 AI 战略与组织变革
讯飞 MaaS 对百亿级 Qwen 调用返还全部实付代金券
讯飞 MaaS 平台推出阶梯返利:日均调用 Qwen 模型达到 100 亿 Tokens 时,可按实付金额全额返还代金券。返还额度可用于平台内六十多个模型,活动同时把 Qwen3.6-35B-A3B 作为支持多模态的高性价比模型推广。优惠改变的是大规模调用的实际采购成本,但返还形式并非现金降价。
- 关键事实:百亿 Token 日均调用档位可获得全额实付代金券返还,代金券适用于平台六十多个模型。
- 后续看点:返利结束后的实际单 Token 成本、代金券使用期限和百亿级调用的服务稳定性是否会被公开。
来源:AI信息Gap-公众号
💰 资管与金融科技前沿
美国财政部以模型蒸馏争议威胁制裁月之暗面
美国财政部在白宫声称月之暗面蒸馏 Anthropic 的 Fable 模型后发出制裁威胁。该事件把模型训练来源与蒸馏行为从公司争议推入政府处置范围,也加剧了华盛顿围绕中国开放模型进入美国市场的政策争论。正式材料未披露拟议制裁工具、证据细节或执行时间。
- 关键事实:财政部已发出制裁威胁,触发原因是白宫对模型蒸馏行为的指控。
- 后续看点:美国政府是否公布蒸馏指控的技术证据、适用的制裁工具及开放模型的具体限制范围。
来源:TechCrunch
🔧 硬件算力与智能设备
Starcloud 完成英伟达芯片在轨运行验证
Starcloud 已发射卫星并成功在轨运行英伟达芯片,把太空数据中心从概念推进到算力验证。现阶段仍需解决供电、散热和通信问题,正式材料也未给出在轨芯片型号、负载规模、运行时长或成本数据,因此距离可商业化的数据中心仍有多项工程指标需要补齐。
- 关键事实:Starcloud 已完成卫星发射和英伟达芯片在轨运行。
- 后续看点:Starcloud 是否公布芯片负载、持续运行时长、散热方案和星地通信带宽。
来源:全球风口-公众号