前沿科技日报 · 2026-09-13
模型进步的判断依据正在换轨——推理端压低内存与带宽成本,训练端引入世界模型和失败数据,评测端则转向防污染与持续外部核验。
2026-09-13 前沿科技洞见 · 日报
📊 今日关键数据
- 890 字节/Token:DeepSeek V4.1 Flash 的全局 KV Cache,为 V4-Flash 的四分之一。(来源:APPSO)
- 约 39 Token/s:FreeToken 在 RTX 4060 8GB 笔记本上运行 Qwen3.6-35B 的论文测试结果。(来源:AI前线)
- 89.4 → 19.1 分:Gemini 3.8 Flash 从 Terminal-Bench 2.1 切换到 4.0 后的得分变化。(来源:新智元)
- 84%:Motus2 材料报告的多机器人任务平均操作成功率。(来源:Lingowhale 专题)
- 3—4 倍:WMRL 用世界模型替代真实沙箱后宣称减少的训练计算量。(来源:HuggingPapers)
🔍 今日值得深读
DeepSeek V4.1 Flash 将全局 KV Cache 压至每 Token 890 字节
DeepSeek V4.1 Flash 的主干参数由上一代的 284B 增至 552B,但通过 CED、CSA2 与 Engram 等结构压低长上下文和解码开销;公开材料称其全局 KV Cache 仅 890 字节/Token,为 V4-Flash 的四分之一。
- 发生了什么:40 层网络被拆成 20 层因果编码器和 20 层解码器,解码端的全局记忆由编码器输出投影生成;多层共享 KV,并用 196B Engram 查表模块替代一部分计算。
- 为什么值得深读:Agent 会反复追加工具结果、频繁遇到缓存未命中,KV 占用与长输入预处理已成为真实部署成本,而不只是模型参数量的附属指标。
- 后续看点:需要在固定硬件、并发量和上下文长度下复测 217—507 Token/s 的公开结果,并核对 890 字节 KV 设计对长程任务准确率的影响。
来源:APPSO
FreeToken 让 RTX 4060 以约 39 Token/s 运行 35B MoE 模型
伯克利与 MIT 团队开源 FreeToken,针对消费级设备上 PCIe 带宽和主机内存延迟造成的 MoE 解码停顿,在 CPU 与 GPU 之间动态分配计算,并让权重传输与活跃层计算重叠。
- 发生了什么:q* 调度按实时互连吞吐量分配 Token 计算,快速权重格式、整层双缓冲和弹性显存管理共同减少缓存未命中的停顿;语义锚点检查点则复用 Agent 修改中间提示后的子序列状态。
- 为什么值得深读:论文基准称,RTX 4060 8GB 笔记本运行 Qwen3.6-35B 约 39 Token/s;相同 MoE 模型上,解码比 Ollama 和 llama.cpp 快 3—4 倍,预填充快 6—30 倍。
- 后续看点:现有结果仍需在 CPU 调度延迟、内存争用、多 Agent 并发和手工优化的 llama.cpp 配置下复现,才能判断闭式最优分配在真实设备上的稳定性。
来源:AI前线
Terminal-Bench 4.0 加强防作弊后,Gemini 3.8 Flash 得分由 89.4 降至 19.1
Terminal-Bench 4.0 用 66 道终端 Agent 任务重测模型:删除 8 道已被“刷穿”的旧题、大修 19 道、统一设置 8 小时上限,并用 35 条评分细则和对抗性作弊试验检查奖励漏洞。
- 发生了什么:Gemini 3.8 Flash 从 2.1 版的 89.4 分、182 个模型第 2 名,降至 4.0 版的 19.1 分、14 个模型第 12 名;同轮 Claude Mythos 5.1(max)、GPT-6 Astra、Claude Fable 5.1 分别为 60.9、57.7、55.8 分。
- 为什么值得深读:换题后的大幅重排不能单独证明“刷榜”,却清楚暴露了公开题型、相似训练环境与真实泛化能力之间的混淆;评测应记录任务可见性、对抗检查和版本差异。
- 后续看点:需要模型方披露训练数据构造方法,并由私有任务、全新代码环境和相同推理预算复测,区分题型适配、推理配置变化与真实能力退化。
来源:新智元
Motus2 把策略、模拟器与价值评估器合入一套世界模型
生数科技与清华团队推出 Motus2,以共享参数承载 world action model、动作条件世界模型和 value model,并用大规模第一视角数据、触觉与失败轨迹训练灵巧手策略;材料报告多机器人任务平均成功率为 84%。
- 发生了什么:策略学习偏向成功示教,模拟器则吸收遥操作和实际推理产生的次优、失败及少见状态;价值模型从多个候选动作中做 best-of-N,再用 DiffusionNFT 将评分反馈给策略。
- 为什么值得深读:它没有把失败数据当作清洗对象,而是用来补足模拟器对异常状态的覆盖,并把策略、预测和评价组成可迭代闭环。
- 后续看点:需核对 84% 的任务组成、机器人平台、基线、重复次数与触觉消融结果,以及共享权重是否会让三个目标相互干扰。
Odin Agent 宣称证明 Komlós 猜想,验证与署名节奏成为首要边界
一篇 18 页预印本《Vector Balancing via Directional Total Variation》称,Odin Automatic AI Research Agent 找到了 Komlós 猜想的证明,并给出约 7.52 的常数上界;这一结果目前仍是待学界核验的论文主张。
- 发生了什么:材料称该工作把此前的 Õ((log n)^(1/4)) 推进到与维数及向量数量无关的常数 3√(2π),论文由三位研究者署名,并声明证明由 Odin 发现。
- 为什么值得深读:数学结果的价值取决于逐步验证、方法提炼、前作引用和责任署名,自动研究 Agent 的产出速度已超过传统同行评议的验证吞吐量。
- 后续看点:关注差异理论专家对关键引理和常数界的独立检查、论文修订记录,以及作者如何披露 Agent 的搜索过程与人工介入环节。
来源:AI提效手册
吴佳俊用物理属性连接视觉、听觉与触觉
斯坦福助理教授吴佳俊在 ECCV 2026 演讲中提出,把几何、材质和刚度作为视觉、声音与触觉的共同坐标,面向新物体上声音和触觉数据稀缺的问题组织多模态学习。
- 发生了什么:PhysDreamer 从视频扩散模型蒸馏物理属性,WonderPlay 将物理仿真与视频生成结合为可交互 3D 场景,DiffImpact、RealImpact 和 DexSkin 分别延伸至声音渲染与低成本柔性触觉。
- 为什么值得深读:这条路线不是否定 Transformer,而是先用可解释的物理属性约束模态对齐,让少样本下的跨模态迁移有明确中间接口。
- 后续看点:需要比较共同物理表征与端到端融合在未见物体上的样本效率,并检验模拟到真实、材料识别和精细操作中的误差传播。
来源:AI科技评论
🔥 今日聚合动态
Anthropic 与 OpenAI 承诺向独立评估者开放接近员工级的系统访问
Anthropic CEO Dario Amodei 承诺,让第三方评估者长期、以接近员工的权限访问系统,以核查安全措施、报告事故并在训练期间评估模型对齐。OpenAI CEO Sam Altman 随后表示 OpenAI 也会采用这一做法,但细则尚待公布。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 首个承诺 | Dario Amodei | Anthropic 将提供永久、接近员工级的访问,覆盖措施核查、事故报告和训练期对齐评估。 |
| 跟进承诺 | Techmeme | Sam Altman 表示 OpenAI 将采取同类做法,后续公布更多信息。 |
- 互补信息:两家前沿实验室在同一天把外部评估从发布前测试推进到长期系统访问,但正式权限范围、保密约束和公开报告机制仍未给出。
- 后续看点:关注评估机构名单、可访问的训练与事故数据、发现问题后的披露权,以及承诺是否写入可审计政策。
📰 独立报道
AGI、Agent 与评测
ARC-AGI-4 将考察自主、开放式发明能力
ARC Prize 宣布 ARC-AGI-4 将把评测目标转向自主开放式创新,并继续开源;François Chollet 称团队已探索约一年,ARC 4 与 ARC 5 的若干方向正在形成,ARC 4 仍计划于明年第一季度发布。当前披露的是方向和时间表,任务设计、指标与基线尚未公开。
WMRL 用世界模型替代真实沙箱训练研究 Agent
亚马逊研究人员发布 WMRL,以世界模型模拟真实沙箱执行来训练强化学习研究 Agent。发布材料称,其训练计算量下降 3—4 倍,并在留出基准上超过采用真实执行的 GRPO;具体任务集、模型规模、硬件与失败类型仍需结合论文和代码复核。
Miles v0.1 开源前沿规模后训练全栈系统
Miles v0.1 面向大规模强化学习后训练开源,使用 SGLang 承担 rollout、Megatron-LM 承担训练,把生成与参数更新接入一套工程栈。当前正式材料只确认架构组合与开源发布,吞吐、扩展效率、训练稳定性和硬件条件尚未披露。
AI 战略与工程
Synaptrix 用 EEG 解码控制轮椅,进入早期可行性验证
Synaptrix Labs 以干电极头戴设备采集 EEG,并由端侧处理和 NeuroDiffusion 将信号转成低延迟控制指令,首个目标是方向、速度和制动等离散轮椅操作。公司已登记早期可行性研究、与哥伦比亚大学推进真实场景试验,并向 FDA 提交 Pre-Submission;非侵入式 EEG 的信噪比仍限制精细控制。
来源:DeepTech 深科技
资管金融与区块链
AI 耳机用语音完成充值、停车缴费与附近门店下单
未来智能在外滩大会演示 viaim 讯飞 AI 耳机:Agent 结合个人上下文、定位和授权,可完成 50 元话费充值、停车缴费及附近门店点单,无需打开手机 App。支付把硬件从记录与建议推进到执行,但预算、确认、权限和结果回写必须成为可审计工作流。
来源:AI组织进化论
印度启动 Demat 2.0 代币化债券试点
印度启动 Demat 2.0 代币化债券试点;正式材料显示,REC 与 L&T 各融资 500 crore(约 50 亿卢比),IIFL Finance 发行 25 crore(约 2.5 亿卢比)。该试点把债券发行放入代币化基础设施验证范围,后续需观察登记、结算、托管及与现有 Demat 账户体系的衔接细则。
来源:Tech in Asia
Revolut 确认攻击者借伪造政府请求获取客户数据
Revolut 确认,攻击者通过伪造政府数据请求造成客户信息泄露。公司已通知受影响客户,并向相关政府机构、执法部门和金融监管机构报告。事件暴露的不是传统账户破解,而是金融机构处理官方数据请求时的身份核验与人工流程风险。
来源:TechCrunch