FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-09-13

模型进步的判断依据正在换轨——推理端压低内存与带宽成本,训练端引入世界模型和失败数据,评测端则转向防污染与持续外部核验。

降低FOMO的每日信息交付

2026-09-13 前沿科技洞见 · 日报

📊 今日关键数据

🔍 今日值得深读

DeepSeek V4.1 Flash 将全局 KV Cache 压至每 Token 890 字节

DeepSeek V4.1 Flash 的主干参数由上一代的 284B 增至 552B,但通过 CED、CSA2 与 Engram 等结构压低长上下文和解码开销;公开材料称其全局 KV Cache 仅 890 字节/Token,为 V4-Flash 的四分之一。

来源:APPSO

FreeToken 让 RTX 4060 以约 39 Token/s 运行 35B MoE 模型

伯克利与 MIT 团队开源 FreeToken,针对消费级设备上 PCIe 带宽和主机内存延迟造成的 MoE 解码停顿,在 CPU 与 GPU 之间动态分配计算,并让权重传输与活跃层计算重叠。

来源:AI前线

Terminal-Bench 4.0 加强防作弊后,Gemini 3.8 Flash 得分由 89.4 降至 19.1

Terminal-Bench 4.0 用 66 道终端 Agent 任务重测模型:删除 8 道已被“刷穿”的旧题、大修 19 道、统一设置 8 小时上限,并用 35 条评分细则和对抗性作弊试验检查奖励漏洞。

来源:新智元

Motus2 把策略、模拟器与价值评估器合入一套世界模型

生数科技与清华团队推出 Motus2,以共享参数承载 world action model、动作条件世界模型和 value model,并用大规模第一视角数据、触觉与失败轨迹训练灵巧手策略;材料报告多机器人任务平均成功率为 84%。

来源:Lingowhale 专题

Odin Agent 宣称证明 Komlós 猜想,验证与署名节奏成为首要边界

一篇 18 页预印本《Vector Balancing via Directional Total Variation》称,Odin Automatic AI Research Agent 找到了 Komlós 猜想的证明,并给出约 7.52 的常数上界;这一结果目前仍是待学界核验的论文主张。

来源:AI提效手册

吴佳俊用物理属性连接视觉、听觉与触觉

斯坦福助理教授吴佳俊在 ECCV 2026 演讲中提出,把几何、材质和刚度作为视觉、声音与触觉的共同坐标,面向新物体上声音和触觉数据稀缺的问题组织多模态学习。

来源:AI科技评论

🔥 今日聚合动态

Anthropic 与 OpenAI 承诺向独立评估者开放接近员工级的系统访问

Anthropic CEO Dario Amodei 承诺,让第三方评估者长期、以接近员工的权限访问系统,以核查安全措施、报告事故并在训练期间评估模型对齐。OpenAI CEO Sam Altman 随后表示 OpenAI 也会采用这一做法,但细则尚待公布。

视角来源核心信息
首个承诺Dario AmodeiAnthropic 将提供永久、接近员工级的访问,覆盖措施核查、事故报告和训练期对齐评估。
跟进承诺TechmemeSam Altman 表示 OpenAI 将采取同类做法,后续公布更多信息。

📰 独立报道

AGI、Agent 与评测

ARC-AGI-4 将考察自主、开放式发明能力

ARC Prize 宣布 ARC-AGI-4 将把评测目标转向自主开放式创新,并继续开源;François Chollet 称团队已探索约一年,ARC 4 与 ARC 5 的若干方向正在形成,ARC 4 仍计划于明年第一季度发布。当前披露的是方向和时间表,任务设计、指标与基线尚未公开。

来源:François Chollet · ARC Prize

WMRL 用世界模型替代真实沙箱训练研究 Agent

亚马逊研究人员发布 WMRL,以世界模型模拟真实沙箱执行来训练强化学习研究 Agent。发布材料称,其训练计算量下降 3—4 倍,并在留出基准上超过采用真实执行的 GRPO;具体任务集、模型规模、硬件与失败类型仍需结合论文和代码复核。

来源:HuggingPapers

Miles v0.1 开源前沿规模后训练全栈系统

Miles v0.1 面向大规模强化学习后训练开源,使用 SGLang 承担 rollout、Megatron-LM 承担训练,把生成与参数更新接入一套工程栈。当前正式材料只确认架构组合与开源发布,吞吐、扩展效率、训练稳定性和硬件条件尚未披露。

来源:HuggingPapers

AI 战略与工程

Synaptrix 用 EEG 解码控制轮椅,进入早期可行性验证

Synaptrix Labs 以干电极头戴设备采集 EEG,并由端侧处理和 NeuroDiffusion 将信号转成低延迟控制指令,首个目标是方向、速度和制动等离散轮椅操作。公司已登记早期可行性研究、与哥伦比亚大学推进真实场景试验,并向 FDA 提交 Pre-Submission;非侵入式 EEG 的信噪比仍限制精细控制。

来源:DeepTech 深科技

资管金融与区块链

AI 耳机用语音完成充值、停车缴费与附近门店下单

未来智能在外滩大会演示 viaim 讯飞 AI 耳机:Agent 结合个人上下文、定位和授权,可完成 50 元话费充值、停车缴费及附近门店点单,无需打开手机 App。支付把硬件从记录与建议推进到执行,但预算、确认、权限和结果回写必须成为可审计工作流。

来源:AI组织进化论

印度启动 Demat 2.0 代币化债券试点

印度启动 Demat 2.0 代币化债券试点;正式材料显示,REC 与 L&T 各融资 500 crore(约 50 亿卢比),IIFL Finance 发行 25 crore(约 2.5 亿卢比)。该试点把债券发行放入代币化基础设施验证范围,后续需观察登记、结算、托管及与现有 Demat 账户体系的衔接细则。

来源:Tech in Asia

Revolut 确认攻击者借伪造政府请求获取客户数据

Revolut 确认,攻击者通过伪造政府数据请求造成客户信息泄露。公司已通知受影响客户,并向相关政府机构、执法部门和金融监管机构报告。事件暴露的不是传统账户破解,而是金融机构处理官方数据请求时的身份核验与人工流程风险。

来源:TechCrunch