前沿科技日报 · 2026-07-27
MonkeyOCRv2 用像素重建保住文档细节,T-Rex 用独立高速触觉通路提升灵巧手操作,DeepSWE 则用原创任务重新拉开编码模型差距。
2026-07-27 前沿科技洞见 · 日报
📊 今日关键数据
- 13.2 分:MonkeyOCRv2-B 在固定后端条件下,比最强视觉编码器对照高 13.2 分(来源:机器之心)
- 65%:T-Rex 在 12 项真实灵巧操作任务上的平均成功率,纯视觉强基线为 35%(来源:量子位)
- 113 个:DeepSWE 从头编写的软件工程任务数量,全部配有隔离环境和程序验证器(来源:AI Engineer)
- 3.97% / 52.4%:RecGPT-V3 在淘宝部署后披露的 GMV 增幅与服务成本降幅(来源:HuggingPapers)
- 102 万个:AI Agent 代码审查研究覆盖的 Pull Request 数量,来自 207 个 GitHub 项目(来源:HuggingPapers)
- 四个多月至 19 小时:AI 建模和因子匹配压缩一辆高铁产品碳足迹的核算时间(来源:虎嗅)
🔍 今日值得深读
MonkeyOCRv2 把文档视觉编码器的差距单独测了出来
华中科技大学团队发布 MonkeyOCRv2,并在固定 Qwen3-1.7B、训练数据、优化设置和解码流程的受控实验中,只替换冻结的视觉编码器。MonkeyOCRv2-B 在 8 个文档理解基准上得到 57.2 分,比最强对照 OpenVision-B 高 13.2 分;低分辨率、乱序字符测试中,加入像素重建后准确率由 55.4% 升至 72.1%。
- 关键事实:模型用图像到文本生成学习语义,再用像素级重建约束视觉 Token 保留字符、数字、公式和版面信息;重建解码器只参与预训练。
- 为什么值得深读:实验把后端变量锁定后,显示文档 AI 的错误可能在视觉入口就已形成,不能只靠更强语言模型补救。
- 后续看点:这一视觉编码器接入不同语言模型和真实财报、票据等高密度文档后,13.2 分优势能否保持。
来源:机器之心
T-Rex 为触觉单开高速通路,灵巧手任务成功率升至 65%
李飞飞、Trevor Darrell、Jitendra Malik 等研究者参与的 T-Rex,把视觉、动作规划和触觉交给不同 Transformer 专家处理。模型在 12 项真实灵巧操作任务上的平均成功率为 65%,纯视觉强基线为 35%;去掉触觉输入后,成功率降至 42%。
- 关键事实:T-Rex 用级联流匹配先完成低频动作规划,再注入高频触觉精修;VQ-VAE 将过去 16 帧力信号压缩为 64 个离散码字,以过滤漂移和噪声。
- 为什么值得深读:直接把触觉拼进 VLA 曾让成功率从 17% 降到 6%,问题不在“有没有触觉”,而在不同模态的频率和表征如何协同。
- 后续看点:三阶段训练在更多灵巧手本体和长任务上,能否继续保持对纯视觉方案的优势。
来源:量子位
DeepSWE 用 113 个原创任务降低编码评测污染
Datacurve 构建 DeepSWE,由真实开源项目维护者从头编写 113 个长程软件工程任务,而不是从历史 PR 抓取题目。每个任务运行在隔离环境中,并由程序验证器检查可观察行为。去掉训练集污染后,模型得分不再扎堆,过度扩展任务范围和不验证自产代码等失败模式也更清楚。
- 关键事实:DeepSWE 将“超出需求范围”单独计分,并检查模型是否实际测试自己写出的代码。
- 为什么值得深读:当模型可能见过公开 PR 时,榜单高分很难区分真实工程能力和记忆;原创任务改变了评测可信度。
- 后续看点:后续扩充任务数量时,维护者原创、隔离环境和抗奖励投机的验证器能否继续保持。
来源:AI Engineer
RecGPT-V3 在淘宝上线,成交额提升 3.97%、服务成本下降 52.4%
阿里巴巴的 RecGPT-V3 将持续记忆、文本与商品联合对齐以及潜在推理放进同一推荐系统,并已部署到淘宝。披露结果显示,该系统让 GMV 提升 3.97%,同时把服务成本降低 52.4%。
- 关键事实:模型是有状态的混合模态推荐器,会持续保留用户交互记忆,并共同处理自然语言与商品对象。
- 为什么值得深读:这组线上结果同时给出收入和推理成本,能直接检验大模型推荐器是否具备生产价值。
- 后续看点:技术报告后续是否披露流量范围、实验周期、延迟和长期记忆带来的数据治理边界。
Token 中转市场把免费试用、开放端点和盗刷变成低价 API
一项调查梳理了低价大模型 Token 中转市场:运营者汇集多组 API 凭证,再通过代理向外转售调用额度。凭证来源包括滥用免费试用、借道未保护的客服机器人,以及盗刷信用卡或拒付攻击;买家则用它降低调用成本、绕过地域限制,或收集蒸馏数据。
- 关键事实:中转服务常用 one-api、new-api 等合法开源代理软件做负载均衡,风险来自凭证来源和业务用途,而不是代理软件本身。
- 为什么值得深读:任何没有严格限额的公开 LLM 端点,都可能被纳入一条可变现的滥用链,损失不再局限于单次攻击。
- 后续看点:模型供应商能否为 API Key 提供可强制执行的周期金额上限,并在达到阈值时立即停止调用。
来源:Vectoral · Simon Willison
📰 独立报道
🤖 AGI 前沿
异步强化学习按 Token 陈旧度动态收紧 PPO 更新
Staleness-Adaptive Trust Regions 根据每个 Token 的观测陈旧度调整 PPO 裁剪半径:数据越陈旧,更新范围越窄,以避免异步训练崩溃。披露的 AIME24 最佳成绩在延迟 1 时为 35.83,延迟 8 时为 34.79。
棋类受控实验连接预训练损失与强化学习后的推理表现
一项以国际象棋为环境的受控研究发现,预训练损失可以预测强化学习后的表现;强化学习还会在困难棋题中发现预训练阶段没有给出的新正确走法。研究把“基座模型学到了什么”与“后训练新增了什么”放进同一可测环境。
GigaChat Audio 支持两小时音频定位,开放模型与数据集
GigaChat Audio 将 GigaAM 编码器与 10B MoE 解码器结合,每次激活 1.8B 参数,支持语音识别、翻译、问答、情绪识别和时间定位。模型在两小时音频时间定位上取得 48.3 mIoU,并以 MIT 许可证开放。
相机自运动为三维空间音频提供无标注监督
清华大学与密歇根大学团队用相邻视频帧估计相机旋转和平移,再把这些运动信号作为音频空间位移的监督。方法不依赖 360 度麦克风或人工方向标签,并在野外数据上学习声源方位;远距离声源仍存在稳定偏差。
来源:量子位
自我改进智能体综述区分模型参数与操作脚手架两条路线
一篇 97 页综述把现代智能体定义为“基础模型 + 操作脚手架”,并将自我改进分为参数更新,以及提示词、记忆、工具和控制逻辑的更新。后者更快且易回滚;前者能固化能力,但训练成本和能力退化风险更高。
来源:大模型智能
🏢 AI 战略与组织变革
102 万个 PR 显示 AI Agent 加快代码审查,但未同步改善质量
研究覆盖 207 个 GitHub 项目的 102 万个 Pull Request。结果显示,AI Agent 参与后审查速度加快,但审查质量没有随之稳定提高,团队仍需分别度量交付速度与代码质量。
Loom 把失败测试写入独立状态链,供不同编码 Agent 接管
Valkor 联合浙江大学和伦敦大学学院团队开源 Loom。它把计划、代码变更、测试结果和未解决故障保存为聊天记录之外的结构化工程状态;会话中断或更换模型后,新 Agent 可直接读取状态并继续任务。
来源:AI提效手册
Seed-Evolving 评测显示固定模型 ID 降低升级摩擦,视觉验收仍需人工
Doubao-seed-evolving 通过固定模型 ID 接入按周更新版本。一组四任务实测覆盖仓库理解、长程规划、故障修复和游戏开发:模型一次生成 2445 行可运行代码,并在 Lexical 故障修复中优于 Seed-2.1-pro,但首版图片失效、视觉缺陷和关卡可玩性仍需人工验收。
来源:一深思AI
Poolside 披露 118B 编码模型训练中的合成数据与硬件故障
Poolside 用模板、补充上下文和难度控制生成代码训练数据,并由编排器剔除不合格样本。训练端要求相同模型副本在相同数据上返回一致数值,以暴露坏 GPU、张量并行精度错误和竞态造成的梯度损坏;这套流程已用于 118B 编码模型。
来源:AI Engineer
💰 资管与金融科技前沿
LLM-FADT 组合 7 月相对中证 500 超额收益 13.4%
华泰证券的 LLM-FADT 先让大模型补充研报标题新解、催化剂、潜在风险和收益指引,再由 FinBERT 生成特征、交给 XGBoost 选股。截至 7 月 24 日,组合当月相对中证 500 超额收益 13.4%,但 2026 年以来仍为 -1.1%。
来源:华泰证券金融工程
AI 将一辆高铁的碳足迹核算从四个月压缩到 19 小时
阳光慧碳披露,中车长春轨道客车一份约 3 万条物料的碳足迹清单,人工匹配排放因子需要四个多月;AI 建模和因子匹配将核算时间缩短到 19 小时。系统先推荐匹配结果,再由人工复核,准确性并非完全自动保证。
来源:虎嗅