🖼️ 图文卡片
FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-07-27

MonkeyOCRv2 用像素重建保住文档细节,T-Rex 用独立高速触觉通路提升灵巧手操作,DeepSWE 则用原创任务重新拉开编码模型差距。

资料提供:前沿科技研究部
降低FOMO的每日信息交付

2026-07-27 前沿科技洞见 · 日报


📊 今日关键数据


🔍 今日值得深读

MonkeyOCRv2 把文档视觉编码器的差距单独测了出来

华中科技大学团队发布 MonkeyOCRv2,并在固定 Qwen3-1.7B、训练数据、优化设置和解码流程的受控实验中,只替换冻结的视觉编码器。MonkeyOCRv2-B 在 8 个文档理解基准上得到 57.2 分,比最强对照 OpenVision-B 高 13.2 分;低分辨率、乱序字符测试中,加入像素重建后准确率由 55.4% 升至 72.1%。

来源:机器之心

T-Rex 为触觉单开高速通路,灵巧手任务成功率升至 65%

李飞飞、Trevor Darrell、Jitendra Malik 等研究者参与的 T-Rex,把视觉、动作规划和触觉交给不同 Transformer 专家处理。模型在 12 项真实灵巧操作任务上的平均成功率为 65%,纯视觉强基线为 35%;去掉触觉输入后,成功率降至 42%。

来源:量子位

DeepSWE 用 113 个原创任务降低编码评测污染

Datacurve 构建 DeepSWE,由真实开源项目维护者从头编写 113 个长程软件工程任务,而不是从历史 PR 抓取题目。每个任务运行在隔离环境中,并由程序验证器检查可观察行为。去掉训练集污染后,模型得分不再扎堆,过度扩展任务范围和不验证自产代码等失败模式也更清楚。

来源:AI Engineer

RecGPT-V3 在淘宝上线,成交额提升 3.97%、服务成本下降 52.4%

阿里巴巴的 RecGPT-V3 将持续记忆、文本与商品联合对齐以及潜在推理放进同一推荐系统,并已部署到淘宝。披露结果显示,该系统让 GMV 提升 3.97%,同时把服务成本降低 52.4%。

来源:HuggingPapers

Token 中转市场把免费试用、开放端点和盗刷变成低价 API

一项调查梳理了低价大模型 Token 中转市场:运营者汇集多组 API 凭证,再通过代理向外转售调用额度。凭证来源包括滥用免费试用、借道未保护的客服机器人,以及盗刷信用卡或拒付攻击;买家则用它降低调用成本、绕过地域限制,或收集蒸馏数据。

来源:Vectoral · Simon Willison


📰 独立报道

🤖 AGI 前沿

异步强化学习按 Token 陈旧度动态收紧 PPO 更新

Staleness-Adaptive Trust Regions 根据每个 Token 的观测陈旧度调整 PPO 裁剪半径:数据越陈旧,更新范围越窄,以避免异步训练崩溃。披露的 AIME24 最佳成绩在延迟 1 时为 35.83,延迟 8 时为 34.79。

来源:HuggingPapers

棋类受控实验连接预训练损失与强化学习后的推理表现

一项以国际象棋为环境的受控研究发现,预训练损失可以预测强化学习后的表现;强化学习还会在困难棋题中发现预训练阶段没有给出的新正确走法。研究把“基座模型学到了什么”与“后训练新增了什么”放进同一可测环境。

来源:HuggingPapers

GigaChat Audio 支持两小时音频定位,开放模型与数据集

GigaChat Audio 将 GigaAM 编码器与 10B MoE 解码器结合,每次激活 1.8B 参数,支持语音识别、翻译、问答、情绪识别和时间定位。模型在两小时音频时间定位上取得 48.3 mIoU,并以 MIT 许可证开放。

来源:HuggingPapers

相机自运动为三维空间音频提供无标注监督

清华大学与密歇根大学团队用相邻视频帧估计相机旋转和平移,再把这些运动信号作为音频空间位移的监督。方法不依赖 360 度麦克风或人工方向标签,并在野外数据上学习声源方位;远距离声源仍存在稳定偏差。

来源:量子位

自我改进智能体综述区分模型参数与操作脚手架两条路线

一篇 97 页综述把现代智能体定义为“基础模型 + 操作脚手架”,并将自我改进分为参数更新,以及提示词、记忆、工具和控制逻辑的更新。后者更快且易回滚;前者能固化能力,但训练成本和能力退化风险更高。

来源:大模型智能

🏢 AI 战略与组织变革

102 万个 PR 显示 AI Agent 加快代码审查,但未同步改善质量

研究覆盖 207 个 GitHub 项目的 102 万个 Pull Request。结果显示,AI Agent 参与后审查速度加快,但审查质量没有随之稳定提高,团队仍需分别度量交付速度与代码质量。

来源:HuggingPapers

Loom 把失败测试写入独立状态链,供不同编码 Agent 接管

Valkor 联合浙江大学和伦敦大学学院团队开源 Loom。它把计划、代码变更、测试结果和未解决故障保存为聊天记录之外的结构化工程状态;会话中断或更换模型后,新 Agent 可直接读取状态并继续任务。

来源:AI提效手册

Seed-Evolving 评测显示固定模型 ID 降低升级摩擦,视觉验收仍需人工

Doubao-seed-evolving 通过固定模型 ID 接入按周更新版本。一组四任务实测覆盖仓库理解、长程规划、故障修复和游戏开发:模型一次生成 2445 行可运行代码,并在 Lexical 故障修复中优于 Seed-2.1-pro,但首版图片失效、视觉缺陷和关卡可玩性仍需人工验收。

来源:一深思AI

Poolside 披露 118B 编码模型训练中的合成数据与硬件故障

Poolside 用模板、补充上下文和难度控制生成代码训练数据,并由编排器剔除不合格样本。训练端要求相同模型副本在相同数据上返回一致数值,以暴露坏 GPU、张量并行精度错误和竞态造成的梯度损坏;这套流程已用于 118B 编码模型。

来源:AI Engineer

💰 资管与金融科技前沿

LLM-FADT 组合 7 月相对中证 500 超额收益 13.4%

华泰证券的 LLM-FADT 先让大模型补充研报标题新解、催化剂、潜在风险和收益指引,再由 FinBERT 生成特征、交给 XGBoost 选股。截至 7 月 24 日,组合当月相对中证 500 超额收益 13.4%,但 2026 年以来仍为 -1.1%。

来源:华泰证券金融工程

AI 将一辆高铁的碳足迹核算从四个月压缩到 19 小时

阳光慧碳披露,中车长春轨道客车一份约 3 万条物料的碳足迹清单,人工匹配排放因子需要四个多月;AI 建模和因子匹配将核算时间缩短到 19 小时。系统先推荐匹配结果,再由人工复核,准确性并非完全自动保证。

来源:虎嗅


图文卡片 ⬇️ 一键下载图文卡片