FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-08-29

长程智能体从“给出答案”转向可验证地完成工作,推理成本、持续学习和安全校准同时进入工程闭环

降低FOMO的每日信息交付

2026-08-29 前沿科技洞见 · 日报

过去 24 小时的新材料集中在三个变化:评测开始检查智能体真正改了什么、提交了什么,而不只核对回答;长推理通过裁剪中间 KV Cache 降低持续计算成本;模型又被用于校准其他模型、维护 Agent Harness 和构建可由 Lean 核验的数学工程。共同的约束也更清楚:可测目标能被快速优化,稀有错误、跨任务遗忘和长程执行失败仍需要独立验证。

📊 今日关键数据

🔍 今日值得深读

Prefix Sliding 移除中间推理缓存,128K 序列吞吐从 448 提至 5224 tok/s

斯坦福、华盛顿大学等团队提出 Prefix Sliding:固定保留任务前缀,只让最近 W 个推理 token 留在滑动窗口,更早的中间 token 退出后续注意力。方法无需重训,并配套面向 NVIDIA Hopper 的 FlashAttention 内核。

来源:PaperWeekly

Claude 在 48 小时和 1 块 GPU 内自动改进 10 类对齐缺陷

Anthropic 让 Claude 自主研究、提出方法、训练并测试小模型,目标是在不损害通用能力的条件下修复欺骗、谄媚等可测失配行为。

来源:Anthropic

CommerceAgentBench 用 107 项电商任务核验智能体实际交付,最佳通过率 61.7%

Accio 开源 CommerceAgentBench,覆盖采购、商品发布、运营、履约和售后;智能体需要跨浏览器、邮件、日历、文档、API 与文件操作,评分器检查实际保存、修改或提交的结果。

来源:Chubby / X

FormaTheoria 产出 99.4 万行 Lean 理论,开始核验有限单群分类的文献链

清华求真书院、丘成桐数学科学中心、智能产业研究院与华威大学团队构建 FormaTheoria:从原始文献追踪依赖、整合定义、生成形式化证明,再交给 Lean 逐步核验。

来源:量子位

Harness Continual Learning 让冻结模型通过提示、记忆、技能和工具持续演化

南京大学与伍伦贡大学研究者把持续学习对象从模型参数扩展到 Agent Harness,在基础模型冻结时更新任务接口、经验记忆、能力地图和执行组织等状态。

来源:AI提效手册

Perplexity Search 在统一 Agent Harness 中得分 80,领先原榜首 5 分

Artificial Analysis 用同一 GPT-5.6 Luna、同一开源 Stirrup Harness 和同一网页工具,仅替换搜索服务商,比较 Perplexity Search 的低、中、高三档上下文。

来源:Artificial Analysis

📰 独立报道

AGI 与智能体

腾讯开源混元 Hy4 preview:770B 参数、1M 上下文进入办公与编程产品

混元 Hy4 preview 将总参数从 295B 提至 770B、激活参数从 21B 提至 49B,上下文从 256K 扩至 1M。腾讯组织 163 名专家盲测 203 个工程任务,平均得分 2.99/4;模型还参与训练方法、数据策略、评估和算子优化,使推理吞吐较基线提升 31.8%。

来源:极客公园

智谱开放 GLM-5.3 权重,定位 Agent 编程与网络防御

智谱宣布 GLM-5.3 开放权重,可下载、本地运行和定制;官方将其定位为当前最强的 Agent 编程与网络防御模型,并同步给出 Hugging Face 权重与技术博客入口。后续需要由独立评测补齐具体基准、推理硬件、成本和网络安全能力边界。

来源:智谱 AI

EBR-bench 人类基线显示:AI 首局更强,但连续游玩后几乎不进步

Epoch AI 让参与者在与 AI 相近的文本界面上完成最多 10 次 Earthborne Rangers 长程任务。约一半人类最终超过 AI,几乎所有人都会随经验改善,最佳参与者 5 局后掌握游戏;已测 AI 初局常领先,却只出现轻微提升,显示跨回合学习仍是缺口。

来源:Epoch AI

RLHEV 把游戏引擎变成世界模型的可验证奖励源

RLHEV 提出用游戏开发过程生成世界模型后训练数据,以引擎产生的密集、可验证信号和人类验收反馈替代模糊的 CLIP 分数。材料同时提供论文与复现包入口;实际扩展价值仍取决于不同引擎、任务类型和人类验收成本下的复现结果。

来源:Hugging Papers

Claude 用 5 周协助推导任意近球形粒子的电泳迁移率,团队公开约 160 轮纠错记录

科罗拉多大学团队用 Claude Sonnet 4.6、Opus 4.6 和 Claude Code 辅助处理形状扰动、电场、离子云与流体响应的耦合推导,论文发表于《流体力学杂志》。首阶段计算未收敛,模型多次出错或编造;研究者公开关键对话,明确结果来自人类选定方法、持续质询与核验。

来源:DeepTech 深科技

工程、安全与产品

SeekMoon 用 MoonBit 工具替代 Shell,把智能体权限边界放进语言运行时

SeekMoon 提出“语言即沙箱”:智能体不直接拼写并执行 Shell,而通过 MoonBit 工具获得更细粒度、跨平台的能力边界。材料称 MoonBit 编译可达百毫秒级、分发体积较小;这一方案的关键检验是文件系统、网络和进程权限能否默认最小化并留下完整审计。

来源:CSDN 公众号

Cloudflare 发布 Kitesurf,向智能体提供专用浏览器引擎

Cloudflare 发布面向 AI 智能体的 Kitesurf 浏览器引擎,把网页访问作为 Agent 基础设施单独封装。正式材料未提供可比较的性能或安全指标;后续应关注其页面兼容性、反自动化处理、会话隔离,以及与通用浏览器自动化方案的资源开销差异。

来源:InfoQ 中文站

Meta 在数据中心测试机器人换线缆、重启服务器

Meta 正测试让机器人执行更换线缆、重置服务器等现场技术员任务。场景把具身智能带进高度标准化但容错要求严格的数据中心;决定能否规模部署的指标包括操作成功率、设备停机时间、远程接管频率和与现有运维流程的安全隔离。

来源:WIRED

Meta 限制遮挡提示灯后的眼镜录制,非自愿拍摄风险仍未消失

Meta 针对 AI 眼镜被用于非自愿录制的问题关闭一处规避路径,限制用户遮挡用于提醒旁人的 LED 后继续拍摄。这是设备侧隐私控制的具体修补,但仍需观察遮挡检测误判、旁观者知情机制,以及录音、云端处理和数据保留政策。

来源:Ars Technica

OCaml 项目漏洞传闻出现后数分钟即有利用尝试

剑桥大学教授、OCaml 核心维护者 Anil Madhavapeddy 报告,部分 OCaml 项目的安全问题刚出现线索,数分钟内就观察到利用尝试。事件说明漏洞发现与武器化窗口正在缩短;维护者需要更快完成私下披露、补丁分发、日志检测和依赖方通知。

来源:Simon Willison

资管金融与区块链

x402 过去 30 天承载 2310 万笔 Agent 稳定币转账,几乎全部使用 USDC

Token Terminal 统计显示,AI Agent 过去 30 天通过 x402 完成 2310 万笔稳定币转账,其中 Base 930 万笔、Solana 790 万笔、Polygon 540 万笔,几乎全部使用 USDC。数据说明机器支付已形成可观调用量,但未披露金额、独立 Agent 数、失败率和真实业务构成。

来源:Token Terminal

中国日均 Token 调用量二季度末升至 500 万亿,统计口径尚未统一

材料称中国日均 Token 调用量从 2025 年底的 100 万亿升至 2026 年一季度末 140 万亿、二季度末 500 万亿。不同厂商的分词、缓存、输入输出和跨境调用口径并不一致,因此该数字适合观察增长方向,暂不能直接换算为统一的 AI 产出或经济规模。

来源:虎嗅

硬件与算力

美国拟堵住经第三国数据中心远程使用受限 AI 芯片的出口管制路径

美国政府据报正在起草规则,针对中国公司通过泰国等第三国数据中心远程取得 AI 芯片算力的路径。若规则落地,管制对象将从芯片实物流向延伸到云端算力访问;具体影响取决于客户识别、算力转售、数据中心所在地和执行责任的定义。

来源:Techmeme / The Information 线索

全球数据中心年耗电约 415 TWh,电网开始讨论大型负荷专属成本

LSE 研究文章估算全球数据中心每年耗电约 415 TWh,占总需求 1.5%,到 2030 年可能升至 945 TWh;美国 PJM 批发电价过去一年从每 MWh 77.78 美元升至 136.53 美元。英国 Ofgem 拟向数据中心收取项目成本 2.5%–7.5% 的接网承诺费,讨论重点转向新增电网成本由谁承担。

来源:虎嗅 / LSE 研究解读