前沿科技日报 · 2026-08-04
Qwen3.8 把长程自主编程推进到 16 天;TurboVLA 绕过大语言模型实现 32Hz 机器人控制;美国政府据报拟让 AI 实验室在模型发布前自愿提交审核。
2026-08-04 前沿科技洞见 · 日报
📊 今日关键数据
- 16 天:Qwen3.8 从空目录开始连续自主编程约 16 天,完成自进化智能体框架 oh-my-cli(来源:AI前线)
- 32Hz:TurboVLA 在 RTX 4090 上以 31.2ms 延迟完成在线动作预测,运行显存为 0.9GB(来源:机器之心)
- 69.7%:约 30 亿激活参数的 Orchard-SWE 在 SWE-bench Verified 达到 69.7%,价值模型重排序后为 73.0%(来源:BAAI 智源)
- 5.8 万人:墨西哥国立自治大学 AI 远程监考异常后,约 5.8 万名申请者需重新考试(来源:Ars Technica)
- 74%:外部测试中,Codex Security 报告的 31 个问题有 23 个经人工确认(来源:AI信息Gap)
- 1700 万帧:ACE-Data-0 覆盖 200 个真实家庭任务,为具身模型提供连续操作数据(来源:InfoQ 中文站)
🔍 今日值得深读
Qwen3.8 用 2.4 万亿参数模型连续自主编程 16 天
阿里发布 Qwen3.8-Max:模型采用稀疏 MoE 与混合注意力,总参数量 2.4 万亿、激活参数 950 亿,支持 100 万 Token 上下文。官方称模型从空目录出发连续运行约 16 天,完成并开源自进化智能体框架 oh-my-cli;API 已上线,模型权重预计下周开放。
- 关键事实:Qwen3.8-Max 在 PaperBench 得分 93.0,较上代提高 28.2 分;阿里真武 M890 超节点适配后,Agentic 推理性能最高提升 1.5 倍。
- 为什么值得深读:长程智能体的竞争对象已经不只是单次编码成绩,还包括跨周执行、反馈迭代、状态保持和成果复核。
- 后续看点:权重开放后,第三方能否复现 16 天自主项目,以及 100 万 Token 上下文与 950 亿激活参数的实际部署成本。
来源:AI前线
TurboVLA 绕过大语言模型,把机器人动作预测提到 32Hz
华中科技大学与华为提出 TurboVLA,让视觉与语言特征直接双向交互,再由轻量解码器并行输出连续动作,不再让每次动作预测都经过完整大语言模型。在单张 RTX 4090 上,模型以 0.2B 参数、0.9GB 显存和 31.2ms 延迟实现约 32Hz 在线控制。
- 关键事实:TurboVLA 在 LIBERO 的 40 个语言条件任务上平均成功率为 97.7%;对比模型 π0.5 为 96.9%,参数量 3.4B、延迟 93.6ms。
- 为什么值得深读:这项工作把机器人控制的优化重点从压缩大模型,前移到重新设计视觉、语言与动作的连接路径。
- 后续看点:32Hz、0.9GB 显存和 97.7% 成功率能否在不同硬件、更多真实机器人任务及更长执行链上复现。
来源:机器之心
Orchard 用可复用环境训练跨任务智能体
Orchard 开源了一套跨软件工程、网页导航和个人助理任务复用的环境服务,并兼容 Codex、OpenClaw、ZeroClaw 等部署平台。其 Orchard-SWE 模型仅激活约 30 亿参数,在 SWE-bench Verified 上达到 69.7%,经价值模型重排序后为 73.0%。
- 关键事实:项目同时开放模型、训练数据和评估方法,并提供 Orchard-SWE、Orchard-GUI 与 Orchard-Claw 三套验证实现。
- 为什么值得深读:环境、数据管道和评估流程能否复用,直接决定智能体研究从单项演示扩展到多任务时的成本与可比性。
- 后续看点:社区能否在相同环境中复现 69.7% 与 73.0% 的结果,并测出跨任务迁移带来的实际训练成本变化。
来源:BAAI 智源
美国政府据报拟引入模型发布前自愿审核
据报道,美国政府邀请 OpenAI、Google 和 Anthropic 等公司的员工代表赴白宫审议 AI 监管框架。框架拟建立自愿程序,让实验室在向合作伙伴和公众发布模型前先提交政府审核;会议由国家网络安全总监办公室主办,时间晚于行政命令设定的 8 月 1 日完成期限。
- 关键事实:受邀者预计以员工级代表为主,会议用于讨论框架后续工作,并非公开发布活动。
- 为什么值得深读:自愿的发布前审核若落地,将把政府介入点前移到模型公开之前,实验室需面对新的材料准备、保密与时间安排问题。
- 后续看点:最终文本如何界定自愿参与、提交材料、保密责任,以及该机制是否附带采购、认证或其他激励。
来源:FX168
GenOffice 用两层转换架构处理 AI 文档交付
Genspark 发布面向 Windows 和 Mac 的 GenOffice Alpha,本地客户端免费、开源且无广告。产品让 AI 先生成 Markdown 或 HTML,再由转换引擎输出可编辑的 Word 和 PPT,以减少模型直接处理复杂格式时产生的返工。
- 关键事实:Genspark 称首版客户端由一名工程师用一周完成,消耗约 1 万美元 AI Token;既有文档能力来自团队一年多的产品积累。
- 为什么值得深读:办公 Agent 的交付瓶颈落在格式兼容、版式稳定和本地上下文,而非只生成一段正确文字。
- 后续看点:Alpha 版在复杂排版、跨端兼容上的表现,以及开源社区如何维护长尾文档格式。
来源:Founder Park
AI 远程监考异常,5.8 万名考生需重考
墨西哥国立自治大学首次让近 16 万名申请者完全远程参加入学考试,系统采用锁定浏览器和 AI 摄像头监考。成绩分布随后明显偏离历史水平:得分达到 100 分以上的考生比例从 2021—2025 年的 3.5% 升至 16.3%,最终约 5.8 万名学生被要求重考。
- 关键事实:考试共 120 题,远程考试从 5 月下旬持续至 6 月上旬,异常首先体现在高分段。
- 为什么值得深读:自动监考一旦失效,影响的不只是识别准确率,还包括考试有效性、申诉成本和大规模重考安排。
- 后续看点:校方能否公开区分监考软件、考试环境与流程设计各自造成的偏差,并给出重考判定依据。
来源:Ars Technica
📰 独立报道
🤖 AGI 前沿
NVIDIA 发布开放式全双工语音模型 Nemotron VoiceChat
NVIDIA 在 Hugging Face 发布 Nemotron VoiceChat。模型支持全双工对话、工具调用、自然轮次切换和用户插话,把实时语音交互与智能体执行放进同一个开放模型。
长上下文推理的性能上限在训练前就被架构锁定
NVIDIA 指出,随着上下文从 4K 扩到 32K、128K,注意力在推理计算中的占比快速上升,单靠更快内核不足以解决瓶颈。分组大小、头维度、KV Cache 大小和并行策略会共同限制吞吐量与单用户响应速度。
来源:NVIDIA AI
TencentDB Agent Memory 用四层存储保存长期记忆
腾讯开源 TencentDB Agent Memory,以 L0—L3 分层存储和异步提炼把对话转成长期记忆。实测中,原始对话立即落盘,模型约 6 秒生成结构化卡片;检索可组合字面匹配和语义向量,但语义召回默认关闭。
来源:Datawhale
OpenAI 开源 Codex Security,测试样本命中率为 74%
OpenAI 开源代码安全工具 Codex Security,支持标准与深度扫描并可接入 CI/CD。一项针对 16.2 万行生产代码的外部测试中,工具报告 31 个问题,23 个获人工确认;同批测试中 Snyk 与 Semgrep 的命中率分别为 28% 和 20%。工具仍处研究预览阶段,已有扫描过程触发自身安全策略的报告。
来源:AI信息Gap
Anthropic 公布 Claude 在三类环境中的安全隔离架构
Anthropic 说明了 Claude 在 Web、开发和桌面环境中约束 Agent 行为的隔离架构。材料将安全边界落到不同执行环境,便于开发团队比较浏览、代码运行与本机操作各自需要的权限控制。
来源:InfoQ 中文站
GitHub Agentic Workflows 自动生成跨仓库文档 PR
Aspire 团队用 GitHub Agentic Workflows 把已合并功能转成跨仓库文档 PR,并配置范围受限的权限和专家审核。82 个 PR 全部合并,中位合并时间为 44.8 小时,提供了代码变更驱动文档更新的实测样本。
来源:GitHub
RLSVR 把开放任务改造成可验证的“谁是卧底”游戏
字节跳动 Seed 团队提出 RLSVR,将开放式任务转成“谁是卧底”式对抗游戏来产生可验证奖励,使模型无需外部裁判即可在摘要、创意写作和数学推理任务上自我改进;模型、论文与代码均已公开。
Mental World Modeling 把信念、欲望与情绪纳入世界模型
Mental World Modeling 认为,只记录物理场景的世界模型会在行为由信念、欲望或情绪驱动时预测错误。该框架将心理状态作为核心变量,并同步提供论文、代码、数据集和项目页面。
🏢 AI 战略与组织变革
AWS 计费故障产生数万亿美元账单预估
AWS 计费系统故障让用户收到数万亿美元级账单预估,其成本告警未能阻止影响扩大。事件暴露了云成本系统在异常值拦截、告警升级和面向用户展示之间的控制缺口。
来源:InfoQ 中文站
Cloudflare 统一数据平台中,计费工作负载占查询的 53%
Cloudflare 披露统一数据平台的查询构成,其中计费工作负载占 53%。这一比例说明,面向客户计量与结算的数据处理已是平台的主要负载之一。
来源:InfoQ 中文站
苹果再诉英国政府,拒绝为 iCloud 加密数据开访问通道
苹果于 7 月 13 日向英国调查权力法庭提出新挑战,反对政府以“技术能力通知”要求绕过 iCloud 高级数据保护。该功能覆盖短信和设备备份等数据;苹果已于 2025 年 2 月在英国下架该功能,但仍拒绝提供访问途径,听证会定于 9 月举行。
来源:华尔街见闻
💰 资管与金融科技前沿
贝莱德申请在 Solana 上发行代币化基金份额
贝莱德向美国证券交易委员会提交申请,计划在 Solana 上发行代币化基金份额,并推出 BlackRock Daily Reinvestment Stablecoin Reserve Vehicle。披露信息称,相关安排将把稳定币储备管理放到链上。
来源:Solana
Pluang 在印尼测试需逐笔确认的 AI 交易功能
Pluang 在印度尼西亚推出限量 AI 交易测试。每笔订单都需要用户确认,系统同时设置服务器端支出上限,以约束模型建议转成真实交易时的权限与资金风险。
来源:Tech in Asia
新加坡金融科技机构发布支付行为准则
新加坡金融科技行业机构发布支付行为准则,适用范围包括依据《2019 年支付服务法》提供受监管法币相关支付服务的豁免服务商,为不同牌照状态下的市场参与者补充统一行为要求。
来源:Tech in Asia
🎓 学术前沿
Paper-BibChecker 用多源比对筛查论文引用幻觉
MLNLP 发布开源工具 Paper-BibChecker,按标题、作者、年份、出版信息及 DOI、arXiv ID、URL 做多源交叉核验。结果分为通过、需核对、无法确认和疑似幻觉四类;工具只标记风险并保留证据,不会自动改写或删除 BibTeX 条目。
来源:大模型智能
ACE-Data-0 开源 200 个具身任务与 1700 万帧家庭数据
大晓开源 L5 级具身数据集 ACE-Data-0,覆盖200 个真实家庭任务和 1700 万帧数据,把家庭环境中的连续操作过程整理为机器人训练材料。
来源:InfoQ 中文站