🖼️ 图文卡片
FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-08-04

Qwen3.8 把长程自主编程推进到 16 天;TurboVLA 绕过大语言模型实现 32Hz 机器人控制;美国政府据报拟让 AI 实验室在模型发布前自愿提交审核。

资料提供:前沿科技研究部
降低FOMO的每日信息交付

2026-08-04 前沿科技洞见 · 日报


📊 今日关键数据


🔍 今日值得深读

Qwen3.8 用 2.4 万亿参数模型连续自主编程 16 天

阿里发布 Qwen3.8-Max:模型采用稀疏 MoE 与混合注意力,总参数量 2.4 万亿、激活参数 950 亿,支持 100 万 Token 上下文。官方称模型从空目录出发连续运行约 16 天,完成并开源自进化智能体框架 oh-my-cli;API 已上线,模型权重预计下周开放。

来源:AI前线

TurboVLA 绕过大语言模型,把机器人动作预测提到 32Hz

华中科技大学与华为提出 TurboVLA,让视觉与语言特征直接双向交互,再由轻量解码器并行输出连续动作,不再让每次动作预测都经过完整大语言模型。在单张 RTX 4090 上,模型以 0.2B 参数、0.9GB 显存和 31.2ms 延迟实现约 32Hz 在线控制。

来源:机器之心

Orchard 用可复用环境训练跨任务智能体

Orchard 开源了一套跨软件工程、网页导航和个人助理任务复用的环境服务,并兼容 Codex、OpenClaw、ZeroClaw 等部署平台。其 Orchard-SWE 模型仅激活约 30 亿参数,在 SWE-bench Verified 上达到 69.7%,经价值模型重排序后为 73.0%。

来源:BAAI 智源

美国政府据报拟引入模型发布前自愿审核

据报道,美国政府邀请 OpenAI、Google 和 Anthropic 等公司的员工代表赴白宫审议 AI 监管框架。框架拟建立自愿程序,让实验室在向合作伙伴和公众发布模型前先提交政府审核;会议由国家网络安全总监办公室主办,时间晚于行政命令设定的 8 月 1 日完成期限。

来源:FX168

GenOffice 用两层转换架构处理 AI 文档交付

Genspark 发布面向 Windows 和 Mac 的 GenOffice Alpha,本地客户端免费、开源且无广告。产品让 AI 先生成 Markdown 或 HTML,再由转换引擎输出可编辑的 Word 和 PPT,以减少模型直接处理复杂格式时产生的返工。

来源:Founder Park

AI 远程监考异常,5.8 万名考生需重考

墨西哥国立自治大学首次让近 16 万名申请者完全远程参加入学考试,系统采用锁定浏览器和 AI 摄像头监考。成绩分布随后明显偏离历史水平:得分达到 100 分以上的考生比例从 2021—2025 年的 3.5% 升至 16.3%,最终约 5.8 万名学生被要求重考。

来源:Ars Technica


📰 独立报道

🤖 AGI 前沿

NVIDIA 发布开放式全双工语音模型 Nemotron VoiceChat

NVIDIA 在 Hugging Face 发布 Nemotron VoiceChat。模型支持全双工对话、工具调用、自然轮次切换和用户插话,把实时语音交互与智能体执行放进同一个开放模型。

来源:HuggingPapers

长上下文推理的性能上限在训练前就被架构锁定

NVIDIA 指出,随着上下文从 4K 扩到 32K、128K,注意力在推理计算中的占比快速上升,单靠更快内核不足以解决瓶颈。分组大小、头维度、KV Cache 大小和并行策略会共同限制吞吐量与单用户响应速度。

来源:NVIDIA AI

TencentDB Agent Memory 用四层存储保存长期记忆

腾讯开源 TencentDB Agent Memory,以 L0—L3 分层存储和异步提炼把对话转成长期记忆。实测中,原始对话立即落盘,模型约 6 秒生成结构化卡片;检索可组合字面匹配和语义向量,但语义召回默认关闭

来源:Datawhale

OpenAI 开源 Codex Security,测试样本命中率为 74%

OpenAI 开源代码安全工具 Codex Security,支持标准与深度扫描并可接入 CI/CD。一项针对 16.2 万行生产代码的外部测试中,工具报告 31 个问题,23 个获人工确认;同批测试中 Snyk 与 Semgrep 的命中率分别为 28% 和 20%。工具仍处研究预览阶段,已有扫描过程触发自身安全策略的报告。

来源:AI信息Gap

Anthropic 公布 Claude 在三类环境中的安全隔离架构

Anthropic 说明了 Claude 在 Web、开发和桌面环境中约束 Agent 行为的隔离架构。材料将安全边界落到不同执行环境,便于开发团队比较浏览、代码运行与本机操作各自需要的权限控制。

来源:InfoQ 中文站

GitHub Agentic Workflows 自动生成跨仓库文档 PR

Aspire 团队用 GitHub Agentic Workflows 把已合并功能转成跨仓库文档 PR,并配置范围受限的权限和专家审核。82 个 PR 全部合并,中位合并时间为 44.8 小时,提供了代码变更驱动文档更新的实测样本。

来源:GitHub

RLSVR 把开放任务改造成可验证的“谁是卧底”游戏

字节跳动 Seed 团队提出 RLSVR,将开放式任务转成“谁是卧底”式对抗游戏来产生可验证奖励,使模型无需外部裁判即可在摘要、创意写作和数学推理任务上自我改进;模型、论文与代码均已公开。

来源:HuggingPapers

Mental World Modeling 把信念、欲望与情绪纳入世界模型

Mental World Modeling 认为,只记录物理场景的世界模型会在行为由信念、欲望或情绪驱动时预测错误。该框架将心理状态作为核心变量,并同步提供论文、代码、数据集和项目页面。

来源:HuggingPapers

🏢 AI 战略与组织变革

AWS 计费故障产生数万亿美元账单预估

AWS 计费系统故障让用户收到数万亿美元级账单预估,其成本告警未能阻止影响扩大。事件暴露了云成本系统在异常值拦截、告警升级和面向用户展示之间的控制缺口。

来源:InfoQ 中文站

Cloudflare 统一数据平台中,计费工作负载占查询的 53%

Cloudflare 披露统一数据平台的查询构成,其中计费工作负载占 53%。这一比例说明,面向客户计量与结算的数据处理已是平台的主要负载之一。

来源:InfoQ 中文站

苹果再诉英国政府,拒绝为 iCloud 加密数据开访问通道

苹果于 7 月 13 日向英国调查权力法庭提出新挑战,反对政府以“技术能力通知”要求绕过 iCloud 高级数据保护。该功能覆盖短信和设备备份等数据;苹果已于 2025 年 2 月在英国下架该功能,但仍拒绝提供访问途径,听证会定于 9 月举行。

来源:华尔街见闻

💰 资管与金融科技前沿

贝莱德申请在 Solana 上发行代币化基金份额

贝莱德向美国证券交易委员会提交申请,计划在 Solana 上发行代币化基金份额,并推出 BlackRock Daily Reinvestment Stablecoin Reserve Vehicle。披露信息称,相关安排将把稳定币储备管理放到链上

来源:Solana

Pluang 在印尼测试需逐笔确认的 AI 交易功能

Pluang 在印度尼西亚推出限量 AI 交易测试。每笔订单都需要用户确认,系统同时设置服务器端支出上限,以约束模型建议转成真实交易时的权限与资金风险。

来源:Tech in Asia

新加坡金融科技机构发布支付行为准则

新加坡金融科技行业机构发布支付行为准则,适用范围包括依据《2019 年支付服务法》提供受监管法币相关支付服务的豁免服务商,为不同牌照状态下的市场参与者补充统一行为要求。

来源:Tech in Asia

🎓 学术前沿

Paper-BibChecker 用多源比对筛查论文引用幻觉

MLNLP 发布开源工具 Paper-BibChecker,按标题、作者、年份、出版信息及 DOI、arXiv ID、URL 做多源交叉核验。结果分为通过、需核对、无法确认和疑似幻觉四类;工具只标记风险并保留证据,不会自动改写或删除 BibTeX 条目

来源:大模型智能

ACE-Data-0 开源 200 个具身任务与 1700 万帧家庭数据

大晓开源 L5 级具身数据集 ACE-Data-0,覆盖200 个真实家庭任务和 1700 万帧数据,把家庭环境中的连续操作过程整理为机器人训练材料。

来源:InfoQ 中文站


图文卡片 ⬇️ 一键下载图文卡片