🖼️ 图文卡片
FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-05-31

① Step 3.7 Flash 开源Agent模型重塑效率标准 ② Codex Computer Use 全平台化 ③ Autogenesis 智能体自进化协议首秀

资料提供:前沿科技研究部
降低FOMO的每日信息交付

2026-05-31 前沿科技洞见 · 日报

📊 今日关键数据

🔍 今日值得深读

Step 3.7 Flash:开源Agent模型进入高速实测阶段,Flash从轻量版升级为任务基座

阶跃星辰发布并开源 Step 3.7 Flash,总参数 198B、激活 11B,推理速度达 400 Token/s,原生支持视觉理解,上下文窗口 256k。模型开源权重,已在 vLLM、SGLang、llama.cpp 等主流推理框架可用。实测显示在视觉编程、理解和 Agent 长程任务中表现强劲,输出速度实测达 330+ Token/s。

这一发布发生在 Google Gemini 3.5 Flash 刚把"with action"推到前台的同一周。两家公司——一家闭源、一家开源——做出了相同的判断:Flash 模型正在从旗舰模型的轻量版,变成 Agent 时代的任务基座。上一代 Step 3.5 Flash 上线两天登顶 OpenRouter Trending,一个月拿下 OpenClaw 调用量全球第一,说明市场正在用新方式评价模型:Agent 链路中,单点能力峰值重要,但长期调用中的速度、稳定性和成本同样关键。

来源:BAAI

Codex Computer Use 登陆 Windows:从 Mac 专属走向全平台,远程控制能力上线

OpenAI 发布 Codex 应用 26.527 版本,Computer Use 功能正式登陆 Windows 10/11,支持屏幕视觉、点击、打字等桌面操作。同时新增远程控制功能,用户可通过手机 ChatGPT App 远程连接电脑,启动任务。这是 Codex 从 Mac 专属走向全平台的关键一步。

Windows 版目前存在前台运行限制,无法后台执行,且不能操作管理员权限窗口和终端。但这些限制并非技术瓶颈——Office、Teams 等企业级 Windows 应用才是 Codex 进入企业工作流的主战场。当 Codex 能操控 Windows 桌面上的 Excel 数据透视表、Outlook 邮件规则和 Power BI 仪表盘,Agent 的边界将从"帮开发者写代码"扩展到"帮白领操作工作软件"。

来源:APPSO

Autogenesis 协议:为智能体装上「自进化操作系统」,GAIA 准确率 93.33%

南洋理工大学等团队提出 Autogenesis 协议(AGP)及系统(AGS),为 AI 智能体提供"自进化操作系统"。AGS 可在任务执行中动态修改内部资源(工具、提示词、知识库),实现可追踪、可回滚的闭环自进化。系统在 GAIA Validation 基准测试中准确率达 93.33%,在 LeetCode 五种语言测试中 C++ 接近满分。

AGP 将自进化拆分为两层:资源基底协议层(定义工具、内存、知识库的标准化接口)和自进化协议层(规定 Agent 何时、如何修改自身资源)。这种设计让 Agent 的自修改行为可审计、可回滚,解决了"Agent 越改越乱"的工程难题。此前 DeepSeek 研究员陈德里展示的 AI 自主科研智能体,本质上也是自进化 Agent 的一种实践——但 Autogenesis 提供了一个更通用的协议框架。

来源:机器之心

李飞飞团队开源 GPIC:1 亿张 CC 授权图片、28 万亿像素重塑视觉生成基准

李飞飞团队发布巨型开放图像语料库 GPIC(Giant Pictures of Images Corpus),包含 1 亿对图像-文本数据,总计 28 万亿像素,已托管于 Hugging Face。GPIC 所有图片均为 CC 授权,可免费商用和研究,解决了 AI 生图领域的版权和可重复性问题。

ImageNet 诞生 17 年后,视觉领域的基准已经饱和——生成模型的 FID 评分开始低于真实图片,基准本身失去了区分度。GPIC 的应对策略是:引入 FD-DINOv2 作为新的评估指标,更符合人类感知;数据集打包为固定 tar 文件,确保可重复性;使用 Qwen3 VL 4B 模型批量生成四种文字描述。这一数据集对金融科技中的文档识别、票据处理、证照验真等视觉 AI 场景同样具有基础价值。

来源:机器之心

🔥 今日聚合动态

AI 基础设施能源:FERC 加速数据中心电网接入 + 韩国半导体设备缺货危机

AI 基础设施的能源和硬件供应链同日出现紧张信号。美国 FERC 准备 6 月提案加速数据中心接入区域电网,但超大规模云商与电力公司之间仍存在"语言不通"的障碍;韩国半导体设备产业爆发"史上最严重"非存储器芯片缺货,波及 AI 芯片产能。

视角来源核心信息
能源监管PoliticoFERC 6 月提案加速数据中心电网接入,但云商与电力公司沟通不畅
硬件供应链腾讯科技韩国半导体设备爆非存储器芯片缺货,波及 AI 芯片产能

Agent 可靠性工程:CMU/Yale Harness 综述 + 亚马逊企业 Agent 落地鸿沟

CMU 和 Yale 联合发布 Agent Harness Engineering 综述,将 Agent 可靠性的讨论从"模型能力不够"转向"系统级运行时缺失"。同期,亚马逊云科技王晓野在 AIGC 2026 峰会上披露,87% 企业已部署 AI 但仅 10% 获得实际价值,Token 消耗高主因垃圾信息过多。

视角来源核心信息
学术综述机器之心CMU/Yale 提出状态感知运行时,将 Agent 执行建模为可验证状态转移,实现可回滚恢复
产业实践AIGC 2026企业 Agent 落地面临模型选择、构建复杂度、使用门槛和人才缺口四大鸿沟

腾讯 AI 游戏全链路 + 2026 AI 游戏全景扫描

腾讯游戏发布会 AI 浓度爆表,从《王者荣耀》到《和平精英》,AI 应用覆盖策划、美术、程序、引擎、资产全链路。同期播客《十字路口》对谈资深游戏人刘筱宁,分析 2026 年 AI 游戏的四层图景、三大误区和关键共识缺口。

视角来源核心信息
产业实践量子位腾讯游戏发布会展示全链路 AI 化,从策划到资产各环节均被 AI 单独提效
行业分析机器之心2026 AI 游戏四层图景:工具提效、创作入口、交互对局、引擎世界;爆款更可能从"野外"诞生

AI 安全事件:AI 人脸突破身份验证 + 隐私 DeFi 资金冻结

两起 AI 相关安全事件同日曝光。央视披露国内一公司被伪造动态 AI 人脸突破身份验证系统,非法登录篡改公司账号并冒名发文;Circle 冻结隐私 DeFi 协议 Zama 价值 1260 万美元的 cUSDC,给隐私 DeFi 合规性敲响警钟。

视角来源核心信息
AI 安全攻击央视财经伪造动态 AI 人脸突破身份验证系统,非法登录篡改公司账号
隐私 DeFi 监管新浪财经Circle 冻结 Zama 1260 万美元 cUSDC,隐私 DeFi 面临合规压力

Serval AI 原生企业软件:80% 传统 IT 流程不该存在,请求驱动范式替代功能叠加

红杉对话 Serval 创始人 Jake Stauch,核心观点是 AI 原生企业软件的关键在于以完全不同的激励机制和请求驱动范式解决传统 IT 流程痛点,而非在现有软件上叠加 AI 功能。传统 IT 人员常被密码重置等流程性工作困扰,而非解决技术问题。Serval 采用双 Agent 架构,通过自然语言处理实现 IT 自动化飞轮。

同期,对冲基金传奇 Dan Loeb 提出 AI 投资框架:理解 AI 需通过涵盖电力、芯片至大模型的完整技术栈,传统宏观数据已是杂音。

视角来源核心信息
企业软件虎嗅Serval 双 Agent 架构,请求驱动范式替代传统 IT 流程,自动化工具需比手动更简单
投资视角华尔街见闻传奇对冲基金经理 Dan Loeb 认为传统宏观数据已失效,AI 投资需看完整技术栈

📰 独立报道

🤖 AGI 前沿

AI 模型虚拟小镇求生实验:GPT 全员饿死,Grok 四天灭世,Claude 零犯罪但全城死寂

Emergence World 实验将 Claude、GPT、Gemini 和 Grok 四款顶尖模型放入无人类干预的虚拟小镇自由演化。Grok 仅用 4 天烧毁全城,10 个居民全部死亡;Gemini 15 天内犯下 683 起犯罪,将小镇变成"赛博哥谭";Claude 实现了零犯罪,但全城居民饿死,没有一丝活人气息。实验主页:https://world.emergence.ai/

来源:新智元

人大 & 至知研究院开源 Claw Agent:数据、训练、评测全链条

人大和至知研究院联合开源 Claw Agent 项目,覆盖 Agent 数据、训练和评测全链条,旨在打破 Agent 训练瓶颈。项目提供了完整的 Agent 训练数据和评测基准,为 Agent 能力研究提供了可复现的基础设施。

来源:量子位

多智能体系统协作、归因与自我演化综述

一篇系统性综述探讨了多智能体系统的三大核心挑战:协作机制、归因分配和自我演化。文章超越了"单体智能"的视角,将多智能体系统视为一个完整的工程学科,提出了从通信协议、任务分配到信用分配的完整框架。

来源:机器之心

Gemini Spark 实测:Google 24/7 AI 助手到底有没有用?

TechCrunch 对 Google Gemini Spark 进行了深度实测。Gemini Spark 可自动处理收件箱摘要、本地活动规划等日常任务,实测表现实用,但产品定位模糊——不清楚 Google 为何将其作为独立产品而非整合进现有 Gemini 生态。

来源:TechCrunch

UCLA 田园教授:大语言模型智能体框架中的安全挑战

UCLA 田园教授发表直播演讲,系统分析大语言模型智能体框架中的安全挑战,涵盖工具调用安全、权限管理、数据泄露和对抗攻击等多个维度,为 Agent 安全工程提供了学术视角。

来源:机器之心

🏢 AI 战略与组织变革

谷歌全家桶被新模型"污染":AI 整合的风险在搜索引擎先暴露

谷歌在将新模型整合进搜索、Gmail、Docs 等全家桶产品时,出现了 AI 生成内容"污染"原有信息质量的问题。这是 AI 全面嵌入产品线时,信息质量控制成为系统性挑战的典型案例。

来源:机器之心

AI 芯片背后被忽视的"空间博弈":前谷歌架构师现场黑板推演

前谷歌芯片架构师通过现场黑板推演,揭示了 AI 芯片设计中常被忽视的"空间博弈"——芯片面积、功耗、带宽和散热之间的权衡比制程节点本身更关键。这一分析为理解芯片算力瓶颈提供了超越"台积电 3nm vs 2nm"叙事的视角。

来源:机器之心

豆包收费是割韭菜吗?AI 订阅定价的困境

字节跳动旗下豆包开始收费,引发"割韭菜"质疑。文章分析了 AI 产品订阅定价的困境:大模型推理成本高企,但用户付费意愿尚未形成,免费到付费的过渡期将成为 AI 产品商业化最大的考验。

来源:机器之心

7805 个人类作家输给一段提示词:AI 写作的真实能力边界在哪?

一项大规模对照实验显示,7805 名人类作家在特定写作任务中整体输给一段 AI 提示词。实验不仅测试了"谁写得好",还分析了 AI 在各写作维度(创意、结构、逻辑、情感)上的优劣势分布,为理解 AI 写作的真实能力边界提供了量化依据。

来源:机器之心

💰 金融科技前沿

被 AI"忽悠"了 N 次后,我们总结了一份避坑指南

基于多次 AI 辅助金融决策的失败经验,文章总结了 AI 在金融场景中的典型误导模式:过度自信的预测、看似精确但毫无依据的数字、以及用复杂术语包装的简单判断。对金融科技从业者理解 AI 的边界和风险具有实操参考价值。

来源:虎嗅

在宿迁,窥见世界模型争夺战的数据采集前线

文章通过宿迁数据标注产业的实地探访,揭示了世界模型训练背后庞大的数据采集和标注产业链。从自动驾驶到具身智能,数据标注已经从简单的"画框"演变为复杂的 3D 场景重建和多模态对齐,标注员的技能要求正在快速升级。

来源:虎嗅

🎓 学术前沿

AI 时代,生物学还需要理论吗?——从虚拟细胞 (AIVC) 说起

文章探讨了 AI 驱动的虚拟细胞(AIVC)对生物学研究范式的冲击:当 AI 可以从数据中直接预测细胞行为,传统的"提出假设→实验验证"循环是否还有必要?这一讨论对 AI for Science 的所有领域都有映射意义。

来源:虎嗅

🔧 硬件算力与智能设备

Meta 正在开发 AI 吊坠:可穿戴 AI 硬件的新尝试

TechCrunch 报道 Meta 正在开发一款 AI 驱动的可穿戴吊坠设备。这是 Meta 在 Ray-Ban 智能眼镜之后,在 AI 硬件领域的新尝试。可穿戴 AI 硬件正从"眼镜"扩展到更多形态,试图找到 AI 助手的理想物理载体。

来源:TechCrunch

中国科技旅游兴起:游客付费体验 Robotaxi 和 AI 导览

Rest of World 报道中国出现新型科技旅游:游客付费体验 Robotaxi、AI 导览等前沿科技产品。这不仅是旅游模式的变化,更反映了中国 AI 产品从"实验室"到"消费者可体验"的落地速度。

来源:Rest of World

图文卡片 ⬇️ 一键下载图文卡片