🖼️ 图文卡片
FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-06-09

Siri AI全面重做,微信Agent开放生态,阿里AI组织重组

资料提供:前沿科技研究部
降低FOMO的每日信息交付

2026-06-09 前沿科技洞见 · 日报


📊 今日关键数据


🔍 今日值得深读

苹果WWDC发布Siri AI全面重做,底层接入谷歌Gemini模型

苹果在WWDC 2026大会上正式发布了全面重构的Siri AI,这是库克以CEO身份主持的最后一次WWDC。新一代Siri不再只是语音助手,而是升级为具备屏幕感知、跨应用操作和实时知识访问能力的AI代理。其底层核心大模型由谷歌Gemini提供技术支持,运行在苹果私有云计算环境中,同时苹果也推出了第二代端侧模型负责本地轻量任务。

这一架构改变了苹果长期坚持的封闭AI路线。以往苹果极力避免依赖外部模型,但这次不仅引入Gemini作为核心,还通过新开放的LanguageModel协议允许第三方云模型接入。对于中国大陆用户,苹果明确表示Siri AI和Apple Intelligence新功能暂不支持,需配合监管要求推进本地化方案,业内猜测可能由国产大模型替代。同时,Xcode 26.3也引入了Agentic Coding能力,AI能自主拆解需求、生成代码并自动修复。

来源:智东西


微信开放AI Agent生态,数百万小程序全面Agent化

微信正式发布《开发者接入微信AI生态指引》,启动开发者内测,允许AI直接调用和操作小程序。开发者可选择"自动模式"或"开发模式"接入:自动模式下,微信AI可自行读取小程序源码并直接操作;开发模式则允许开发者基于业务特性自主个性化开发。这意味着微信平台上数百万小程序将首次具备被AI Agent直接调用的能力。

此举直指当前AI"能想不会做"的核心瓶颈。微信不再满足于做一个聊天工具,而是试图让AI Agent通过小程序生态与现实世界完成交易闭环——从需求理解、服务调用到支付履约。同一天,微信还宣布与华为、荣耀等国产手机厂商合作推出A2A功能,允许手机AI助手直接调用微信核心功能如语音发消息、拨打音视频通话。

来源:新智元


阿里重组AI架构,成立Token Foundry事业部由CEO吴泳铭直管

阿里巴巴于6月8日宣布重大AI组织架构调整:合并通义大模型事业部与未来生活实验室,成立Token Foundry事业部,由集团CEO吴泳铭亲自挂帅。同时,周靖人升任阿里集团首席科学家,牵头成立AI未来研究院,这是阿里技术体系中的最高学术头衔。创新事业部还设立超级小组,鼓励青年工程师探索AI创意项目。

Token Foundry的命名本身就说明了阿里的战略意图——不再把模型研发和应用转化视为两个阶段,而是试图掌控Token从生成到消费的全生命周期。未来生活实验室此前开发的Happy Horse、Happy Oyster等AI项目也将并入Token Foundry。周靖人领导的AI未来研究院则专注于前沿科技探索,与Token Foundry的商业化形成"研究-产品"双轮。

来源:新智元


微软开源包遭供应链攻击,73个仓库被植入凭证窃取代码

微软数十个开源GitHub代码仓库遭到入侵,攻击者在Azure和AI编程工具相关的包中植入了高级凭证窃取代码。当开发者使用AI编码助手打开这些包时,恶意代码会被触发。GitHub平台 automated systems 共标记了73个包为恶意,但微软直到事发数日后才在邮件中承认"正在调查潜在恶意内容"。

这是两周内微软第二次发生类似事件。更令人担忧的是,被感染的包具有密码学验证签名,意味着供应链上游已被渗透。AI编码助手的高速采用扩大了攻击面——开发者越来越依赖AI自动引入依赖包,而人工审查环节被压缩。微软目前已暂时移除相关仓库,但尚未披露攻击者如何获得写入权限。

来源:Ars Technica


🔥 今日聚合动态

腾讯云WorkBuddy企业版发布,争夺AI办公统一入口

腾讯云在2026 AI产业应用大会上发布WorkBuddy企业版,试图将AI从个人提效工具升级为组织级工作流系统。不同来源从不同角度解读了这套产品的设计逻辑和组织意义。

视角来源核心信息
产品架构量子位WorkBuddy定义"专家+助理+团队"三层能力,将岗位经验预封装为AI专家,实现开箱即用
组织落地新智元腾讯的Agent底牌全摊开,WorkBuddy Inside将AI嵌入企业工作场景,实现底层能力化
协作沉淀AI提效手册团队能力提供共享协作环境,将个人AI成果沉淀为可复用的组织资产

DeepSeek登顶美企软件趋势榜,中国模型获海外付费认可

美国企业支出管理平台Ramp发布的6月软件趋势报告显示,中国大模型公司DeepSeek登顶榜单,美国公司正直接付费使用其API服务。这一现象表明,在累计投入超1万亿美元AI支出后,美国企业开始认真寻找OpenAI和Anthropic的低成本替代方案。

视角来源核心信息
市场数据虎嗅Ramp数据显示美国公司直接向DeepSeek付费而非本地部署;DeepSeek旗舰模型V4-Pro API价格已永久下调至原价四分之一
成本反思华尔街见闻美国企业AI累计支出超1万亿美元,实际成本节约远低于预期,性价比成为采购决策的关键变量

Agent互操作框架并行推进:Skills标准与A2A协议同日热议

Agent生态的互操作性建设在同一天出现两个重要信号:Anthropic发布的Agent Skill标准获得中文开发者社区深度跟进,清华大学104页A2A研究报告则从技术架构层面重新定义了智能体协作边界。

视角来源核心信息
技能标准IT有个圈儿Anthropic的Agent Skill标准通过模块化技能工具箱,让AI能操作数据库、运行代码、控制API,已被多个Agent工具支持
协作协议IT有个圈儿清华A2A报告将协议从"通信"转向"委托",强调任务、能力、权限、证据、审计、责任六大核心要素
概念辨析智能体AI系统区分Model、Tool、Skill、Rules、Hooks、Harness等组件,强调Agent思维而非模型思维

AI编程新范式Loop Engineering引发讨论,大规模AI代码迁移暴露安全争议

Claude Code之父Boris Cherny与"龙虾之父"Peter Steinberger力推AI编程新范式"Loop Engineering"——通过设计循环系统持续调度Agent,取代传统手动提示词工程。与此同时,Bun项目使用Claude Code在9天内重写百万行代码的实验,暴露了AI大规模代码迁移中的安全隐患。

视角来源核心信息
新范式定义虎嗅Loop Engineering强调反馈循环和明确目标,避免Agent重复劳动,但面临高昂的Token消耗挑战
工程实践AI提效手册Anthropic通过生成器-评估器-规划器结构提升Agent长时间自主运行能力

📰 独立报道

🤖 AGI 前沿

小米MIMO V2.5 Pro推理速度达1000 tokens/s

小米发布了MIMO V2.5 Pro UltraSpeed大模型,官方宣称推理速度高达1000 tokens/s。用户可通过小米大模型平台申请试用,小米预告本周还将发布更多重磅内容。与此同时,在一场针对高考语文数学的"裸考"评测中,小米MiMo v2.5 Pro以256.30分夺冠,数学单科136分,显示出模型在均衡性上的优势。

来源:赛博禅心


Anthropic将Claude训练为化学助手,解读NMR谱图能力追平专业软件

Anthropic发布首篇化学研究白皮书,披露其将Claude训练为化学助手的长期计划。研究团队用三个Claude模型(Opus 4.7、Opus 4.6、Sonnet 4.6)对阵化学家桌面使用数十年的专业NMR解读软件,发现未经任何化学专门微调的通用大模型,在核磁共振谱图解读任务上平均水平已追平、某些维度甚至反超了专业软件。

来源:BAAI 智源


OpenSkill框架实现Agent无监督自进化,多项基准刷新SOTA

孙立超团队提出OpenSkill框架,使Agent在无监督条件下获得可执行、可迁移的skills。该框架通过知识获取、无泄漏skills进化、零样本目标评估三步实现能力自提升。在SkillsBench等基准测试中,OpenSkill表现超越现有方法;由强模型生成的skills可直接迁移至弱模型并带来显著增益。

来源:学术头条


LeCun系统阐述LLM局限,提出JEPA世界模型路线

图灵奖得主Yann LeCun在Datawhale梳理的长文中系统阐述了大语言模型的结构性局限。他认为LLM缺乏预测行动后果及基于搜索的多步规划能力,VLA(视觉-语言-动作)路线因可靠性不足、数据依赖过重已近失败。LeCun提出JEPA架构的世界模型是通向通用智能的关键——通过在抽象表征空间预测可控后果,而非像素级重建。

来源:Datawhale


Google NotebookLM升级Gemini 3.5,新增Agentic能力与高级推理

Google宣布NotebookLM研究工具升级,底层模型切换为Gemini 3.5和Antigravity架构,为AI Ultra用户带来新的Agentic能力和更高级的多步推理功能。NotebookLM此前已因音频摘要和播客生成功能获得广泛关注,此次升级进一步将其从"文档分析工具"推向"研究代理"。

来源:Techmeme


🏢 AI 战略与组织变革

豆包推出付费专业版,向高容错生产力场景转型

字节跳动旗下豆包宣布推出付费专业版,目标从免费AI助手转型为覆盖软件开发、金融分析等高容错场景的专业生产力工具。业内分析指出,OpenAI通过整合ChatGPT与Codex为字节提供了生态打通的参考样本,豆包需要将豆包、扣子、Trae等生态工具无缝衔接,才能在高容错专业场景中建立竞争力。

来源:人人都是产品经理


Kimi Work将多Agent协作引入本地电脑

月之暗面推出的Kimi Work将AI Agent集群能力引入本地电脑,通过可视化界面封装,让普通用户也能利用多Agent协作处理复杂任务。产品提供本地文件连接、定时任务、浏览器自动化等功能,Agent集群能模拟企业咨询项目组的工作模式,生成多格式专业文档。

来源:APPSO


奇绩创坛春季路演展示56个AI项目,智能体重心转向垂直落地

奇绩创坛2026春季路演展示了56个AI项目,涵盖智能体、具身智能、FDE(全职数字员工)、AI基础设施等领域。一个显著趋势是:智能体项目仍是主线,但更侧重垂直场景落地,研究型创始人占比达45%。具身智能的场景也在拓宽,AI基础设施的范畴则持续外溢至更上层形态。

来源:Founder Park


Google AI Plus订阅降价至4.99美元/月,存储翻倍至400GB

Google宣布AI Plus订阅计划降价至4.99美元/月,此前为7.99美元,同时包含的存储空间从200GB翻倍至400GB。在AI订阅服务竞争加剧的背景下,Google选择以降价扩量的方式争夺用户,与OpenAI、Anthropic的高价策略形成对比。

来源:Techmeme


💰 金融科技前沿

蚂蚁国际推出移动智能体协议AMP,统一海外AI支付标准

蚂蚁国际宣布推出移动智能体协议AMP(Agent Mobile Protocol),旨在为海外AI支付建立统一标准。该协议允许AI Agent在移动端直接完成支付、转账等金融操作,解决当前AI Agent"能决策但不能交易"的闭环缺失问题。这是首个由支付机构主导的AI Agent金融交互协议。

来源:InfoQ 中文站


华为云RuiPath病理大模型下沉基层,瞄准14万医生缺口

华为云通过RuiPath病理大模型等方案切入智慧医疗赛道,试图解决全国病理医生缺口达14万、优质资源集中于一线城市的结构性短板。传统病理AI模型跨院易"水土不服",华为云方案通过适配基层医院的数字切片系统和数据合规要求,帮助降低成本并提升诊断效率。

来源:虎嗅


特朗普政府重启阻止州AI法律,推动KOSA前置方案

特朗普政府重新启动阻止各州制定AI法律的联邦行动,由参议员Blackburn主导谈判,试图将《儿童在线安全法》(KOSA)纳入AI前置法案包。Axios报道称,白宫正在以支持国会关键技术政策优先事项为交换,谈判联邦对州AI法律的优先适用权。这一动向可能影响各州正在推进的AI监管立法。

来源:Techmeme


🎓 学术前沿

UCL开源VAM框架,为大模型补齐视觉记忆系统

伦敦大学学院团队开源VAM(Visual Agentic Memory)框架,为大模型补齐视觉记忆系统,解决长视频理解中注意力稀释、证据丢失等问题。VAM通过在线索引、分层记忆和智能体检索构建记忆库,仅保留0.06%关键帧,在OVO-Bench榜单上性能反超原生模型,在51天超长视频挑战中准确率位列已发表工作第二。

来源:量子位


复旦ICML提出Prompt Reinjection,无需训练提升文生图能力

复旦大学等机构研究发现文生图模型存在"提示词遗忘"现象——深层网络丢失细粒度语义信息。团队提出Prompt Reinjection方法,通过注入浅层文本特征缓解遗忘,无需额外训练即可提升模型指令遵循能力。该论文已被ICML 2026接收。

来源:机器之心


南洋理工首发3D骨架行人重识别全景图谱

南洋理工大学团队发布首篇3D骨架行人重识别(SRID)全景综述,该技术通过提取人体关键关节3D坐标,剥离面部等敏感信息,实现隐私友好、轻量化的行人识别。综述将AI"读骨"技术归纳为手工特征、序列建模和图建模三大流派,已被IJCAI 2026接收。

来源:PaperWeekly


MIT Luca Carlone指出机器人需任务驱动型记忆系统

MIT副教授Luca Carlone在ICRA 2026大会上指出,下一代机器人需要从传统精确地图转向任务驱动型记忆系统。他论证了从经典SLAM到3D场景图、再到情景记忆的递进路径,并展示了Clio系统如何利用信息瓶颈工具构建任务驱动的场景图表征,在子地图对齐中解决射影歧义问题。

来源:AI科技评论


微软亚研VITRA框架:纯人类视频预训练VLA灵巧操作

微软亚洲研究院与清华大学合作提出VITRA框架,将海量无标注人类活动视频转化为机器人VLA训练数据。模型在纯人类视频数据上预训练后,仅需少量微调即可在真实机器人上实现高成功率的灵巧操作。VITRA通过3D手部运动轨迹、原子级动作分割和语言指令构建超大规模数据集。

来源:量子位


ICML研究:纯代码提升编程能力但对数学推理帮助有限

一项ICML 2026研究显示,纯代码训练能提升模型的编程能力,但对复杂数学推理的帮助有限。研究区分了纯代码与混合文本数据的效果,发现结构化推理信号(如"推理脚手架")对复杂数学推理的提升更为显著,而数学数据对特定编程任务有益但并非所有代码任务都适用。

来源:PaperWeekly


🔧 硬件算力与智能设备

全球首个预制算力中心底座落地山东,Token用电成本降约30%

全球首个预制算力中心底座"算电岛"在山东青岛正式启用。该项目由特锐德打造,通过预制化、模块化数据中心供电系统实现"算电协同",占地面积减少超30%,建设成本下降约20%,最快5个月即可完成建设。国际能源署数据显示,2025年全球数据中心用电量约4850亿千瓦时,同比增长17%。

来源:智东西


英国投资十亿美元建设AI超级计算机,培育本土芯片产业

英国政府宣布投资十亿美元建设AI超级计算机,目标是减少对美技术的依赖并培育本土芯片初创企业。这一基础设施计划被视为英国在AI主权竞赛中的关键动作,试图通过国家级算力投入来留住本土AI人才和企业。

来源:WIRED


华为云Agentic Infra强调token生产力而非总量竞争

华为云提出Agentic Infra理念,主张AI云竞争应从"卷Token总量"转向"卷token生产力"。该基础设施通过优化推理效率、调度策略和任务编排,让同样数量的Token产生更高的业务价值,而非单纯追求吞吐规模。

来源:InfoQ 中文站


图文卡片 ⬇️ 一键下载图文卡片