前沿科技日报 · 2026-06-17
蚂蚁百灵万亿级模型技术报告公开,M365 Copilot 最高级别漏洞被证明可窃取 2FA 验证码,ChatGPT 市场份额跌至 46.4% 而 Gemini 升至 27.7%,AI 辅助参数型保险在灾害多发区悄然爆炸增长
2026-06-17 前沿科技洞见 · 日报
📊 今日关键数据
- 46.4% / 27.7% / 10.3%:Sensor Tower 数据显示,ChatGPT 5 月底市场份额跌至 46.4%,Gemini 升至 27.7%,Claude 升至 10.3%,Grok/Meta AI 均不足 5%(来源:Techmeme/TechCrunch)
- $100M / 200 万台:Plaud AI 笔记硬件累计出货超 200 万台,软件 ARR 突破 $100M(来源:TechCrunch)
- 10%:Robinhood 宣布裁员 10%,CEO 通知信未提 AI(来源:TechCrunch)
- 98.6% / 1.2B 参数:星源智发布全球首个具身交互世界模型 ω-EVA,1.2B 参数在仿真基准测试中成功率高达 98.6%(来源:AI提效手册)
🔍 今日值得深读
蚂蚁百灵 Ling & Ring 2.6 技术报告公开:万亿级开源模型三档架构攻克能力-成本-延迟"不可能三角"
蚂蚁百灵团队发布 Ling-2.6-flash、Ling-2.6-1T 和 Ring-2.6-1T 三款模型的完整技术报告,系统公开架构、预训练、后训练与推理基础设施细节,三款模型已全部开源。三档面向不同场景:Ling-2.6-flash 主打低延迟、高吞吐和高频调用,适合 Agent 工作流中的轻量执行节点;Ling-2.6-1T 面向高能力密度和强通用能力,重点提升即时响应场景下单位输出 token 的信息量;Ring-2.6-1T 面向复杂推理和 Agent 任务,强调长链路规划、工具调用、代码执行和搜索环境交互。
架构层面,百灵 2.6 系列采用混合线性注意力(Hybrid Linear Attention),将闪电注意力与线性注意力结合,在控制推理成本的同时维持长上下文处理能力。三款模型权重均在 Hugging Face 公开,适用协议为 Apache 2.0。
- 关键事实:万亿参数量级三档开源,flash(低延迟)/ 1T(高能力)/ Ring-1T(复杂推理+Agent)覆盖不同算力预算;混合线性注意力降低推理成本;技术报告完整披露预训练与推理基础设施
- 为什么值得深读:国产万亿级模型达到技术报告级别的透明度公开,且针对 Agent 工作流明确做出"轻量节点 + 复杂推理"双档专项工程化设计
- 后续看点:Ring-2.6-1T 在代码执行和多工具调用基准(如 SWE-bench、ToolBench)上的量化表现,以及与同级别参数开源模型的直接对比数据
来源:智东西
M365 Copilot 最高级别安全漏洞公开:研究者证明提示注入可从用户邮件中窃取 2FA 验证码
Ars Technica 报道:上周二 Microsoft 为 M365 Copilot 修补了一个被评为"最高级"(max critical)的安全漏洞。发现该漏洞的研究者在公开期后披露了概念验证(PoC)细节——攻击者可向用户邮箱发送包含恶意指令的邮件,当 Copilot 处理该邮件时,模型会遵从邮件正文中的指令,将用户的 2FA 验证码和其他可访问邮件内容外泄。
漏洞根本原因是提示注入:LLM 无法可靠区分"用户授权的操作指令"与"第三方内容中嵌入的恶意指令"。报道指出,LLM 提供商"始终无法阻止"其产品遵从此类恶意请求。M365 Copilot 已在全球大量企业部署,2FA 凭证是现有企业安全体系的核心防护层。
- 关键事实:PoC 通过恶意邮件触发 Copilot 提示注入,成功从可访问邮件中导出 2FA 代码和敏感内容;漏洞评级为 max critical;Microsoft 已完成修补
- 为什么值得深读:提示注入是 LLM 集成企业工作流后的系统性安全问题,此次是针对企业核心认证机制的实际利用,是 AI 安全从研究向实战转化的典型案例
- 后续看点:企业是否需要对 Copilot 邮件访问权限增加额外访问控制;SOC 2 / ISO 27001 合规框架是否会针对 LLM 集成场景更新提示注入防控要求
来源:Ars Technica
Interconnects × Finbarr Timbers:前沿后训练配方综述——从早期 RLHF 到当前 Frontier 级别的关键演进
Interconnects 播客发布了与 Finbarr Timbers 的深度对话,梳理当前主流前沿后训练(post-training)配方的演进路径:从最早的 RLHF 指令微调流程,到今日各大实验室的 SFT + RLHF + Constitutional AI / RLAIF 组合,再到如何把 OLMo 风格的开放配方推向 Frontier 级别。
主持人 Nathan Lambert 正在撰写 RLHF/Post-training 书籍,此期提炼了关键前沿配方的幻灯片总结,Finbarr 则基于其对近期大量模型技术报告的阅读贡献了一手观察。讨论重点在于开放配方与 Frontier 配方之间的关键技术缺口——包括数据质量、奖励信号设计和拒绝采样策略。
- 关键事实:Interconnects tier-1 Newsletter,系统梳理主流前沿后训练配方;涵盖 OLMo 风格开放配方推向 Frontier 级别的关键缺口
- 为什么值得深读:后训练配方是当前模型质量差异的核心决定因素之一,公开讨论 Frontier 配方与开放配方差距的内容在业界并不多见
- 后续看点:Nathan Lambert RLHF 书籍出版时间;开放社区能否在 2026 Q3 前填补 Frontier 级 RLHF 的关键技术缺口
传统家庭财险正在系统性崩塌,AI 辅助参数型险种在气候灾害多发地区悄然爆炸性增长
WIRED 深度报道:在加利福尼亚、佛罗里达等自然灾害高频地区,Allstate、State Farm 等传统家庭财险公司正在集体停止承接新客户——这是保险业对气候风险重新定价后的系统性撤退。填补空缺的是AI 辅助参数型保险(AI-assisted parametric insurance):不等待事后定损理赔,只要触发预设气象指标(风速、降水量、地震烈度等阈值)即自动赔付,AI 在其中承担气象数据分析、风险定价和触发阈值设定等功能。部分产品已被 FEMA 纳入考量范围。
参数型险种的核心风险在于"基差风险"(basis risk)——触发阈值命中,但实际房屋未受损(或反之),赔付与实际损失之间存在不匹配。AI 定价引擎提升了阈值精度,但并未消除此结构性问题。
- 关键事实:Allstate、State Farm 已停止在高风险州承接新客户;AI 参数险在灾害多发地区快速扩张;FEMA 正在研究此类产品能否纳入联邦灾害补偿体系
- 为什么值得深读:AI 参数型保险是 AI 在金融基础设施中少数能直接改变赔付逻辑的场景,涉及产品设计、定价透明度和联邦合规多个层次
- 后续看点:联邦保险监管机构是否会要求 AI 定价算法满足可解释性要求;FEMA 是否将参数型险种纳入灾害援助补偿框架
来源:WIRED
🔥 今日聚合动态
AI 助手市场份额加速分化:ChatGPT 首次跌破五成,Gemini 升至 27.7%,Claude 升至 10.3%
Sensor Tower 发布 5 月 AI 助手市场份额数据,同时另有 TechCrunch 的深度分析,两份信息共同描绘了 AI 助手市场从单极垄断走向三强格局的进程。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 份额数据 | Techmeme/TechCrunch | ChatGPT 5 月底份额跌至 46.4%,Gemini 升至 27.7%,Claude 升至 10.3%,Grok/Meta AI 各不足 5% |
| 趋势分析 | TechCrunch | Android 17 + Wear OS 7 发布同日深度集成最新 AI 模型,Gemini 功能扩展至 Pixel 全线设备 |
- 关键事实:ChatGPT 发布 3.5 年后首次跌破五成市场份额;Gemini 加速上升的背后有 Android 17 生态整合的结构性支撑
- 互补信息:市场份额变化与 Google 将 Gemini 深度集成到 Android 的策略部署在时间上重合,两者存在直接因果关联
- 后续看点:Claude 能否延续 10.3% 份额上升趋势至 Q3;Gemini 的份额增长有多少来自 Workspace 企业用户转换
端侧 AI 与 XR 生态成形:Android 17 发布 + Qualcomm 押注 40+ AI 可穿戴并发布旗舰 XR 芯片
Google 发布 Android 17 + Wear OS 7 正式版的同日,Qualcomm 宣布两款面向后手机时代的 AI 芯片产品,共同指向移动计算平台向 AI 可穿戴和 XR 设备的迁移。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 操作系统更新 | Techmeme/TechCrunch | Android 17 + Wear OS 7 首批登陆 Pixel,深度集成最新 AI 模型 + 气泡栏 UI + 多任务工具 |
| 芯片战略 | TechCrunch | Qualcomm CEO:正推进逾 40 款 AI 可穿戴设备(含耳机相机、别针、手表);XR 芯片路线图加速 |
| XR 芯片发布 | Techmeme/UploadVR | Snapdragon Reality Elite 旗舰 XR 芯片今秋首发于 Xreal Aura Android XR 空间计算设备 |
- 关键事实:Qualcomm 40+ AI 可穿戴设备覆盖从耳机、别针、手表到 XR 头显的全品类布局;Android 17 Wear OS 7 是 Wear OS 平台首次正式整合最新 AI 推理能力
- 互补信息:软件(Android 17 AI 集成)与硬件(Qualcomm 芯片生态)双向协同,端侧 AI 所需的算力和系统支持正在同步到位
- 后续看点:Snapdragon Reality Elite 的实际推理性能与功耗数据;Android 17 Wear OS 在非 Pixel 设备上的更新节奏
📰 独立报道
🤖 AGI 前沿
OpenAI 推出 Deployment Simulation:用真实对话数据在上线前预测模型行为偏差
OpenAI 官方博客发布 Deployment Simulation:在模型上线前,将历史真实用户对话在候选新模型上重放,与基准模型对比,提前发现行为偏差和安全风险。核心是把评估场景从"人工构造测试集"换成"真实分布数据重放",提高安全评估对分布外风险的覆盖率,无需额外人工标注。
- 关键事实:方法使用真实对话日志重放于候选模型,通过行为差异统计在部署前识别安全偏差
- 后续看点:Deployment Simulation 是否会被纳入 OpenAI 正式 Preparedness Framework,以及是否开放给第三方开发者
来源:OpenAI 新闻
Casey Harrell 成为脑机接口首位"重度用户":ALS 患者通过大脑电极流畅说话近一年
MIT Technology Review 报道:ALS 患者 Casey Harrell 已在大脑中植入电极近一年,成为迄今记录在案的 BCI 系统最密集使用者。与此前多数短期实验不同,Harrell 将 BCI 作为日常沟通工具持续使用,能够以接近正常语速表达意图。同期 MIT 报道还涉及韩国政府对 AI 的系统性大规模推进。
- 关键事实:大脑电极植入近一年,BCI 已成为患者日常沟通工具;是目前 BCI 高密度使用时长最长的记录案例
- 后续看点:长期使用的设备稳定性数据(信号衰减率、感染风险)是否支持更广适应症扩展
🏢 AI 战略与组织变革
DeepMind 与英国政府合作:AI 加速住宅规划审批,应对住房供应危机
Google DeepMind 官方博客披露:与英国政府联合构建 AI 驱动的规划审批原型系统,目标是加快住宅建设的审批决策速度。英国住房市场长期面临审批流程冗长、规划官员人手不足的问题,新系统通过 AI 辅助规划文件分析和合规性评估,旨在压缩单案审批周期。这是英国政府继税务、司法和医疗之后在 AI 国策层面的又一具体落地案例。
- 关键事实:DeepMind 与英国政府联合建立 AI 辅助住宅规划原型;目标对象是审批决策过程,而非政策制定
- 后续看点:原型系统是否进入实际审批流程试点;审批准确率与人工对比的量化结果何时公开
来源:DeepMind
五角大楼用生成式 AI 为国会写法定报告,DoD 首席技术官公开展示效率提升
Ars Technica 报道:美国国防部每年有数百份须向国会提交的法定报告,DoD 首席技术官 Emil Michael 在哈德逊研究所活动上表示,生成式 AI 工具已用于撰写这些法律要求的报告,并将此作为 AI 落地的重要成果。这些报告承担国会监督职能,AI 生成内容的事实核查责任归属尚不明确。
- 关键事实:Emil Michael 明确确认 AI 已用于撰写国会法定报告;DoD 将此视为落地成果
- 后续看点:国会是否要求披露哪些报告为 AI 辅助生成;DoD IG 是否会介入核查内容准确性
来源:Ars Technica
微软 Copilot Cowork 转按用量计费,并考虑引入自托管 DeepSeek 作为低价模型选项
Axios 报道:Microsoft 将 Copilot Cowork 的定价模式从订阅制改为按用量计费,以扩大企业端 AI 工具的使用覆盖;同时正在考虑引入微软自托管的 DeepSeek 版本作为低价模型选项,以应对企业对 AI 使用成本的敏感性。
- 关键事实:订阅制 → 按量计费;DeepSeek 自托管版本是正在考量的低价选项之一
- 后续看点:DeepSeek 是否最终进入 Microsoft 官方服务目录;按量计费模式的推出时间表
清华/中大/港中文 OpenRath 开源:Session 成为多智能体系统"一等公民",提供类 PyTorch 工程体验
来自清华大学、中山大学和香港中文大学的 Rath Team 开源 OpenRath,一个多智能体、多会话运行时框架。核心主张:当多 Agent 系统扩展到数十至数百个 Agent 时,Session(会话)而非 Agent 本身才应该是系统的"一等公民"——Session 是完整操作证据链的载体,Agent Cluster 通过共享 Session 协作,解决大规模部署中调试、复现、编排失控的工程难题。借鉴 PyTorch 的抽象设计,已在 PyPI 发布至 v1.2.1,pip install openrath 即可安装,BSD-3-Clause 协议。
- 关键事实:v1.2.1 已发布;Session 作为证据载体记录完整 Agent 行为链;Agent Cluster 通过共享 Session 实现协作
- 后续看点:OpenRath 在 100+ Agent 规模生产环境的稳定性验证;是否获得 LangGraph/CrewAI 等主流框架的兼容适配
来源:量子位
微信和支付宝把小程序改造成 Skill,争夺 AI 时代"调用资产"定义权;微信支付 AI 专属卡最快本周上线
虎嗅报道:微信和支付宝正将小程序从"分发资产"改造为"调用资产"——即 AI 可以直接调用的 Skill,以应对豆包等纯 AI 原生入口的竞争。微信已发布 Skill 技术规范,支付宝正在内测"AI 版支付宝"。同日,财联社报道微信支付联合腾讯 WorkBuddy 测试 AI 支付功能,推出"AI 专属卡"最快本周上线;该卡消费上限由用户充值决定,智能体发起支付须用户输入密码确认。
- 关键事实:微信已发布 Skill 规范;支付宝内测 AI 版产品;AI 专属卡将授权边界锁定在"用户充值上限+验密"双重约束
- 后续看点:微信 Skill 规范是否开放给第三方小程序开发者;AI 专属卡的风险管控模型与金融监管合规路径
非十科技 Agivar:桌面 Agent 通过"录屏教学"主动学习工作流,替代年薪 300 万的 FDE 工程师
机器之心报道:非十科技发布桌面 Agent 产品 Agivar,通过让 AI 在"录屏"状态下观察用户操作,自动提取任务逻辑和规则,无需用户手动编写 Prompt。Agivar 采用"大脑+小脑"双层架构,针对桌面任务场景专门训练模型,通过训练收敛、多重校验和规则约束确保执行确定性,能理解流程背后的逻辑,而非机械复现点击轨迹。
- 关键事实:录屏学习代替人工 Prompt 编写;"大脑+小脑"架构专为桌面任务设计;核心目标是确定性执行
- 后续看点:Agivar 在跨系统跳转场景(CRM + ERP + 内网审批流)的实际可靠性测试数据
来源:机器之心
Robinhood 宣布裁员 10%,CEO 通知信全程未提及 AI
TechCrunch 报道:Robinhood CEO Vlad Tenev 向全员发出裁员 10% 通知。与科技行业众多同行将裁员归因于"AI 重组"的惯例不同,Tenev 的通知信中没有提及 AI,聚焦于业务优先级调整。报道将此作为反例突出——当多数科技 CEO 把裁员包装成"拥抱 AI"时,Robinhood 选择直接说明业务原因。
- 关键事实:裁员 10%;CEO 通知信无任何 AI 相关表述
- 后续看点:裁员涉及部门(工程/客服/运营)分布,是否与 AI 替代预期高相关
来源:TechCrunch
🤖 AGI 前沿(续)
通义千问发布 Qwen-Robot Suite:面向物理世界智能的基础模型套件
阿里云通义千问团队发布 Qwen-Robot Suite,定位为面向物理世界智能(Physical World Intelligence)的基础模型套件,涵盖操控、感知和推理等机器人核心能力,是通义千问系列首次扩展至机器人/物理世界域。
- 关键事实:Qwen 首次将模型能力扩展至物理世界智能;以"Suite"形式整合多个子模型
- 后续看点:Qwen-Robot Suite 在标准机器人操控基准(如 RLBench、LIBERO)上的量化表现
来源:通义千问
🏢 AI 战略与组织变革(续)
红帽 AI 3.4:支持任意模型/GPU/云的企业 AI 平台,引入 llm-d 分布式推理 + NVIDIA AI 工厂深度集成
红帽在 2026 全球峰会发布 Red Hat AI 3.4,新增 llm-d 分布式推理引擎(以 vLLM 为推理服务器核心),以及提示词管理功能和评估中心(从质量、准确性、安全性、风险维度评估模型表现)。红帽成为英伟达新一代 AI 算力平台的 Day 0 操作系统支持方,推进 Red Hat AI Factory with NVIDIA,集成英伟达 Agent 运行时 OpenShell 与红帽全栈 AI 平台。
- 关键事实:llm-d 分布式推理 + vLLM;Day 0 支持 NVIDIA 新算力平台;评估中心支持安全与风险维度
- 后续看点:llm-d 在实际混合云推理场景的吞吐量与延迟对比数据
来源:智东西
🔧 硬件算力与智能设备
首场"AI 世界杯":联想是 FIFA 官方技术合作伙伴,部署 AI Pro 智能体、3D 数字人越位判定等六项 AI 系统
2026 FIFA 世界杯是 AI 大模型时代的首场世界杯,联想集团作为 FIFA 官方技术合作伙伴,部署了 FIFA AI Pro 超级智能体、3D 数字人可视化越位判定、裁判视角 AI 视频增强、智能指挥中心、智能导览和全息投影 Hologram 互动六项技术。3D 数字人越位判定系统已在多场比赛实际运行,联想 FIFA 项目负责人表示世界模型和智能体技术已在赛事管理中落地应用。
- 关键事实:联想为 FIFA 官方技术合作伙伴;3D 数字人已用于越位判定;AI Pro 智能体在现场实际运行
- 后续看点:AI 越位判定与现有 VAR 系统的协议整合方式和错判率数据
来源:智东西
💰 金融科技前沿
Plaud AI 笔记:软件 ARR 突破 $100M,出货超 200 万台 AI 智能记事本
TechCrunch 报道:Plaud 创始人透露,公司软件 ARR 已突破 1 亿美元,AI 智能记事本硬件出货超 200 万台。Plaud 通过硬件切入差异化了与云端 AI 笔记工具(Otter.ai、Fireflies 等)的竞争格局,采用硬件 + 软件订阅双轮模式。
- 关键事实:软件 ARR 破 $100M;AI 笔记硬件出货超 200 万台;硬件 + 订阅模式
- 后续看点:Plaud 是否进入 B2B 企业市场;$100M ARR 对应的盈利模型
来源:TechCrunch