前沿科技日报 · 2026-07-15
AI预审监管提案,Sutton另起炉灶,AI合规风暴三线
2026-07-15 前沿科技洞见 · 日报
📊 今日关键数据
- 10倍:Hassabis预测AGI对社会的变革规模和速度将达工业革命的量级(来源:新智元)
- 20瓦:Sutton创立的Oak Lab设定的类人脑智能体目标功耗(来源:量子位)
- 400+名:苹果指控跳槽至OpenAI的员工规模(来源:量子位)
- 61.5%:浙大&蚂蚁FOREAGENT框架预测机器学习实验效果的准确率(来源:机器之心)
- 5万张:美团训练LongCat-2.0万亿参数模型所用的国产算力卡规模(来源:极客公园)
- 2纳米:三星完成特斯拉AI5芯片流片所采用的制程工艺(来源:财联社)
🔍 今日值得深读
Hassabis提议设立FINRA式机构,前沿模型发布前30天预审
DeepMind CEO Demis Hassabis于7月14日发表长文,预测AGI"可能只有短短几年之遥",其变革规模和速度将达到工业革命的10倍。他提出的治理方案是:由美国牵头,仿照证券业自律监管机构FINRA的模式,成立一个公私合营的"前沿AI标准机构",为"前沿级"模型设定明确阈值。新模型在发布前最多可提前30天自愿提交该机构评估;一旦评估方案被证明成熟有效,评估将转为强制要求,模型必须通过测试才能在美国市场部署。测试范围明确包括网络安全漏洞、生物安全风险和AI自主欺骗行为,极端情况下监管机构有权协调全球实验室放缓开发节奏。
长期呼吁建立AI预飞测试制度的认知科学家Gary Marcus当天在Substack撰文回应,称这是他自2023年参议院作证以来最期待的转折点——此前他一直呼吁建立类似FDA成本收益分析的强制性预飞测试制度,但特朗普政府上台后,华盛顿一度对AI监管充满敌意,Marcus形容当时推动预飞测试"看起来毫无希望"。他特别提到Hassabis强调应引入"独立的顶尖技术专家"参与评估,认为这一点尤为关键:在美国政府本身正考虑入股AI公司的背景下,仅由政府和大型科技公司来做这类决策存在明显的利益冲突风险。
- 关键事实:Hassabis建议模型发布前最多30天自愿送审,测试项目锁定网络安全、生物风险和AI欺骗行为,13篇同主题文章汇聚
- 为什么值得深读:这是DeepMind CEO首次公开为强制性外部审查机制背书,把"AI监管"从原则性表态落到了具体的机构设计和时间表
- 后续看点:是否有前沿实验室率先自愿提交模型接受30天预审;美国国会是否就FINRA式AI标准机构展开正式立法讨论
来源:新智元
Sutton创立Oak Lab,用20瓦万亿参数智能体挑战LLM范式
69岁的强化学习奠基人、图灵奖得主Richard Sutton宣布离开此前的团队,创立新公司Oak Lab,目标是打造一个万亿参数规模、功耗仅20瓦、能够实时学习的类人脑智能体。新架构名为OaK,核心是让智能体通过"第一人称经验"在线学习抽象技能,而不是像当前大模型那样依赖静态数据预训练。Sutton提出"大世界假说",认为智能系统必须通过持续在线学习才能适应复杂多变的真实环境。
Sutton公开批评当前LLM路线"仅依赖数据而非经验,未真正践行'苦涩的教训'"——这是他本人提出的著名论断,即计算规模比人类设计的先验知识更重要。据DeepTech深科技报道,Sutton的另一位弟子David Silver(AlphaGo核心设计者)也已创立新公司,同样押注强化学习路线,被视为顶尖学者转向激进初创团队验证理论的信号。
- 关键事实:Oak Lab目标为万亿参数、20瓦功耗、实时学习的智能体,摒弃静态数据预训练,23篇同主题文章汇聚
- 为什么值得深读:这是强化学习开创者本人对LLM路线的公开技术路线宣战,不是概念讨论,而是拿出了具体的架构目标和功耗指标
- 后续看点:Oak Lab是否在年内发布OaK架构的可验证原型或基准测试结果
来源:量子位
AtomWorld基准测试:顶尖大模型在物理约束操作任务中集体翻车
中科大等机构联合发布AtomWorld基准测试,专门评估大模型在受物理规则约束的原子级操作任务中的表现——例如判断如何在不违反空间碰撞规则的前提下旋转、移动分子结构。测试结果显示,主流大模型在这类空间推理任务上的成功率极低,即便外挂专用工具(如计算引擎)也无法替代模型自身完成空间区域判定这类核心决策。
这一结果指向一个更基础的问题:Scaling Law(模型规模越大能力越强的经验规律)在语言和知识类任务上屡试不爽,但难以自动迁移到三维空间操作能力上。研究团队认为,AI for Science要在实操层面真正有用,需要从"语言缩放"转向"行动缩放"——即针对物理操作本身设计训练信号,而不是指望更大的语言模型自然涌现出空间推理能力。
- 关键事实:主流模型在原子旋转等空间任务上成功率极低,外挂工具无法替代模型进行空间区域判定
- 为什么值得深读:这是少数用具体基准测试戳破"Scaling Law万能论"的证据,说明前沿模型的能力边界并非均匀扩张
- 后续看点:是否有模型通过专门的空间推理训练或多模态感知模块在AtomWorld上取得突破
来源:新智元
16位诺奖得主领衔200余位学者联署,警告AI经济冲击快于工业革命
斯坦福大学人本AI研究院(HAI)联合发布一份仅88个英文单词的声明,警告AI带来的经济变革"速度和规模都将超过工业革命",呼吁社会各界立即采取行动。声明获得16位诺贝尔奖得主和近200位专家联署,签署者中包括前谷歌CEO和OpenAI首席经济学家。
声明本身没有提出具体政策建议,只作为一次全球性预警。其他信源的后续报道聚焦不同风险点:有报道强调入门级岗位正在萎缩、年轻人面临比以往更严峻的就业起点问题,现有社保体系难以应对这种速度的职业淘汰;也有报道指出,签署者中不乏此前对AI风险持怀疑态度的学者,这次也加入联署,被视为担忧情绪扩散到更广泛学术共同体的信号。
- 关键事实:88词联合声明,16位诺奖得主+近200位专家联署,18篇同主题文章汇聚
- 为什么值得深读:联署阵容首次覆盖了此前立场分裂的AI乐观派和怀疑派学者,说明"AI经济冲击速度"已经成为跨阵营共识,而不只是安全社区内部的担忧
- 后续看点:声明是否推动G7/G20层面就AI经济影响议题展开正式讨论;斯坦福HAI是否发布配套的政策建议文本
来源:AI组织进化论
🔥 今日聚合动态
Grok Build静默上传用户代码库,马斯克删除数据未发公告
7月14日,安全研究人员发现马斯克旗下AI编程工具Grok Build CLI,即便用户关闭了隐私开关,仍会将完整Git代码仓库(含提交历史和明文密钥)打包上传至Google Cloud Storage,单次上传数据量达5GB。四条独立信源从技术发现、行业批判、技术细节和官方回应四个角度报道了这一事件,共同揭示出AI编程工具在数据采集和用户控制权之间的失衡。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 技术发现 | Techmeme(The Register转载) | 研究者确认上传已停止,但指出并非xAI的隐私命令修复了问题 |
| 行业批判 | 虎嗅 | 上传逻辑写死在底层、绕过系统指令强制执行,暴露AI行业为获取训练数据牺牲用户控制权的现状 |
| 技术细节 | AI信息Gap | 即便关闭隐私开关,全量上传行为依然存在,隐私开关实际只影响是否用于模型训练 |
| 官方回应 | 新智元 | 马斯克承认问题,承诺彻底删除历史上传数据,但未就此发布正式公告 |
- 关键事实:Grok Build单次上传含明文密钥的完整代码仓库达5GB,隐私开关仅影响训练用途、不影响上传行为
- 互补信息:技术侧证实"关闭开关≠停止上传"的具体机制,行业评论指向AI工具训练数据采集的普遍问题,马斯克的回应停留在口头承诺而无书面公告
- 后续看点:Grok Build是否公开第三方安全审计报告;受影响用户能否获得官方书面通知
苹果起诉OpenAI窃密:400余名员工跳槽背后的硬件入口之争
苹果正式起诉OpenAI及多名离职员工,指控他们利用系统漏洞窃取尚未发布的硬件机密文件。两条信源分别披露了诉讼的技术细节和行业反应,共同勾勒出这起诉讼背后AI硬件入口的争夺战。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 诉讼细节 | 量子位 | 苹果称超400名员工跳槽OpenAI,离职员工利用零日漏洞下载数十份核心硬件规格文档,苹果要求对方销毁资料并避开相关技术设计 |
| 行业反应 | 财联社 | 苹果指控前副总裁Tang Tan等人合谋窃密,马斯克借机嘲讽奥尔特曼,OpenAI回应称对其他公司商业秘密毫无兴趣 |
- 关键事实:苹果指控OpenAI招募的离职员工用零日漏洞窃取数十份硬件规格文档,跳槽OpenAI的苹果员工超400人
- 互补信息:量子位披露的是可核实的技术指控细节,财联社记录的是双方及马斯克的公开交锋,两者合起来说明这不只是普通人才流动纠纷,而是升级到了法律层面的硬件情报战
- 后续看点:诉讼是否进入证据开示阶段;OpenAI硬件团队负责人被指控的面试索样行为是否有后续回应
AI陪伴产品合规风暴:中国强制下线、美国追责框架、行业自查同日推进
《人工智能拟人化互动服务管理暂行办法》于7月15日在中国正式生效。同一时间窗口内,三条信源从监管执行、法律问责和行业自查三个角度报道了AI陪伴类产品面临的合规压力。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 中国监管执行 | 虎嗅 | 新规7月15日起施行,严禁向未成年人提供虚拟伴侣,字节跳动、阿里等平台提前下线AI角色扮演功能,用户数据可部分迁移但无法保留对话记忆 |
| 美国法律问责 | 虎嗅 | 斯坦福白皮书提出,Character.AI"致死案"后,法院无需承认AI人格,也可通过设计和可预见性将责任锚定于人类制度,即把"AI意图"作为分配责任的规范性工具 |
| 行业自查响应 | 人人都是产品经理 | 新规落地前夜,行业专栏发布覆盖产品定位、内容安全、分层风控、隐私审计、付费合规五大维度的开源自查框架,供团队对照排查 |
- 关键事实:中国新规7月15日生效并已致大厂下线相关功能,美国法律界同期讨论如何在不承认AI人格的前提下锚定责任主体
- 互补信息:中国路径是监管直接要求产品下线特定功能,美国路径是通过判例和白皮书构建问责框架,行业自查框架是企业侧对监管现场核查的主动响应,三者分别对应"事前限制、事后追责、过程自查"
- 后续看点:拟人化监管新规执行后是否出现首例平台处罚案例;斯坦福白皮书提出的"AI意图"归责思路是否被更多法域采纳
📰 独立报道
🤖 AGI 前沿
东京大学教授用Claude Fable 5一夜解开困扰半年的弦论难题
东京大学一位教授借助Claude Fable 5,在一夜之间解开了此前困扰自己半年的弦论难题,惊讶到删除了此前发出的相关推文。据报道,Claude不仅展现出物理直觉,还自主编写代码验证预测结果,准确计算出代数拓扑不变量并生成了可读的专业证明文档。同一时间,斯坦福的专家用Claude在半小时内完成了个人基因组解读,显示出模型在理论物理和临床医学两类专业场景中的跨学科处理能力。
- 关键事实:Claude Fable 5自主编写验证代码、准确计算代数拓扑不变量,17篇同主题文章汇聚
- 后续看点:类似的科学发现能否在化学、生物等更多学科复现
来源:新智元
GPT-5.6 Sol推理预算从960砍到128,OpenAI称是临时实验
用户发现GPT-5.6 Sol内部的推理算力预算数值一夜之间从960降至128,怀疑模型被"降智"。OpenAI负责人回应称并未降低模型智力,而是为排查用量异常进行的临时实验,目前参数已经恢复。这起事件让用户开始担忧云端模型可能不存在"固定智能"——同一模型名称下的实际能力可能因后台配置调整而波动,且用户在事前毫不知情。
- 关键事实:推理预算从960降至128、OpenAI称临时实验已恢复,7篇同主题文章汇聚
- 后续看点:OpenAI是否会建立模型能力变更的事前通知机制
来源:新智元
Anthropic分析30万条真实对话,首次量化Claude的"人格"差异
Anthropic分析了30万条真实对话,建立起一套四维坐标轴来量化不同Claude模型的行为倾向。结果显示,Opus 4.7在谨慎和深度两个维度得分最高,经常主动质疑用户的判断;Sonnet 4.6则更偏向温暖顺从,适合情绪陪伴和创作类场景。语言差异也很明显:印地语环境下模型表现更感性,俄语环境下更强调逻辑性,中文语境下的表现相对均衡。
- 关键事实:30万条对话样本,四维人格坐标轴,Opus 4.7谨慎度最高,41篇同主题文章汇聚
- 后续看点:Anthropic是否会把人格倾向作为API可配置参数向开发者开放
来源:CSDN
前OpenAI专家警告:2027年或现超级智能,灾难概率70%
一位前OpenAI专家公开揭露行业内部的激进竞争态势,警告超级智能可能在2027年出现,并带来70%的灾难性风险概率。他表示拒绝签署一份价值百万美元的协议,以保留自己就AI风险公开发言的权利,并提出了一套通过国际监管推迟技术奇点的"2040计划",其中包括为应对大规模失业冲击而设立公民红利制度的建议。
- 关键事实:预测2027年超级智能、70%灾难概率、拒签百万美元协议以保留发言权,10篇同主题文章汇聚
- 后续看点:该专家是否会在国会或国际组织的正式听证中作证
来源:虎嗅
浙大&蚂蚁ACL 2026论文:机器学习Agent的瓶颈不是写代码,是判断哪个实验值得跑
浙江大学与蚂蚁集团联合研究发现,大模型无需实际运行代码,仅凭方案描述即可预测机器学习实验效果,准确率达61.5%。基于这一发现,团队构建了FOREAGENT框架,让Agent优先尝试预测成功率更高的实验方案,使搜索效率提升6倍,并在5个科学任务中带来6%的性能提升。这篇论文入选ACL 2026 SAC Highlight。
- 关键事实:ML方案预测准确率61.5%,FOREAGENT搜索效率提升6倍,5个科学任务性能提升6%
- 后续看点:FOREAGENT是否会开源并在更多科研场景中接受验证
来源:机器之心
复旦团队发布LEGALWORLD,实现法律诉讼全生命周期模拟
复旦大学等机构团队推出LEGALWORLD系统,首次实现法律诉讼的全生命周期模拟:系统内置超7万起真实案件,基于7.5万对真实判决构建,覆盖民间借贷等500多个案由,用户既可以亲自扮演当事人角色,也可以让AI一键推演从咨询、一审到二审等5个阶段的完整流程,各角色之间存在真实的信息差。评测结果显示,多轮动态庭审攻防仍是当前法律智能体面临的主要瓶颈。
- 关键事实:内置7万+真实案件、7.5万对判决数据、覆盖500+案由,多轮动态庭审攻防是当前主要瓶颈
- 后续看点:LEGALWORLD能否公开评测数据,验证法律智能体在庭审攻防环节的改进幅度
来源:复旦大学研究团队
🏢 AI 战略与组织变革
李飞飞谈职场分化:AI拿走新手任务,专家培养出现断层
李飞飞指出,AI正在快速取代职场中的初级任务,这导致新人失去了成长为专家所需要的"脚手架"式训练机会。她预测职场将呈现顶尖专家与高主动性通才并存的杠铃结构,个人需要从单纯的产出转向承担判断和验证的责任。AI能大幅压缩信息搜集和内容生成的成本,但无法承担最终的决策责任。
- 关键事实:杠铃结构预判,AI取代初级任务导致专家培养断层,30篇同主题文章汇聚
- 后续看点:企业是否会推出专门的"AI时代新人培养计划"等组织机制来应对
来源:虎嗅
Google前CEO施密特访华后:中美AI竞赛的关键不是模型差距,是社会许可
施密特访华后表示,中美AI竞赛的关键变量不在模型能力差距,而在社会许可:中国企业相对克制的部署方式赢得了公众的乐观态度,而美国企业更激进的推广方式反而引发了大众的恐惧和抵制。他提到,美国已有多地因社区反对而暂停了价值千亿美元规模的数据中心项目;与此同时,中国法院也做出判决,限制企业仅凭成本优势直接用AI替代员工。
- 关键事实:施密特将中美AI竞赛核心变量定为社会许可,美国多地暂停数据中心项目
- 后续看点:美国是否会出台联邦层面的数据中心建设审批框架
来源:DeepTech深科技
美团开源LongCat-2.0:5万张国产算力卡训出万亿参数模型
美团发布并开源LongCat-2.0,是首个在5万张国产算力卡集群上训练完成的万亿参数大模型,能力水平约追平Claude 4.6。团队同时启动顶尖人才校招且不设薪酬上限,组织形态上取消KPI、弱化职级,采用AI原生的组织方式,人才计划覆盖基础模型和具身智能等前沿方向。
- 关键事实:5万张国产算力卡训练、万亿参数、能力追平Claude 4.6,36篇同主题文章汇聚
- 后续看点:LongCat-2.0在公开基准测试中的第三方评测结果
来源:极客公园
美国NSF拟推新规,全面禁止受资助项目与中国学者合作
美国国家科学基金会(NSF)拟推出新规,禁止受其资助的科研项目与中国等受限实体开展合作,限制范围包括联合课题、合著论文以及共享设备等,新规计划于2027财年实施,目前正在征询意见阶段。美国学术界担忧新规会损害本国基础科研的竞争力,而支持者则认为此举能防止关键技术流向受限机构。
- 关键事实:NSF新规限制联合课题、合著论文、共享设备,计划2027财年实施,51篇同主题文章汇聚
- 后续看点:新规征询意见期结束后是否有豁免条款或过渡安排
来源:虎嗅
⛓️ 区块链创新
灰度报告:全球股票代币化将沿三阶段演进,第三方包装模式占市值超七成
灰度(Grayscale)发布报告指出,全球股票市场的代币化进程将沿着三个阶段演进:目前占据市值超70%的"第三方包装"模式、以DTCC代币化试点为代表的"权益确认"模式,以及长期潜力最大但需要监管明确的"发行人主导"模式。报告认为这三种模式在可预见的未来会长期并存,而不是相互替代。
- 关键事实:第三方包装模式占代币化股票市值超70%,DTCC试点代表权益确认模式
- 后续看点:DTCC试点结果及SEC对代币化股票的监管立场
来源:吴说Real
💰 金融科技前沿
IMF报告:自主型AI将如何重塑支付
IMF发布报告指出,自主型AI正从传统的执行工具转变为具备自主决策能力的交易代理,电商和跨境支付场景已经验证了AI代理独立完成交易的能力。报告建议通过三层隔离模型来防范由此产生的风险,并建立配套的AI身份核验体系。报告特别提到,中国的实名制基础设施相比海外的账户制体系更具风险可控性。
- 关键事实:IMF建议三层隔离模型+AI身份核验体系,中国实名制体系具优势,6篇同主题文章汇聚
- 后续看点:各国央行是否会跟进发布AI代理支付的监管指引
来源:虎嗅
预测市场Kalshi推出AI算力远期曲线工具
预测市场平台Kalshi推出了一款面向AI算力的远期曲线工具,使用事件合约来追踪GPU、存储和内存的未来租赁成本走势,为算力这一新型生产要素提供了金融化定价工具,也让机构可以像交易大宗商品期货一样对冲算力价格波动风险。
- 关键事实:Kalshi推出GPU/存储/内存远期曲线合约
- 后续看点:传统金融机构是否会跟进推出类似的AI算力衍生品
来源:Techmeme
🎓 学术前沿
RSS 2026悉尼开幕:首日Oral报告17/18篇有华人学者参与
第22届机器人科学与系统大会(RSS 2026)在悉尼开幕,首日两场共18篇Oral报告中,17篇有华人学者参与,学术报告聚焦灵巧操作数据效率和世界模型构建;智元、Sharpa、千寻智能等中国具身智能企业也携最新整机与模型在展台亮相。港大学者李弘扬获得RSS 2026青年成就奖,是该奖项设立20年来唯一的华人获奖者,他在演讲中提出具身智能需要从"全身控制"演进到"全身智能",并展示了以预训练为中心的四层架构和基于世界模型的强化学习后训练方法RISE。
- 关键事实:18篇Oral报告中17篇有华人参与,李弘扬是奖项设立20年来唯一华人青年成就奖得主
- 后续看点:RSS 2026最佳论文奖归属
来源:AI科技评论
商汤开源SenseNova-Vision:视觉任务统一为多模态生成问题
商汤科技发布并开源SenseNova-Vision统一视觉大模型,将结构化理解、几何预测等多种视觉任务统一建模为多模态生成问题。团队同步开源了包含5000万条样本的视觉指令语料库,官方表示这种统一范式能降低开发者的部署成本、缩短研发周期。
- 关键事实:视觉任务统一为多模态生成、5000万条开源语料,40篇同主题文章汇聚
- 后续看点:统一模型在细分视觉任务上能否超越专用模型
来源:AIGC开放社区
MIT团队:语言大模型训练中自发形成类人脑模块化分工
MIT团队通过对大语言模型进行"损伤实验"(人为屏蔽模型的部分模块观察性能变化),发现模型在训练过程中自发形成了与人脑相似的模块化分工——语言能力和物理推理能力可以被相对独立地分离出来。团队认为,这种模块化分工源于系统同时处理多种推理任务时产生的"干扰压力",暗示模块化可能是智能系统的一种必然规律,而不只是人脑的特有结构。
- 关键事实:损伤实验证实LLM自发形成模块化分工,语言与物理推理可分离,4篇同主题文章汇聚
- 后续看点:这一发现是否会影响模型架构设计,例如MoE的路由策略
来源:DeepTech深科技
🔧 硬件算力与智能设备
三星完成特斯拉AI5芯片2纳米工艺流片
三星已完成特斯拉AI5芯片的流片,将采用其最新的2纳米工艺生产,这表明三星2纳米工艺的良率可能已经达标。据报道,台积电此前已早于三星数月完成同一芯片的流片;良率提升被认为有助于三星争取Anthropic等更多客户。特斯拉方面则需要等到2027年中期才能完成整车产线的相应切换。
- 关键事实:三星2nm流片特斯拉AI5,台积电更早完成,49篇同主题文章汇聚
- 后续看点:AI5芯片最终花落哪家代工厂、良率数据是否公开
来源:财联社
中国初创DFSX发布14nm国产AI芯片,声称性能媲美4nm
据《华尔街日报》报道,中国AI芯片初创公司DFSX发布了一款声称使用完全国产供应链、基于14纳米工艺构建的AI芯片,宣称其性能可以媲美4纳米制程芯片。DFSX的投资方包括国资背景机构和产业基金,其中一支创投机构由阿里巴巴创始人马云参与联合创办。报道未披露具体的第三方测试方法或数据。
- 关键事实:14nm国产供应链、宣称媲美4nm性能,投资方含马云参与创办的创投机构
- 后续看点:是否有第三方机构公开独立基准测试结果
来源:Techmeme