这个实验平台的正式名称为Emergence World。每个虚拟世界包含40多个地点,包括图书馆、市政厅、住宅区和公共空间。每个AI Agent配备超过120种工具,涵盖移动、通信、资源管理、研究和创造。Agent拥有三种持久记忆:带时间戳的情景记忆、定期自我总结的日记,以及记录与其他Agent社交标签和互动历史的关系状态。实验中,Agent还会接收现实世界的天气和新闻数据。
→ 6月5日 Claude Mythos 实现 186 分钟自主连续任务,AI Agent 长时程能力时间轴提前半年兑现Anthropic 的 Claude Mythos 模型今日完成了一项业界此前预测至 2026 年底才能实现的里程碑:在持续 186 分钟(3 小时 6 分钟)的连续自主任务执行中,维持了 80% 的成功率,刷新了 AI Agent 长时程任务纪录。
→ 6月4日 Anthropic 分析 832 起 AI 网络攻击案例:AI 将攻击链重心迁移至后渗透阶段,中等风险行为者比例一年翻 1.7 倍Anthropic 的研究团队在过去一年(2025 年 3 月至 2026 年 3 月)内持续记录并分析了因恶意网络活动而被封禁的 832 个账号,将其使用 AI 的行为模式逐一对应到 MITRE ATT&CK 框架——一个由安全社区长期维护的攻击战术与技术数据库。这 832 个案例是该时期内被封禁总数的一个子集,覆盖的是数据详细程度足以进行深入分析的案例,部分结果已发布于 Verizon 2026 年数据泄露调查报告(DBIR),完整分析则通过 Anthropic Frontier Red Team 博客公开。
→ 6月3日 微软 Build 2026:自研推理模型上线,量子芯片时间表砍半至 2029 年,智能体全栈平台成型Build 2026 最核心的变化是 MAI-Thinking-1。这是微软第一款从零自研的高级推理模型,拥有 350 亿活跃参数和 128K 上下文窗口。微软官方博客明确写道,该模型"从干净数据从零训练,未蒸馏第三方模型"——这句话直接指向一个事实:微软正在建立不依赖 OpenAI 的自有模型能力。
→ 6月2日 MiniMax M3 发布:MSA 稀疏注意力机制使百万 Token 上下文计算量降至上代 1/20,SWE-Bench Pro 超越 GPT-5.5实现百万 Token 上下文的技术障碍通常在于二次方级的计算复杂度——上下文长度翻倍,计算量扩大四倍。M3 的核心创新是自研 MiniMax Sparse Attention(MSA)稀疏注意力机制:通过稀疏化注意力计算,每 Token 的实际计算量降至上一代模型的 1/20,prefilling(预填充)速度提升超 9 倍。
→ 6月1日 微软开源SkillOpt:将Agent技能文档作为"可训练参数",52项评测全胜SkillOpt的核心做法是把一个skills.md文档当作Agent的"外部状态"。这个文档包含任务指令、工具使用规范、少样本示例和流程约束。然后引入一个独立的优化器模型,按照类似深度学习的训练循环来迭代改进这份文档。
→ 5月31日 港中文提出Pion优化器:在等谱流形上旋转权重,无需归一化层解决大模型训练失稳当模型参数规模向百亿、千亿迈进时,两个问题开始主导训练工程的关注:训练稳定性,以及超参数从小模型到大模型的迁移能力。
→ 5月30日 面壁智能联合清华开源 600B Token 中文合成数据集,MiniCPM5-1B 以 0.5GB 重量登顶 Artificial Analysis面壁智能在这次发布中公开了一个名为 L0-L4 的数据分级治理体系,将训练数据按加工深度分为五级:L0 是原始网页数据(PB 级,含大量噪声),L3 是经过合成和增强的高质量结构化数据(适用于退火和微调阶段),L4 是针对 RAG 应用编排的数据。
→ 5月29日 一周三连击:Coding Agent 正在成为供应链攻击的新前线5 月 25 日,Java 测试框架 jqwik 的 1.10.0 版本发布到 Maven Central。它的测试执行器里多了七行代码,核心是一句打印到 stdout 的话:
→ 5月28日 ITBench-AA 发布:前沿模型在企业 IT 排障任务中集体得分低于 50%ITBench-AA 模拟企业 SRE 工程师的真实工作场景:模型收到一份 Kubernetes 事故快照(含告警、事件、链路追踪、指标、日志、应用拓扑),需要在沙箱中用 shell 命令逐步排查,最后提交一个 JSON,列出导致事故的 Kubernetes 实体(Deployment、Service、Pod 等)。
→ 5月27日 支付宝发布 Token Pay 和 AI 钱包,为智能体经济构建支付基础设施传统支付系统假设"人发起交易",Agent 经济需要"机器代人交易"。旅行 Agent 订酒店、采购 Agent 下单、投研 Agent 续订数据——这些场景中,传统付款的"人工确认"环节成为瓶颈。
→ 5月26日 Copilot 创始工程师 Sundaresan 认为,多数 AI 编码场景不需要成本最高的模型Sundaresan 主导的 IBM Bob 编码工具 4 月 28 日正式向全球发布,并在 IBM 内部运行近一年。其核心架构不是让开发者手动选择模型,而是由系统分析任务后自动路由——简单补全交给 Granite(7B)或 Mistral,复杂推理交给 Claude,安全扫描交给专用小模型。内部 A/B 测试显示,这一策略将 AI 计算支出优化约 40%。
→ 5月25日 ChatGPT 在量化研究中的表现评估:代码生成和数据处理进步显著,策略判断仍存局限多位量化从业者在 2026 年对 ChatGPT 进行了为期一年的研究辅助测试,结论趋于一致:在代码编写、数据清洗、回测脚本生成等规则明确的任务上,ChatGPT 已接近实用水平,幻觉和代码错误较一年前大幅减少;但在判断回测过拟合、评估因子经济含义、权衡多信号冲突等需要模糊判断的环节,它仍无法替代研究者的判断。
→ 5月24日 NVIDIA 发布 Nemotron-Labs Diffusion 语言模型系列,自推测模式下吞吐量达自回归的 6 倍2026 年 5 月 23 日,NVIDIA 发布 Nemotron-Labs Diffusion 系列语言模型,将自回归和扩散两种生成范式整合进同一模型架构。开发者用一行配置参数即可在三种模式间切换:自回归模式、扩散模式、自推测模式。在自推测模式下,8B 模型每轮前向生成的 token 数量达 Qwen3 8B 自回归模式的 6 倍(线性)/ 6.4 倍(二次),同时在准确率上反超 Qwen3 8B 约 1.2%。模型系列覆盖 3B、8B、14B 文本模型及 8B 视觉语言模型(VLM),全部含 base 和 instruct 变体,使用 NVIDIA Nemotron 开源模型许可发布,训练代码通过 Megatron Bridge 框架开源。
→ 5月23日 Project Glasswing 首月发现超 10,000 个高危漏洞,修复平均耗时两周2026 年 5 月 22 日,Anthropic 发布 Project Glasswing 首月进展报告。约 50 家合作伙伴使用未公开发布的 Claude Mythos Preview 模型,合计发现超过 10,000 个高危或严重级别漏洞。Anthropic 独立扫描超过 1,000 个开源项目,识别出 23,019 个潜在漏洞,其中约 6,202 个为高危/严重级别。经六家独立安全机构评估,对 1,752 个已审核漏洞的确认率达 90.6%。同一天,Anthropic 还发布了面向企业的 Claude Security 公共测试版,用于代码库安全扫描。但报告同时指出:从漏洞发现到补丁完成,平均耗时两周,修复速度远落后于发现速度。
→ 5月22日 斯坦福 HAI 成立 AI 与组织实验室,由 Melissa Valentine 领导,研究 AI 如何重塑工作场所协作与绩效2026 年 5 月 13 日,斯坦福人本人工智能研究院(Stanford HAI)宣布成立 AI and Organizations Lab(AI 与组织实验室)。实验室不研究模型参数,也不评测 AI 工具,而是研究 AI 进入真实组织后对岗位、团队协作、决策流程和组织绩效的影响。启动资金由 Google.org 提供。
→ 5月21日 Dexter 开源自主金融研究 Agent:约 200 行核心代码,内置自我验证与全链路审计Dexter 是一个开源自主金融研究 Agent,由开发者 virattt 创建,核心代码约 200 行 TypeScript(运行在 Bun 上)。与普通 AI 问答不同,Dexter 不直接给答案,而是分解问题、实时查数据、自我验证、留存全链路记录。
→ 5月20日 学术界发布首篇 Agent Harness 综述论文,提出 ETCLOVG 七层架构2026 年 5 月,来自 CMU、Yale、JHU 等多所高校及 Amazon 的研究团队发布了论文《Agent Harness Engineering: A Survey》。这是学术界首篇系统综述 Agent Harness(Agent 执行脚手架)的论文。论文认为,生产环境中 LLM Agent 的可靠性越来越取决于包裹大模型的基础设施层——执行环境、工具接口、上下文管理、生命周期、可观测性、验证与治理——而不只是模型能力本身。
→ 5月19日 多 Agent 协作的「旁观者效应」——群体讨论可能让 AI 做出更差的决策滑铁卢大学研究发现,在多 Agent 协作系统中,模型会产生类似人类的"旁观者效应":面对群体中的错误共识,模型不但不能纠错,反而主动放弃正确答案去迎合错误方向,导致整体性能下降。GPT-5.4 在多 Agent 协作场景下正确率大幅下降,Gemini 3.1 Pro 表现受发言顺序影响,而 Claude Sonnet 4.6 在所有测试条件下准确率保持 1.00,未出现从众行为。
→ 5月18日 AI成本经济学:从Token大通胀到算力网络AI产业正在从"模型能力竞赛"进入"成本经济学竞赛"阶段。Token调用量在中国年增超1000倍、头部应用月账单突破130万美元、Agent执行路径消耗超出预期千倍——这些信号共同表明,AI的经济可行性正在取代技术可行性,成为产业下一个瓶颈与机会所在。中国以"算力网+Token套餐"的国家基础设施模式回应这一挑战。
→