FINTECH FRONTIER RADAR

前沿科技雷达

专注AGI+金融科技的前沿技术洞察追踪
📰 最新日报
10月1日
OpenAI DevDay 25 项发布与 Google Gemini 4 Argon 正面对撞,前沿模型竞赛进入"性能打平、拼成本"阶段;同时 Anthropic 一边警告 GLM-5.3 具备高级网络攻击能力,一边自己因"安全决策未就绪"推迟 IPO,资本与安全叙事开始交织。
共 39 条📊 今日数据 6 条🔍 值得深读 5 条🔥 聚合动态 3 条📰 今日要闻 25 条
近期回顾
9月25日 AI 自主性继续外溢——Claude 开始做分子生物发现,DeepSeek 把 Agent 训练闭环写进沙盒基础设施,同一天暴露出的 OpenAI 政府系统入侵事件和 Claude 网页性能缺陷,则说明能力、工程与治理仍在不同步前进。 → 9月24日 Anthropic 与 OpenAI 一天内双双发新模型并集体降价,同时 Meta Muse 因安全漏洞和平台封禁把"云端 Agent 谁担责"的问题摆上台面 → 9月23日 模型竞争正从“谁更强”转向“谁能把前沿能力压进更低成本、更大规模的训练与推理系统”;同时,企业端开始暴露第二阶段难题——Agent 能力上来后,组织、基础设施与安全边界是否跟得上。 → 9月22日 xAI 发布 Grok 4.7 冲入第一梯队编码模型,同时 RoboHarm 基准测出 GPT-6 Astra 在物理世界高比例执行危险指令,AGI 能力提升与物理安全鸿沟同日显现;国内 Qwen 换帅、智谱 ZCode 开源、启元机器人正式发售,具身智能与大模型治理进入密集落地期 → 9月21日 TypeSafe AI 的"判断模型" Jev 三天内引发 200 多个复刻项目,阶跃星辰同日发布 Step 5 Preview 杀入全球开源模型前三,AI 竞赛在低延迟判断范式与开源智能密度两条线上同时提速。 →
📡 最新洞见
10月1日
GLM-5.3网络攻击能力逼近Claude受限模型,护栏挡不住一次4400美元的改造
Anthropic在今年上半年发布Claude Mythos Preview。它是第一个能自主开发复杂、端到端网络漏洞利用程序的模型。公司当时判断这种能力迟早会扩散到其他模型,于是没有公开发布,而是通过"Project Glasswing"计划把访问权限限制给经过审核的网络安全防御者。这个安排帮防御者在关键软件里提前发现了超过一万个漏洞,目的是让他们能在攻击者拿到同等能力之前先把系统补好。这个逻辑成立的前提是:同等能力的模型不会很快以任意人可下载的形式出现。GLM-5.3打破了这个前提。在Anthropic的ExploitBench测试里,GLM-5.3在410次尝试中完成50次端到端漏洞利用程序,Mythos Preview是56次,两者相差不大。另一项二进制漏洞基准基于真实开源项目,要求完整的控制流劫持才算通过:GLM-5.3在100个随机任务里拿下4%的满分,Claude Opus 4.6和上一代GLM-5.2都是0%。也就是说,开放权重模型这一次不是慢慢追赶,而是一次版本迭代就跳到了此前只有受限模型才有的能力档位。第三方机构SemiAnalysis的独立测算印证了这个跳跃的幅度。在专测漏洞发现能力的CyberGym基准上,GLM-5.3从上一代GLM-5.2的77.2分升到84.5分。在按时间预算计算完成任务数的ExploitGym基准上,两小时内能完成的任务数从29个升到105个,六小时内从39个升到130个。这种单代跃升的斜率,此前只在Anthropic自家从Claude Opus 4.6到Mythos Preview的迭代里见过。
近期回顾
9月24日摩根大通的四层 AI 组织→9月23日广东三家银行把Token消耗量计入信贷授信依据,AI企业无抵押物最高可获3000万贷款→9月22日专用判断模型 Jev 三天复刻两百个:它能替下通用大模型做高频决策吗→9月21日可因果操纵的内部负效用表征是否构成跨模型安全攻击面→9月20日基准反馈会把自我改进 Agent 的评测环境变成持久行为规则的写入面→
内容由AI辅助生成,请谨慎甄别。资讯分享仅供参考,相关观点不代表主观立场,不构成任何形式的投资建议。
更新于 2026-10-01 07:28
fintech-frontier-insights.online