GLM-5.3 不换基座、能力却涨了:后训练规模化正在替代预训练,成为大模型竞赛的新主战场
2026-08-15
一、触发新闻与一句话定义
智谱AI(Z.ai)在2026年8月14日发布了GLM-5.3,官方文档明确写道,这一代模型使用的基座与三个月前的GLM-5.2完全相同(约7430亿参数MoE架构,未做任何重新预训练),编程能力在内部评测中较上一代提升约50%,在Terminal-Bench 3.0上从4.6分跳到28.3分,网络安全方向新增的攻防能力在269个开源项目中挖出2436个漏洞,其中1097个是高危或严重级别。 权重没有跟着发布同步开放,官方给出的理由是要先做安全评估和"模型加固",两周后再放。
这不是一次常规的版本号递增。放在GLM系列的历史里看,从GLM-4到GLM-5,智谱每一次跨代跃迁都伴随着基座架构的实质变化;这次不是。研究对象因此聚焦到一个更具体的问题上:当一家头部实验室公开承认"这次能力提升跟基座无关,全靠后训练",这意味着大模型竞赛的主战场正在从"谁的预训练模型更大"转移到"谁的后训练规模化做得更狠"。GLM-5.3只是这场转移里最新、也最直白的一个样本。
二、纵向分析:从诞生到当下
从知识工程实验室到"大模型第一股"
智谱的故事得从一间实验室讲起。清华大学计算机系的知识工程实验室(KEG Lab)由唐杰主导,早年做的是知识图谱和学术情报挖掘,2006年那款叫AMiner的科研情报产品是这个团队最早被外界记住的作品。2019年6月,实验室的技术成果转化成了一家公司,智谱华章正式注册,CEO张鹏带队把实验室里的东西往市场上推,唐杰则以首席科学家的身份留在了技术决策的核心位置。这个"学院派创业"的起点很重要,因为它决定了智谱此后很长一段时间的技术性格:先有论文,后有产品,路径依赖非常明显。
2021年3月,一篇叫《GLM: General Language Model Pretraining with Autoregressive Blank Infilling》的论文挂上了arXiv,一年后正式发表在ACL 2022上。它提出的"自回归空白填充"预训练目标,是智谱区别于同期直接抄GPT架构的中国团队的第一个技术分叉点——GLM这个名字里的G,从一开始指的就是这套自研的预训练范式,而不是"通用大模型"的泛称。这个细节值得记住,因为它意味着智谱在预训练路线上曾经是有自己想法的,不是从一开始就打算靠后训练弯道超车。
2022年8月,1300亿参数的GLM-130B开放,斯坦福基础模型中心当年11月的评测显示它在准确性和鲁棒性上能跟GPT-3的175B版本掰手腕。半年后,2023年3月14日,60亿参数的ChatGLM-6B开源,这是智谱第一次真正意义上"出圈"——两周内爬上Hugging Face趋势榜第一,到5月全球下载量破200万。这一年也是国产大模型集体启动的一年,"AI六小龙"的说法就是在这个窗口期里成型的:智谱、MiniMax、月之暗面、阶跃星辰、百川智能、零一万物,六家公司几乎同时拿到融资、同时开始烧钱训模型。
GLM-4到GLM-4.6:换基座的最后一段路
2024年1月16日,GLM-4发布,10T token预训练加多阶段RLHF,性能对标彼时的GPT-4。这之后智谱走的还是"新基座+能力对齐"的老路子:2024年6月开源GLM-4-9B、启动视觉矩阵;商业化的GLM-4-Plus闭源走API路线,服务企业客户。
真正的转折点在2025年7月28日。智谱在国际市场把品牌改成了Z.ai,同一天开源了GLM-4.5,第一次把"Agentic-Reasoning-Coding"三种能力原生融合进同一个训练目标里,12项评测均分做到全球第三、国产第一。两个月后的2025年9月30日,GLM-4.6上线,编程能力比4.5又高了27%,官方给出的对标对象是Claude Sonnet 4,同时这一代模型在寒武纪芯片上做了国产首个FP8+Int4混合量化部署——脱离英伟达硬件依赖的信号,从这时候已经开始显现。
GLM-5:异步强化学习基础设施登场
2026年2月11日到12日,GLM-5发布,这是理解GLM-5.3的关键前置节点。技术报告《GLM-5: from Vibe Coding to Agentic Engineering》里,智谱第一次系统性地公开了一套"新的异步强化学习基础设施",核心思路是把生成和训练解耦,让后训练效率大幅提升,同时提出了配套的异步Agent RL算法。架构上引入了类似DeepSeek Sparse Attention的DSA机制,把长上下文的训练和推理成本压了下来。更关键的是,这一代模型完全基于华为昇腾芯片和MindSpore框架训练,不依赖英伟达硬件——这既是被出口管制倒逼出来的选择,客观上也逼着智谱在RL基础设施层面做更多自研工程优化,因为国产芯片生态没有现成的PyTorch+CUDA那套RL训练工具链可以直接抄。GLM-5的SWE-bench Verified跑到77.8%,AIME 2026拿下92.7%,在LMArena文本竞技场上做到开源模型第一。
这里能看到一个此前容易被忽略的伏笔:GLM-5真正的技术亮点,与其说是基座架构(DSA说到底是对DeepSeek方案的借鉴与工程化),不如说是那套异步RL基础设施。智谱在这时候已经把研发重心悄悄挪到了后训练系统工程上,只是当时外界的注意力还停留在"GLM-5参数量743B、超越Kimi K2.5"这类基座层面的比较上。
GLM-5.1到GLM-5.2:把长程任务当成主战场
2026年4月8日,GLM-5.1首次实现8小时级长程任务处理能力,这是"模型能不能像一个真实工程师一样连续工作一整天"这个问题上,国产开源模型第一次给出肯定回答。两个月后的6月16日,GLM-5.2把这套长程能力又往前推了一步:引入统一基础设施层slime来管理长程交互,用一种基于Critic的单rollout PPO方法处理长度不等的任务轨迹——这是个很具体的工程问题,此前的RL方法对轨迹长度差异很敏感,长短不一的任务放在一起训练容易导致梯度不稳定,智谱选择在算法层面而不是数据层面解决它。同时上线了IndexShare索引复用技术支撑1M稳定上下文,还有一个叫effort level的思考档位机制,允许用户在质量、速度、成本之间自己调节。GLM-5.2在Artificial Analysis综合榜单上拿到51分,和Anthropic、OpenAI的模型并列前三,发布当天就完成了华为昇腾、平头哥、摩尔线程、寒武纪、昆仑芯、沐曦、海光、壁仞八大国产算力平台的适配。
到这一步,"基座不变,靠系统性后训练工程持续拉升能力"这条路径已经在GLM-5系列内部跑通了两轮(5→5.1、5.1→5.2),GLM-5.3只是把这个已经验证过的打法又做了一次,规模更大。
GLM-5.3:后训练把"训练任务"改造成了"真实工作"
这是最值得展开的一段。GLM-5.3相比GLM-5.2,官方文档给出的描述是训练已经不再局限于孤立的编程题目,而是扩展到了识别问题、分析方案、实施、验证、交付的完整工程流程,其中部分任务的复杂度相当于一个资深工程师连续工作数天。训练环境不再是人工构造的测试题,而是使用真实计算集群、真实存储系统、真实的内部文档和代码库搭建出来的——环境数量比GLM-5.2时期增加了十倍以上,类型也更丰富。
结果反映在几组对比数字上:Terminal-Bench 3.0从4.6分跳到28.3分,六倍多的涨幅,拿到开源模型第一;DeepSWE v1.1从46.2到66.9;Agents' Last Exam从23.8到28.5。效率维度上,在Z.ai Code Bench的高难度档,GLM-5.3用大约5万token跑出31.4%的分数,超过了Claude Opus 4.8用12万token跑出的29.5%——同等难度下,token消耗只有对方的四成左右。
真正让这次发布出圈的,是一个训练团队本身可能都没完全预料到的副产品:网络安全能力的"意外涌现"。CyberGym基准上GLM-5.3拿到84.5%,超过Mythos 5的83.8%;ExploitBench从上一代的24.4%直接跳到54.4%。更直观的是它被拿去扫了269个真实开源项目,挖出2436个漏洞,其中1097个属于高危或严重级别,里面还有一个追溯到上世纪八十年代初的历史遗留漏洞。这个能力不是智谱刻意训练的目标——训练环境设计的初衷是工程任务,网络安全攻防能力是长程推理、代码理解、系统交互这几种能力叠加之后的溢出效应。也正因为这个能力来得"意外",智谱这次没有像GLM-5、5.1、5.2那样发布权重就同步开源,而是决定先做安全评估和"模型加固",权重延后大约两周开放——这是GLM系列历史上第一次因为安全审查而推迟旗舰模型的开源节奏。
这个决定本身也值得放进纵向叙事里:智谱一直以"旗舰模型必开源"作为区别于DeepSeek路线之外的另一种品牌资产,从ChatGLM-6B到GLM-5.2全部如此。GLM-5.3打破了这个惯例,说明公司内部已经真实感受到了"后训练规模化"这条路径可能带来能力溢出到安全边界之外的风险,这不是公关姿态,而是一次真实的战略权衡。
一条平行的商业化叙事:从八轮融资到港交所
技术脉络之外还有一条商业线索不能不提。智谱从2019年的4000万元天使轮起步,2022年B1轮估值到28亿元,2023年密集拿到美团、蚂蚁、阿里、腾讯、小米、金山等几乎所有互联网巨头的投资,累计融资超过83亿元。2026年1月8日,智谱在港交所主板挂牌(股票代码02513.HK),成为全球第一家上市的通用大模型开发商,上市首日股价涨13.17%,市值一度接近580亿港元。招股书披露的财务数据很能说明问题:2022到2024年收入从5740万元涨到3.124亿元,年复合增长率130%,但同期净亏损从1.44亿元扩大到29.58亿元,三年半累计亏损超过62亿元。这意味着GLM-5.3这种"靠海量算力堆后训练"的打法,是在一家仍处于深度亏损、但已经背负公开市场业绩压力的公司里做出的选择——后训练规模化不是免费的技术炫技,是真金白银堆出来的商业赌注。
三、横向分析:竞争图谱
"基座不变、靠后训练冲能力"这件事,2026年已经不是智谱一家在做。把同期几个头部玩家摆在一起看,会发现这条路径分成了两个阵营:一部分厂商把它当成常规操作,另一部分仍然坚持新基座才是"真升级",后训练冲刺只是过渡期打法。
DeepSeek:几乎同一天发布的镜像案例
这是横向对比里最有说服力的一组。DeepSeek在2026年4月24日发布了V4系列的预览版,这是真正意义上的新基座。但之后的两次迭代都是纯后训练打法:7月31日的V4-Flash-0731,报道明确指出模型结构和尺寸与预览版完全一致(284B总参数、13B激活),只是重新做了一轮后训练来提升任务分解、工具调用和代码执行能力;8月13日凌晨,也就是GLM-5.3发布前一天,DeepSeek毫无预告地放出了V4-Pro-0813,架构和参数量同样未变(1.6万亿MoE、约49B激活),改变全部来自针对性后训练——DeepSWE基准从12.8跳到62.7,涨幅390%。
两家公司几乎前后脚交出了同一份答卷,这不太可能是巧合,更像是行业里对"预训练已经喂饱、后训练还有大量空间"这件事形成了同步认知。更值得记录的是DeepSeek创始人梁文锋在2026年5月一次投资人闭门会上的表态:进入Agent阶段之后,模型能不能用好终端、能不能在几百轮交互里维持任务状态、出错了能不能自己修正、知不知道什么时候该调用什么工具,这些能力已经不再由预训练决定,而是越来越依赖后训练、强化学习和模型外部的执行框架。这段话几乎是在给GLM-5.3的做法做注脚,只是DeepSeek说在前面,智谱做在后面。V3.2的技术报告里还有一个具体数字:RL阶段消耗的算力超过了预训练总算力的10%,这是目前少数几个被头部实验室主动公开的"后训练/预训练算力比"。
阿里Qwen:两条路线同时在跑
阿里的选择更复杂一些,值得分开看。Qwen3.5在2026年2月发布,官方明确这是一个原生多模态基座,从零开始训练,不是给文本模型嫁接视觉编码器——这条线走的是"换基座"的老路子。但Qwen-Max系列走的是另一条路:Qwen3.7-Max(5月)到Qwen3.8-Max(预览版7月19日、正式版8月3日、开源权重8月12日),官方表述是"基于Qwen3.5架构演进而来",基座没变,靠系统性后训练迭代往前冲。有意思的是Qwen3.8-Max预览版发布时没有技术报告、没有跑分,半个月后才把完整数据补齐——这种"先抢发布节奏、后补技术证据"的做法,某种程度上也说明了后训练竞赛已经卷到需要抢时间窗口的地步,谁先在开发者社区里立住"最强开源编程模型"的叙事,谁就占了便宜,哪怕数据后补。
阿里同时押注两条路线这件事本身是个信号:换基座和纯后训练冲刺不是互斥选项,而是同一家公司在不同产品线上根据节奏灵活切换的两种工具。
月之暗面Kimi:多模态RL反哺纯文本能力
Kimi K2到K2.5的路径提供了另一个变体。K2.5的技术报告标题直接叫《Visual Agentic Intelligence》,核心手段是联合文本-视觉的强化学习,用一种叫"zero-vision SFT"的方法,只靠高质量文本数据就能激活模型的视觉推理和工具使用能力。有意思的是这次多模态RL训练带来了跨模态的迁移收益——MMLU-Pro从84.7%涨到86.4%,GPQA-Diamond从84.3%涨到86.4%,都是纯文本任务,却因为视觉RL训练而受益。这跟GLM-5.3的路径不完全一样:智谱是把编程任务环境做深做真实,Kimi是把多模态RL和文本RL做成联合训练,两条不同的后训练扩展路径,但底层逻辑相通,都是在预训练之外找增量。
MiniMax、阶跃星辰:RL算法层面的军备竞赛
MiniMax在M1论文里提出了CISPO算法,用裁剪重要性采样权重的方式替代PPO/GRPO对token更新的裁剪,让那些概率虽低但对维持模型探索熵很关键的token也能参与梯度计算,这是一个专门为大规模RL训练稳定性设计的算法创新。配合Forge框架,MiniMax M2.5训练时对接了超过10万个真实世界的agent脚手架和环境,日吞吐量做到百万级样本,通过异步调度加树状样本合并,训练速度比naive方法快了大约40倍。阶跃星辰的Step 3.5 Flash技术报告则提出了从统一SFT模型出发做大规模RL、结合可验证奖励与人类偏好反馈的方案,专门为数学、代码、STEM、工具使用等场景训练了一批领域专家模型。
这些细节拼在一起会发现一件事:中国厂商之间在RL算法和基础设施层面存在明显的相互借鉴和快速扩散——DeepSeek V4的技术报告里提到采用了"经Kimi验证的Muon优化器",GRPO、CISPO这类算法在不同公司间被反复复用和改造。后训练竞赛不只是算力堆量的竞赛,也是一场RL算法工程的军备竞赛,谁的训练基础设施更稳定、更能扩展,谁就能把更多算力真正转化成能力提升,而不是浪费在训练不稳定或者奖励黑客(reward hacking)上。
海外阵营:默契的"同基座迭代"与Anthropic的暧昧地带
海外几家实验室同样存在这个现象,只是表述方式不太一样。多家科技媒体的分析文章指出,OpenAI的o1、o3和GPT-5系列在过去一年半里共享同一个GPT-4o基座,性能提升完全靠后训练和RL算力扩张驱动,直到2026年4月的GPT-5.5才被称为"OpenAI一年来第一个全新训练的基座模型"——这意味着此前从GPT-5.0到5.4的一整条产品线,包括专精代码的5.3变体,全部是同一基座上的后训练迭代。需要说明的是,这个结论主要来自科技媒体的技术分析而非OpenAI官方的直接书面确认,严谨起见应视为行业推断而非一手声明。
谷歌DeepMind这边反而是官方口径最清楚的一个:Gemini 3.1 Pro的模型卡直接写明"基于Gemini 3 Pro",是同一系列的下一次迭代,专门针对复杂问题解决和长程agentic工作流做了后训练优化,模型卡里详细列出了指令微调、强化学习、人类偏好反馈三类后训练数据集。
Anthropic是这几家里最值得玩味的一个。Opus系列在2025年11月到2026年7月之间连续发布了4.5、4.6、4.7、4.8四个版本,最后在7月24日跳到Opus 5这个大版本。但Anthropic官方从来没有明确说明4.5到4.8这几个小版本之间是否共享同一预训练基座,更有意思的是外部观察者发现Opus 4.7用的tokenizer跟4.6不一样,这直接引发了"4.7到底算不算新基座"的公开争论,厂商自己也没有出面澄清。这种模糊本身说明了一件事:随着后训练规模化成为常态,"基座是否更换"这个问题正在变得越来越难从外部界定,因为持续训练、checkpoint延续、部分层参数微调这些操作,已经让"新基座"和"老基座上做了很深的后训练"之间的边界变得模糊,厂商也未必有动力主动说清楚,毕竟"全新基座"本身就是一个更有营销价值的叙事。
一个更极端的旁证来自代码工具公司Cursor。它在2026年发布Composer 1.5时,官方博客明确写了一句很扎眼的话:这次模型的后训练阶段消耗的算力,已经超过了预训练基座模型本身所用的算力。这大概是目前唯一一家公开确认"后训练算力反超预训练算力"具体量级关系的案例,虽然Cursor不是传统意义上的基座模型实验室,但它代表了这条路径被推到极致之后会是什么样子。
四、横纵交汇洞察
把纵向的GLM系列发展史和横向的行业格局放在一起看,能看出几层此前分开看时看不出来的东西。
第一层是历史决策如何直接铸就了今天这个位置。智谱在GLM-5发布时就已经把研发重心押在了那套"异步强化学习基础设施"上——把生成和训练解耦这件事,表面上是个工程优化,实际上是在为"后续版本不换基座、只靠拉长后训练规模就能持续涨分"这条路径铺轨道。GLM-5.1的8小时长程任务、GLM-5.2的slime统一基础设施和单rollout PPO,都是在反复打磨同一套后训练系统的不同环节。等到GLM-5.3需要把训练环境从"孤立编程题"扩展到"真实工程全流程"时,智谱手里已经有一套跑通两轮的基础设施可以直接复用扩容,而不是从头搭建。这解释了为什么GLM-5.3能在三个月这么短的周期里就拿出Terminal-Bench 3.0六倍涨幅的成绩——它不是一次孤立的技术突破,是三代版本里持续投入同一套后训练系统工程的复利。
第二层是竞品的纵向路径差异,如何导致了今天各自不同的打法。DeepSeek从V3阶段就走的是"预训练效率优先、RL做增量"的路子,V3.2披露的"RL占预训练算力10%以上"这个数字,说明它对后训练投入的比例控制是有意识的、克制的;智谱的路径更激进,GLM-5.3把训练环境数量一口气扩了十倍以上,这是一种"把后训练当成第二次预训练来做"的打法。阿里选择同时跑两条线,本质上是把风险分散:Qwen3.5赌"原生多模态"这个新范式,Qwen-Max系列则用最快的迭代速度维持"最强开源编程模型"的叙事存在感,哪怕数据要延后补。这几条路径没有绝对的高下,但确实反映出各家公司在算力约束、组织架构、商业化压力上的不同处境——阿里财大气粗到可以两条线都跑,处于IPO后业绩压力下的智谱更需要一次能立刻见效、成本可控的打法,"不换基座"恰好意味着不用重新烧一轮预训练算力,用现有基座的沉没成本去换后训练产出,性价比更高。
第三层是今天的优势能不能追溯到具体的历史节点。GLM-5.3在效率维度上(同等难度用更少token跑出更高分)的优势,根子在于GLM-5开始的DSA架构和异步RL基础设施对推理成本的持续压缩;而它意外涌现的网络安全能力,根子在于GLM-5.1到5.2一路强化的长程任务处理能力——一个模型如果能连续工作8小时不丢失任务状态,那么这种能力天然适配漏洞挖掘这种需要长链条推理、反复试错、状态追踪的场景,攻防能力不是被单独训练出来的,是长程agentic能力的副产品。这也是为什么这次"意外"来得这么突然:智谱训练团队瞄准的是工程效率,命中的却是一个自己都没完全准备好如何应对的安全议题。
第四层,也是最值得警惕的一层,是今天的优势会不会变成明天的包袱。智谱长期坚持的"旗舰模型必开源"策略,曾经是它区别于DeepSeek、建立开发者生态和品牌信任的核心资产。但GLM-5.3第一次因为安全审查推迟开源,这意味着"后训练规模化"这条路径一旦跑得足够深,产出的能力可能会超出模型发布方自己的风险评估预案——今天推迟两周是可控的,但如果下一代模型的意外能力涉及生物、化学这类更敏感领域,"先发布API、权重延后审查"这套应对机制是否还够用,是一个悬而未决的问题。更宏观地看,行业普遍依赖的做法是"环境规模扩大、后训练时长拉长",这本质上是在用更大规模的合成任务环境去逼近真实世界的复杂度,而真实世界的复杂度里天然包含着模型设计者没有预见到的能力组合,网络安全只是第一个撞上这堵墙的案例,未必是最后一个。另外一个潜在的包袱是对国产算力的深度绑定——GLM-5系列完全基于华为昇腾训练,这在当下是应对出口管制的必要选择,也倒逼团队在RL基础设施上做了更多自研工程优化,但如果国产芯片生态在长期算力供给、软件工具链成熟度上跟不上后训练规模化对算力的胃口,这个曾经的"应对之策"也可能变成扩展速度上的瓶颈。
往前推演三个剧本。最可能的剧本是"不换基座冲刺"会在未来一到两个大基座周期内持续成为行业常规动作——DeepSeek、阿里、智谱、月之暗面几乎都已经把这条路径验证成熟,下一代基座发布之后,紧跟着的几个月大概率还是密集的纯后训练版本迭代,直到下一次预训练边际收益出现新的技术突破(比如新的架构范式或者训练数据形态)才会有下一轮"换基座"的窗口打开。最危险的剧本是意外能力溢出的频率和烈度持续上升,某次纯后训练迭代命中的不是网络安全这种尚可控的领域,而是更敏感的能力组合,逼着某家实验室在没有准备好应对机制的情况下仓促收权重甚至下架产品,行业信任因此受到一次实质性冲击,监管介入的窗口被提前打开。最乐观的剧本是后训练规模化真正把"能力提升"和"预训练算力投入"这两件事解耦开,中小型实验室不需要再去卷动辄数亿美元的预训练集群竞赛,靠更聪明的RL环境设计和训练基础设施工程就能在细分能力上追上头部模型,大模型竞赛的门槛因此实质性降低——但这个剧本能否成立,取决于后训练规模化本身会不会像预训练一样,最终也走向"只有算力和数据规模够大的玩家才玩得起"的老路,从目前GLM-5.3动辄十倍扩容训练环境、DeepSeek V4-Pro-0813动辄1.6万亿参数MoE的态势看,这个隐忧并非杞人忧天。
五、信息来源
- MarkTechPost - Z.ai Ships GLM-5.3 Without Retraining the Base Model
- Z.ai官方开发者文档 - GLM-5.3
- 新浪科技 - 智谱正式发布GLM-5.3
- IT之家 - 智谱正式发布GLM-5.3
- 网易科技 - 智谱发布GLM-5.3:会找漏洞,完整权重两周后开放
- Techtimes - GLM-5.3: Post-Training Produced Exploit Chains Z.ai Never Planned
- wccftech - Zhipu's GLM-5.3 Matches Fable 5 On Coding Using Only Post-Training
- the-decoder - Zhipu AI releases GLM-5.3
- 钛媒体 - GLM-5.3发布:基座没变,能力却涨了
- 东方财富网 - 智谱发布GLM-5.3 后训练Scaling提升智能上界
- ACL Anthology - GLM: General Language Model Pretraining with Autoregressive Blank Infilling
- arXiv:2103.10360 - GLM原始论文
- GLM-130B官方页面
- Tech Startups - China's AI startup Zhipu releases open-source GLM-4.5, rebrands as Z.ai
- 新浪科技 - GLM-4.6发布
- arXiv:2602.15763 - GLM-5: from Vibe Coding to Agentic Engineering
- 智源社区 - 重磅!智谱把GLM-5的所有技术细节都公开了
- Qbitai - 智谱GLM-5技术全公开!完全适配华为等国产芯片
- 智源社区 - 智谱开源GLM-5.1:迈向8小时级长程任务新范式
- 知乎 - 智谱GLM-5.2:一次"先把开发者拉上车"的发布
- 智谱官方研究博客 - GLM-5.2
- GitHub - THUDM/slime
- LMSYS博客 - slime: An SGLang-Native Post-Training Framework for RL Scaling
- arXiv:2508.06471 - GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models
- 知乎 - 大模型第一股诞生!从清华园到港交所,智谱这六年
- 时代周报 - 智谱上市首日大涨13.17%,市值达579亿港元
- 证券时报 - 全球大模型第一股智谱上市首日市值超570亿港元
- arXiv:2512.02556 - DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models
- 掘金 - DeepSeek-V4-Pro-0813发布解析
- 腾讯新闻 - DeepSeek V4-Flash-0731报道
- 证券时报 - 梁文锋投资人闭门会实录
- 阿里云社区博客 - Qwen3.5: Towards Native Multimodal Agents
- MarkTechPost - Alibaba Qwen Team Releases Qwen3.5-Omni
- fanweibin.cn - Qwen3.8-Max正式发布价格战与开源承诺
- arXiv:2507.20534 - Kimi K2技术报告
- arXiv:2602.02276 - Kimi K2.5: Visual Agentic Intelligence
- HuggingFace Blog - MiniMax M2.5解读
- MiniMax官方博客 - Forge: Scalable Agent RL
- arXiv:2602.10604 - Step 3.5 Flash技术报告
- Medium - GPT-5.5 is OpenAI's First New Base Model in a Year
- Wikipedia - GPT-5.5
- DeepMind模型卡 - Gemini 3.1 Pro
- TechCrunch - Anthropic Releases Opus 4.6 With New Agent Teams
- Anthropic - Claude Opus 5公告
- Cursor官方博客 - Composer 1.5
- arXiv:2509.25300 - Scaling Behaviors of LLM Reinforcement Learning Post-Training
- SemiAnalysis Newsletter - RL Systems Mind the Gap
- SemiAnalysis Newsletter - Scaling Reinforcement Learning
- 学术头条-公众号 - GLM-5.3发布原始信源