淘宝不再每次重新认识你:RecGPT-V3 如何把推荐系统变成有记忆的推理机器
2026-07-27
今天日报里的触发新闻,是淘宝 RecGPT 团队近日更新技术报告并由作者集中披露 RecGPT-V3 的生产结果。报告 7 月 17 日首次提交 arXiv、7 月 24 日更新,并非今天首发;今天的新鲜度来自这次更新后的传播。这个系统已经进入淘宝首页「猜你喜欢」:相对线上运行的 RecGPT-V2,在主信息流实验中,商品详情页访问量提高 1.28%,点击率提高 1.00%,成交笔数提高 1.97%,GMV 提高 3.97%,端到端服务资源消耗下降 52.4%。
这不是一条「大模型又做了推荐」的普通产品新闻。
真正需要深挖的是,淘宝正在改变推荐系统保存和处理用户历史的方式。过去,模型每次发起推荐,都要重新阅读一遍用户的长行为序列;现在,它先把行为压成一组可以持续更新、能够追溯原始证据的结构化记忆,再用自然语言理解需求,用商品语义 ID 指向具体商品,最后把原本数千 Token 的显式推理压进 10 个潜在 Token。
于是,推荐系统从「根据你刚刚做过什么,猜下一次点击」向另一种形态移动:它试图保存一个关于你的、会随时间变化的解释。
这条路线的价值,也正在这里。参数规模不是新闻,3.97% 的 GMV 也不是孤立的商业结果。真正的行业信号是:一家服务数亿用户的头部电商平台,开始把长期记忆、商品语言和潜在推理放进同一套生产推荐系统,并证明效果与算力可以同时改善。
但这套系统也留下了一个比效率更难的问题:当平台不只记得用户点过什么,还会把这些行为概括成「育儿阶段」「品牌忠诚」「消费升级」这样的长期判断,谁来保证这些记忆是准确的、及时的、可以被用户纠正的?
从每次重读到持续记忆:RecGPT 的一年
这一段看 RecGPT 怎样从一次性的意图分析,走到今天这套会积累、会压缩、也会犯错的用户记忆。
起点:不是替换排序模型,而是给旧流水线加一层「为什么」
现代推荐系统早已不是一个模型。它通常由召回、粗排、精排、重排等多层组成,在海量商品中逐步缩小候选集合。传统深度推荐模型擅长从点击、购买、停留时长和商品特征中学习相关性:看过跑鞋的人,可能会看运动袜;买过奶粉的人,可能继续购买纸尿裤。
这种相关性极其有用,也支撑了过去十多年互联网推荐的增长。但它有一个天然边界:相关性告诉系统「什么经常一起发生」,不直接告诉系统「用户为什么这么做」。
同一次点击可以有完全不同的含义。用户看羽毛球拍,可能是准备长期训练,也可能只是给孩子买礼物;购买婴儿用品,可能反映家庭阶段,也可能是代购。仅靠行为共现,模型容易把偶然动作当成稳定偏好,把短期需求重复放大。
RecGPT-V1 在 2025 年把大语言模型接进淘宝推荐流程,核心不是让模型直接生成商品,而是把大模型放在「用户兴趣挖掘—商品召回—推荐解释」这些环节中,先从行为历史推断意图,再生成可供下游系统使用的兴趣标签。它要解决的不是「下一件商品是什么」,而是先补上一层「这些行为可能在表达什么」。
这是一个很现实的起点。直接推翻成熟推荐流水线风险太大,尤其在淘宝这样的场景里,延迟、库存、价格、广告、商家公平、交易目标都必须同时满足。RecGPT-V1 选择把 LLM 的语言与推理能力嵌入旧系统,而不是一次性取代旧系统。它因此能更快上线,也从一开始就继承了旧系统的接口约束。
后来最棘手的问题,恰恰从这个折中里长出来。
第一阶段:把一个大模型拆成规划者和专家
RecGPT-V1 证明了意图推理可以进入生产,但它把多个推理任务平铺在一起:不同路线会重复阅读同一段用户历史,生成固定模板式解释,监督微调也容易把模型锁在训练分布里。
2025 年末公开的 RecGPT-V2 没有简单换一个更大的模型,而是改成分层多智能体结构。一个全局规划器先分析行为、拆出意图角色,再交给多个专业模块分别推断商品标签。Meta-Prompting 动态生成提示词,受约束的强化学习平衡准确性、解释、多样性和长度,Agent-as-a-Judge 则把评价拆成多步判断。
这一步的技术选择很关键。V2 把「理解一个用户」从一次模型调用,变成一套组织化推理流程。它扩大了意图覆盖,同时结合混合表示推理,把 GPU 消耗降低 60%。论文报告的淘宝线上实验中,点击率提高 2.98%,商品详情页访问提高 3.71%。
看起来,一切都在朝「更多专家、更细分工」发展。
可一旦上线规模扩大,团队发现最大的账单并不来自专家,而来自最前面的全局规划器。对于高度活跃用户,完整行为序列大约有 5.5 万 Token;每一次分析,规划器都从头阅读。论文给出的生产结构中,规划器占智能体意图分析计算成本约 95%,其开销约为单个专家模型的 20 倍。
更浪费的是,模型每次都在重复发现同一件事:用户有固定复购周期,偏好某个品牌,冬天会买保暖用品,近期开始照顾宠物。
它每次都「理解」用户,却从不记得自己已经理解过。
转折:成本问题逼出了状态问题
如果只把 V3 看成一次推理优化,会错过这条技术路线最重要的转折。
V2 暴露的表面问题是算力:5.5 万 Token 反复处理,太贵。更深的问题却是状态:一次次独立调用之间没有可继承的用户认知。系统只能保存原始日志,不能保存从日志中提炼出的判断。
RecGPT-V3 因此引入 Memory Hub。第一次运行时,它把完整行为序列压缩为若干结构化记忆单元;之后不再重读全部历史,而是读取已有记忆和新近行为增量,判断哪些记忆需要更新、哪些应该保留、哪些新行为足以形成新模式。
一条记忆不只是自然语言摘要。它包含行为模式类别、偏好总结、支持该判断的原始行为索引、品牌偏好、时间活动特征和创建时间。比如,系统可以把一组购买行为概括为「婴幼儿照护」,同时保留支撑这一判断的交易索引;当新行为出现时,把「0—6 个月」更新为「6—12 个月」,而不是简单在旧摘要后面继续追加。
这个设计里有三个值得单独看清的动作。
一是压缩。论文不同实验口径显示,结构化行为压缩可把原始序列的 Token 减少约 80% 至 94.5%。压缩不是为了做一份更短的日志,而是为了把重复出现、置信度较高的行为聚成可复用的模式。
二是溯源。每个记忆单元保存原始行为的整数索引。系统若判断用户偏爱某品牌,理论上可以回到产生这一结论的点击或交易,而不是只保留一句无法核查的模型总结。
三是演化。新行为到来后,模型在同一次前向计算中完成两件事:为已有模式补充或改写证据,以及从无法归入旧模式的行为中抽取新模式。没有新证据的记忆保持不动,发生变化的记忆则重新合成为当前状态。
这让推理成本从「每次请求都支付」变成「周期维护、反复复用」。以 RecGPT-V2 全序列方案为 100%,V3 每次推理降到 33.43%,记忆维护增加 10.77%,合计 44.20%,也就是用户建模计算量下降 55.8%。
不过,「持续记忆」并不等于实时记忆。论文明确写明,生产环境中的增量整理每两个月运行一次。这足以捕捉育儿阶段、季节偏好和复购周期,却未必能及时处理一场婚礼、一趟旅行或一次临时送礼。Memory Hub 解决的是长周期重复计算,不是每一种即时意图漂移。
这条两个月的更新周期,是理解 RecGPT-V3 边界的第一个钉子。
第二道关:语言能理解需求,却很难精确指向商品
V1 和 V2 用自然语言标签连接大模型与商品召回。大模型可以生成「适合马拉松训练的轻量跑鞋」这样的表达,再由下游召回系统寻找商品。
问题是,语言的丰富也是它的不精确。
一个标签可能对应成千上万件价格、材料、品牌和库存状态不同的商品。大模型理解了「为什么」,经过标签这一层再交给召回系统时,信息却被压扁了。标签像一座窄桥:一端是开放的用户意图,另一端是必须精确到 SKU 的商品空间。
V3 的做法是让模型同时使用自然语言和 Semantic ID,也就是商品语义 ID。团队先用 CN-CLIP 编码商品文本、图片和属性信息,再通过 Q-Former 融合;商品行为共现提供正样本线索,低多模态相似度的偶然共现会被过滤。随后,两级 RQ-VAE 把商品向量量化为两个离散代码:第一级表示较粗的语义簇,第二级区分簇内商品。
两级码本各有 32,768 个代码,合计向 Qwen3-14B 的词表加入 65,536 个新 Token。一个商品可以写成类似 <C_18921><C_40222> 的短序列。相近商品共享前缀,模型因而既能在自然语言里表达开放需求,又能输出下游检索直接使用的商品语义代码。
这不是简单把商品 ID 塞进词表。随机编号没有语义,模型只能死记。Semantic ID 的层级结构让相似商品拥有共享代码,使「商品」成为模型可以生成、比较和泛化的第二种语言。
训练也为此分成两步。持续预训练先把 SID 与商品标题、类别等文字信息对齐;指令微调再训练 SID 到文本、文本到 SID 的双向翻译,以及直接在 SID 空间进行序列推荐。为避免模型被电商数据训窄,训练数据中混入约 10% 的数学、代码、科学、医学和指令遵循等通用数据。
这个比例看起来不起眼,消融结果却很尖锐。保留通用数据时,模型在 GSM8K、MMLU、CMMLU 等任务上只出现有限下降;移除通用数据后,GSM8K 从 94.31% 一路跌到 4.70%,MMLU 只剩 0.12%。领域化不是把通用能力全部洗掉,再训练一套电商模型;通用知识恰恰是模型理解未见需求、跨类别联想和新商品的来源。
在这里,RecGPT 早期坚持用语言理解意图的选择没有被抛弃,而是和商品代码并排保留。语言负责广度,SID 负责落地。V3 不是从语言退回 ID,而是承认两种表示各有不可替代的部分。
第三道关:三千 Token 的推理,生产系统等不起
V3 面对的最后一个矛盾更直接。显式思维链能提高意图理解,但每个样本平均生成约 2,300 至 3,000 个推理 Token。对于聊天产品,这可能只是几秒等待;对于首页信息流的高并发推荐,它是无法接受的串行解码成本。
团队没有直接删掉推理,而是把显式推理蒸馏进最多 10 个可学习的潜在 Token。
训练先由强教师模型生成完整推理轨迹,再把轨迹切成若干段,每段对应一个潜在位置。随机初始化的潜在 Token 先通过局部替换进入原有词向量分布,之后进行单段、多段和全链路重建:有时遮住一段文字,让对应潜在 Token 帮助恢复;有时遮住多段;最后把整条推理链都藏起来,要求模型仅凭输入、潜在 Token 和结果重建原推理。
这套课程训练的目的,是让 10 个位置不只是无意义的占位符,而是携带足够信息,在需要时能还原为可读解释。之后,系统再用来自排序反馈的强化学习,直接优化线上业务目标。
结果说明,通用模型「多想一会儿」并不足以自动变成好推荐模型。Qwen3-14B 开启原生推理后,HR@30 只从 0.2276 提高到 0.2347;经过电商语义对齐的基础模型是 0.3050,显式思维链提高到 0.3508,10 个潜在 Token 达到 0.3462,强化学习后进一步提高到 0.3693。
潜在推理在相同硬件的 1,000 个样本测试中,把平均输出长度从 2,840 降到 122 Token,总耗时从 1,020 秒降到 295 秒,端到端速度提高 3.46 倍。它把瓶颈从串行输出解码,转向更容易并行的输入预填充。
这里仍需克制一个常见误读:能够重建一段可读解释,不等于已经证明这段解释忠实记录了模型作出推荐的真实因果过程。重建目标保证潜在表示携带了足够的推理文本信息,但「可解码」与「可审计」之间还有距离。若解释要用于投诉处理、商家申诉或监管审查,仍需要独立的忠实度验证。
上线:真正的突破是效果和算力没有再做单选题
RecGPT-V3 的线上实验以正在运行的 V2 为对照,实验组和控制组各获得淘宝总流量的 1%。团队分别测试纯商品宫格和混合信息流:后者包含商品、广告、直播等多种内容。
纯商品场景中,商品详情页访问提高 3.08%,点击率提高 0.98%,成交笔数提高 3.10%,GMV 提高 7.51%。主信息流中,对应指标分别提高 1.28%、1.00%、1.97% 和 3.97%,日活提高 0.56%。
效率方面,V3 总 GPU 用量仅为 V1 的 19%;相对 V2,端到端服务资源消耗减少 52.4%。这个数字不是泛指所有服务成本,也没有包含组织、人力、数据治理等成本,它指向论文所测量的在线计算资源。更准确地说,Memory Hub 把规划器的大额重复开销摊薄了,抵消了 SID 与潜在推理给专家模型带来的约 15% 局部计算增量。
因此,V3 的行业价值不在于单项指标最高,而在于它打破了一个长期工程直觉:更复杂的 LLM 推荐通常只能用更多算力换更高效果。阿里给出的结果是,先改变状态保存、商品表示和推理形式,效果与计算账单可以同时向好。
当然,这仍是一份公司团队发布、尚未经过同行评审的技术报告。论文没有披露 A/B 测试持续时间、GMV 绝对值、用户分层结果,也没有把三项核心改动逐一做完整的线上因果拆分。我们知道整套 V3 优于 V2,却还不能从线上数据精确判断 3.97% 中有多少来自记忆、多少来自 SID、多少来自潜在推理与强化学习。
这条证据边界,不能被亮眼数字抹掉。
各家的分岔:有人扩参数,有人拆流水线,阿里在造记忆
这一段把 RecGPT-V3 放回 2026 年的生成式推荐赛道,看头部平台解决的是不是同一道题,以及它们为什么长成了不同的系统。
Meta:把推荐写成序列建模,先证明规模还能继续涨
Meta 在 2024 年公开的 Generative Recommenders 与 HSTU,是这一轮工业生成式推荐的关键起点之一。它把传统 DLRM 中分散的稀疏、稠密和交互特征统一成时间序列,把召回和排序改写为序列转导问题。
Meta 面对的核心约束是超长、非平稳、高基数的用户行为流。HSTU 为此修改注意力结构,配合随机长度训练和 M-FALCON 微批推理。在长度 8,192 的序列上,HSTU 相对基于 FlashAttention2 的 Transformer 快 5.3 至 15.2 倍;尽管生成式模型计算复杂度可达到传统 DLRM 的 285 倍,经过推理摊销后,在部分候选规模下仍能获得更高 QPS。论文还报告了大型平台多业务面的生产实验和 12.4% 的 A/B 收益,但没有公开业务指标口径。
Meta 的路线可以概括为「把行为本身当语言」。它不依赖自然语言解释用户,而是尽可能完整地建模内容与动作序列,再通过架构和系统优化把规模推上去。
与 RecGPT 相比,Meta 更接近一个强大的行为世界模型:用户做过什么、时间如何流动、下一项内容和动作如何联合生成。RecGPT 则额外引入自然语言意图、结构化记忆和可读解释。
两者都反对把推荐永远困在手工交叉特征里,但一个相信更完整的行为序列,一个相信对行为进行语义概括。前者保留更多原始信号,计算和数据规模更重;后者压缩得更激进,也承担摘要错误和意图误判。
快手:先把召回和排序接起来,再让模型把理由写进序列
快手的 OneRec 选择的是另一条工业化道路:用端到端生成模型统一召回和排序,通过 Semantic ID 直接生成内容候选,再用偏好对齐让生成结果接近下游目标。
OneRec 已在快手和快手极速版处理约 25% 的 QPS,论文报告两端 App 停留时长分别提高 0.54% 和 1.24%。后续 OneRec-Think 把显式文本推理插入 SID 生成之前,以 Think-Ahead 结构减少推理对在线延迟的冲击;在快手短视频场景中,App 停留时长提高 0.159%,观看时长提高 0.169%。
到了 2026 年的 OneMall,快手又把生成式推荐扩展到电商中的商品卡、短视频和直播,把商品语义 Tokenizer、Transformer/MoE 架构和强化学习串起来。论文报告其已服务超过 4 亿日活用户,商品卡 GMV、短视频订单和直播订单均有提升。
快手与阿里都在使用 SID,也都试图让推理进入推荐。但两家的历史包袱不同。
短视频平台首先要解决的是连续消费和多内容形态统一:一个用户滑过几十条视频,下一条内容的节奏、兴趣和时效性决定停留。电商则必须从模糊意图落到可交易商品,库存、价格、品牌、商家和购买周期都更突出。因此,OneRec/OneMall 更强调统一分发场景和生成流水线,RecGPT 更强调「一个人为什么买」以及如何把语言意图精确落到商品。
快手的显式推理仍然发生在当前序列里;RecGPT-V3 则进一步把长期状态放到请求之外,并把推理压进潜在 Token。前者更容易直接观察理由,后者更适合反复复用长期认知。
美团:不丢掉旧系统的交叉特征,把生成模型嵌进高频交易
美团的 MTGR 对纯生成路线保持了更强的工程警惕。团队发现,如果为了生成式架构放弃传统推荐系统长期积累的交叉特征,性能会明显下降,而且单靠扩大模型无法补回损失。
因此,MTGR 基于 HSTU 建模,却保留用户、上下文、候选商品和交叉特征;同一用户的多个候选共享用户表示,以降低训练和推理成本。系统还用 Group-Layer Normalization 区分不同语义空间,用动态掩码防止信息泄漏。论文报告 MTGR 已承接美团主要流量,计算量达到 DLRM 的 65 倍,并取得近两年最大的线上提升。
美团后来又用 MTGRBoost 优化动态稀疏表、序列负载均衡、Embedding 去重和算子融合,在百卡规模将训练吞吐提高 1.6 至 2.4 倍。
这是一条「不要为了范式纯度丢掉生产知识」的路线。美团的即时交易数据、地理位置、配送约束、商户状态和交叉特征价值很高,旧系统并非等待淘汰的包袱,而是业务知识的载体。
RecGPT-V3 也没有完全端到端替代旧流水线。它用 SID 缩短大模型与召回的距离,但仍保留文本标签和下游检索。两者的共同点是承认工业推荐不会因为 Transformer 出现就一夜清零。差别是,美团主要保留显式工程特征,阿里主要保存模型提炼出的用户状态。
三条路线,其实在回答三个不同问题
把几家放在同一张表里,会看到「生成式推荐」并不是一条统一赛道。
| 玩家与系统 | 最先解决的问题 | 用户历史如何处理 | 商品/内容如何表示 | 推理形态 | 已公开的生产信号 | |---|---|---|---|---|---| | Meta HSTU | 让生成模型在超长行为流上继续扩展 | 长序列直接建模,强调时间和动作 | 高基数内容与动作 Token | 隐式序列建模 | 多业务面部署,公开 12.4% A/B 收益 | | 快手 OneRec / OneMall | 统一召回、排序和多分发场景 | 当前行为序列与压缩结构 | Semantic ID、跨场景电商 Tokenizer | 显式 Think-Ahead 与强化学习 | OneRec 承接 25% QPS;OneMall 服务超 4 亿日活 | | 美团 MTGR | 保留交叉特征,同时获得规模收益 | 用户序列与业务特征联合 | 传统特征 Token 化 | HSTU 生成建模 | 承接主要流量;训练系统处理数亿日请求 | | 阿里 RecGPT-V3 | 让用户理解可积累、可落到商品、可低成本推理 | 结构化长期记忆 + 近期增量 | 自然语言 + 两级 Semantic ID | 10 个潜在 Token,可按需重建解释 | 淘宝 1% 对照实验;GMV +3.97%,资源 -52.4% |
Meta 把重点放在「序列能不能扩」,快手放在「流水线能不能合」,美团放在「旧特征能不能留」,阿里则放在「理解能不能积累」。
这也解释了为什么不能只拿 GMV、停留时长或吞吐量做排行榜。各家产品目标、基线、流量比例、指标定义和实验周期不同,数字没有直接可比性。真正可比的是技术选择:它们愿意把什么信息压缩掉,把什么信息留在系统里,又把哪一种成本放到离线训练、周期维护或在线推理。
用户视角:更懂你,与更难摆脱你,是同一件事
从用户体验看,RecGPT-V3 最有吸引力的地方很直观。它可以记住长期偏好,不必因为一次误点就从头猜;它能识别复购、生命周期和季节变化,也能借助通用知识发现日志里没有直接共现的新需求。主信息流点击、日活和成交同时提高,说明收益没有只停在某一个漏斗环节。
可同一套机制也会放大错误记忆。
论文的人类评测中,记忆所引用的行为索引准确率为 95.27%,但行为模式分类准确率只有 82.89%。也就是说,系统通常能准确指出「哪些行为支持这个判断」,却仍可能把这些真实行为概括成错误的生活阶段或偏好模式。
这和人的偏见很像:证据可以是真的,故事仍然可能讲错。
而且,系统每两个月才整理一次记忆。错误标签若被写入长期状态,可能在一段时间内持续影响推荐。论文没有披露用户能否查看、删除或纠正这些记忆,也没有讨论记忆保留期限、敏感属性推断和跨场景使用边界。
因此,RecGPT-V3 当前最强的产品能力,也是未来最需要治理的地方。传统推荐错误像一次猜错;状态化推荐错误更像建立了一份错误档案。
为什么推荐系统的下一道门槛不是更大,而是更会忘
把 RecGPT 的来路和此刻的行业分岔叠在一起,有三件事就说得通了。
历史上的折中,长成了今天的优势
RecGPT-V1 没有直接取代整套推荐系统,而是在成熟流水线前增加意图理解。这个选择当时看起来保守,却让阿里积累了两种其他路线不一定同时拥有的资产:一是大模型解释用户行为的训练数据和线上反馈,二是语言标签与商品召回之间长期暴露出来的失败案例。
V2 的多智能体结构进一步放大了这种经验。规划者与专家的分工,证明了复杂意图可以拆开处理,也让团队清楚看到成本集中在哪里。没有 V2 那个占 95% 计算量的全局规划器,就不会如此迫切地把「重复理解」改造成「持久记忆」。
SID 也是早期折中的后果。因为 V1、V2 先走了自然语言标签路线,团队才会准确看见 Tag-to-Item 的信息瓶颈;V3 没有简单转向纯 ID,而是保留语言与 SID 双通道。这让它既能利用通用模型的开放知识,又能把结果落到商品空间。
潜在推理同样来自对可解释性的坚持。如果一开始只追求预测分数,最便宜的做法可能是删除显式理由;RecGPT 先把解释作为产品组成,后来才有动力训练一套可压缩、可重建的推理表示。
今天三项优势——记忆、双模态商品语言、潜在推理——都不是突然拼装的功能。它们分别是 V2 状态缺失、V1 标签瓶颈和显式思维链成本留下的答案。
最大的护城河不是模型,而是「可复用的用户解释」
大模型和 SID 技术都在快速扩散。Meta、快手、美团、阿里已经公开多套生成式推荐架构,Transformer、HSTU、RQ-VAE、强化学习都不是某一家永久独占。
更难复制的东西,是平台如何把用户行为转成可复用的中间状态,并通过真实交易不断校正。
传统推荐的核心资产常被描述为行为数据。RecGPT-V3 增加了一层新资产:对行为的结构化解释。原始日志记录「买了什么」,记忆单元记录「这个行为属于哪种模式、何时出现、如何变化、由哪些证据支持」。如果这套表示稳定,它可以跨召回、排序、搜索、广告甚至购物智能体复用。
这让 Memory Hub 很像推荐系统内部的一份「用户世界模型」。它不是把所有历史塞进参数,而是在模型外维护一组可更新状态。随着请求增加,理解成本被摊薄,状态又能帮助下一次推理。流量越大、复用越频繁,这种架构的经济性越明显。
但护城河与风险来自同一个机制。平台一旦形成长期用户解释,就会产生强烈的路径依赖。后续模型会把旧记忆当作高信号输入;旧判断越常被使用,越可能影响新的曝光和行为;新的行为又反过来验证旧判断。一个最初只是 82.89% 准确的模式分类,可能通过推荐反馈逐渐变成自我实现的偏好。
所以,真正决定这条路线能走多远的,不只是记得更准,而是会不会忘。
哪些记忆应该衰减?一次送礼行为多久后不再代表本人偏好?育儿阶段、健康关注、收入水平等可能的敏感推断能否进入长期状态?用户明确表达「不要再推荐」时,系统删除的是展示规则,还是产生推荐的那条记忆?这些问题在 V3 报告中尚无答案,却会直接决定状态化推荐能否从内部工程能力变成可信产品。
今天的好决策,也可能成为明天的包袱
Memory Hub 用结构化摘要换取算力,优势非常清楚。但任何压缩都在做信息选择。它保留高置信、可归类的模式,可能弱化偶然、矛盾和新生的信号;而真正有价值的新兴趣,最初往往正是少量、不稳定、难归类的行为。
两个月更新一次能降低维护成本,却可能把系统推向「擅长长期习惯,不擅长快速变化」。如果竞争对手用更轻量的在线状态更新,在不重读全历史的情况下按天甚至按小时修正用户表示,V3 当前的成本优势会变成新鲜度包袱。
双模态 SID 也有类似问题。两级量化让商品空间可以被语言模型生成,但码本不是自然规律,而是由商品内容和共现数据学出来的。新品、冷门商品和行为稀疏商品可能得到不够稳定的代码;码本更新还会带来版本迁移问题。若 SID 结构频繁变化,旧用户记忆中对商品空间的理解可能失配;若长期不变,商品语义又会落后于市场。
潜在推理用 10 个 Token 换来 3.46 倍速度,是极漂亮的工程结果。它的包袱是可观测性下降。显式思维链虽然昂贵,却容易抽样检查;潜在状态只能通过重建间接观察。如果训练出的解释只是「看起来合理」,而非忠实反映决策依据,系统会在效率提高的同时失去诊断窗口。
历史常常这样工作:一个阶段里最正确的工程决策,会在规模放大后生成下一阶段最难的约束。V1 的标签接口促成 SID,V2 的多智能体促成 Memory Hub;未来,V3 的长期记忆、固定码本和潜在推理,也会成为 V4 必须处理的问题。
对金融行业的映射:长期记忆比一次答对更有价值,也更危险
RecGPT-V3 发生在电商,但它对资管、财富管理和银行的信号并不抽象。
金融机构目前的大量智能体仍是无状态的:每次读取客户资料、持仓、交易记录、风险测评和研究文档,再从头生成回答。随着历史增长,成本上升,前后判断也容易不一致。Memory Hub 提供了一种可借鉴的系统设计:把长期事实压成结构化、可追溯、可增量更新的状态,把原始记录留作证据,只让模型读取当前状态和最新变化。
例如,投研智能体可以把一家公司多年财报、管理层指引和风险事件压成带出处的观点记忆;组合管理智能体可以保存策略约束、历次调仓理由和失效条件;财富管理系统可以区分监管意义上的风险承受能力、客户明确表达的偏好,以及模型从行为中推断的临时倾向。
但金融场景不能直接复制淘宝的容错方式。推荐错一件商品,用户可以划走;把错误记忆用于适当性判断、风险提示、授信或交易建议,后果完全不同。
因此,金融版 Memory Hub 至少需要四个淘宝报告没有展开的机制:事实与推断严格分栏;每条推断带来源、时间、置信度和失效条件;用户或合规人员可以查看和纠正;任何状态更新都有版本记录并可回滚。潜在推理可以用于降本,却不能替代面向审计的显式决策记录。
对金融机构而言,RecGPT-V3 最值得复制的不是「记住客户」,而是把重复读取的成本改造成可治理的状态维护。少了「可治理」三个字,长期记忆只是更持久的模型猜测。
未来推演
沿着过去一年的演变和今天的竞争分岔,RecGPT-V3 接下来大致有三个走向。
最可能:记忆成为推荐基础设施,模型退到可替换层
最可能的走向,是 Memory Hub 从 RecGPT 的专用模块变成淘宝推荐、搜索、广告和购物智能体共享的用户状态层。
这条路径符合阿里的现实利益。结构化记忆已经把每次重读历史改成周期维护;自然语言与 SID 又能连接多种商品理解和召回任务。只要接口稳定,上层可以替换 Qwen 版本、规划器或专家模型,不必重新生成全部用户状态。
V4 更可能优化更新频率、记忆衰减和跨场景调用,而不是单纯增加参数。观察信号包括:增量整理是否从两个月缩短到周或日;搜索与购物 Agent 是否开始调用同一套记忆;论文是否披露记忆删除、冲突合并和版本迁移机制。
如果这些动作发生,生成式推荐的竞争单位就会从「一个更强模型」变成「一套能积累状态的系统」。模型仍重要,但真正黏住业务的是状态格式、反馈管线和治理工具。
最危险:错误记忆进入反馈循环,效率优势变成信任事故
最危险的走向,不是 GMV 没有继续增长,而是错误或敏感推断在多个场景复用。
82.89% 的行为模式准确率在推荐实验里可能已经足够产生净收益,但它也表示相当一部分模式会被错分。若这些记忆只影响一次首页排序,损失有限;若它们被购物 Agent、广告系统、价格激励或金融服务共同读取,错误会跨场景放大。
长期记忆还可能加重过滤泡泡。系统为了节省成本,不再完整重读原始历史,而是优先读取自己过去形成的摘要;摘要决定曝光,曝光决定新行为,新行为再强化摘要。用户会越来越像系统记忆中的那个人,而不是正在变化的本人。
预警信号包括:记忆在没有用户控制的情况下跨业务复用;敏感属性通过普通消费行为被间接推断;模型解释无法忠实还原决策;出现「删除历史后推荐仍不改变」的用户反馈。任何一个都可能把一项算力优化变成数据治理事件。
最乐观:平台学会同时记住证据、保留不确定性、允许用户纠错
最乐观的走向,是 RecGPT 把「可追溯」真正做成产品能力,而不只停在内部数据结构。
用户可以看到系统记住的偏好,区分「我明确告诉平台的」「系统从行为推断的」和「短期猜测」;可以删除一条记忆、设置有效期,或告诉系统某次购买是送礼。模型在更新状态时不强行给每个行为归类,而是保留矛盾与不确定性。商品 SID 也能随目录更新进行稳定迁移,不让旧记忆在码本变化后失真。
对企业端,潜在推理负责高频在线决策,显式证据链负责抽检、申诉和审计;两者不是二选一。对金融等高风险行业,状态层进一步区分事实、规则与推断,任何推断都带有效期和责任边界。
如果做到这些,RecGPT-V3 今天解决的就不只是推荐成本。它会给所有长期运行的企业智能体提供一个更成熟的答案:智能体不必每次从头阅读世界,但它保存下来的世界,必须能够被检查、被修正,也能够被忘记。
报告开头那个问题也就有了答案。
淘宝不再每次重新认识你,确实可以带来更高成交和更低算力。但一套真正成熟的记忆系统,不能只证明它记得有用,还要证明它忘得负责。
信息来源
- RecGPT-V3 Technical Report(arXiv,v1 于 2026-07-17 提交,v2 于 2026-07-24 更新)
- RecGPT-V3 Technical Report v2 PDF
- Hugging Face 论文页与作者发布帖
- RecGPT-V2 Technical Report(arXiv)
- RecGPT Technical Report / RecGPT-V1(arXiv)
- Actions Speak Louder than Words: Trillion-Parameter Sequential Transducers for Generative Recommendations(Meta HSTU)
- Meta Generative Recommenders 官方代码仓库
- OneRec Technical Report(快手)
- OneRec-Think: In-Text Reasoning for Generative Recommendation(快手)
- OneMall: One Model, More Scenarios — End-to-End Generative Recommender Family at Kuaishou E-Commerce
- MTGR: Industrial-Scale Generative Recommendation Framework in Meituan
- MTGRBoost: Boosting Large-scale Generative Recommendation Models in Meituan
- TSGR: Taobao Search Generative Retrieval