Google 给 Agent 造了一本会自己修订的百科全书,9B 模型靠它反超了 27B
2026 年 8 月 27 日,Google Research 提交论文《WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution》。它让 Agent 在反复执行任务时,把经验持续编成一份可修订的 Wiki,再从中提炼可直接调用的技能,全程不修改模型权重。
效果颇为反直觉:在数学推理、网页搜索、表格操作、长文档问答和具身交互五项基准上,Qwen-3.5-9B 加载 WikiSkill 后平均得分为 47.4%,超过未使用该系统的 Qwen-3.6-27B(39.4%)。WikiSkill 分别让 Qwen 4B、9B、27B 提升 12.3%、17.5% 和 23.9%。技能还能跨模型迁移:在 ALFWorld 上,9B 模型使用 27B 模型演化出的技能得分 70.2%,高于使用自身技能的 63.4%。
三层架构,和一条不能通融的门槛
WikiSkill 把经验分成三层。
Raw 层保存完整执行轨迹,包括推理、工具调用、返回结果和最终答案;数据写入后不可修改,相当于现场记录。Wiki 层由 Wiki Maintainer 持续维护,包含失败模式、成功策略、目录索引、演化日志和技能效果记录;它只增量累积,从不重置。Skills 层则把技能分别封装,并记录每项技能对应 Wiki 中的哪个问题。
三层的关键差别在于回滚规则:候选技能集只有在验证集上严格超过历史最佳成绩才会被接受,否则整体退回上一版本;Wiki 层却无论成败都不会回滚。一次失败的技能提案可以被撤销,其中留下的经验仍会参与下一轮提炼。消融实验还显示,训练阶段若允许 Agent 直接查看 Wiki,最终效果反而下降:先独立执行、再总结错误,比直接照抄既有经验更有效。
论文明确将 Andrej Karpathy 2026 年 4 月提出的“LLM Wiki”视为直接灵感。Karpathy 把知识系统分为不可变的原始素材、由 LLM 维护的 Markdown Wiki 和 Schema,主张让知识在每次编译中累积,而不是像传统 RAG 那样每次临时检索和拼装。WikiSkill 将这一构想系统化地用于 Agent 技能演化。
不过,论文没有引用 Reflexion、Voyager、ExpeL、Agent Workflow Memory、Generative Agents、MemGPT 等 Agent 记忆和自我改进领域的经典工作;这些研究更接近其学术前史。WikiSkill直接对比的是 2026 年同期出现的 EvoSkill、Trace2Skill 和 SkillOpt。因此,它是“从经验演化可复用技能”热潮中的新方案,而非赛道开创者。
同一周,另一套记忆方案盯上了“长任务会迷路”
8 月 25 日提交的 Recuris,则专门解决 Agent 在长程交互中丢失任务状态的问题。它由 Working Memory 和 Experiential Memory 两个耦合模块组成:前者追踪当前状态并选择下一项技能,后者保存技能、经验卡片和路由规则。每一步都被记录为“状态—技能—动作—结果”证据链,使系统能把失败定位到具体记忆组件并局部修补,而不必重建整个记忆库。
Recuris 同样由身份固定的 Meta-Agent 更新记忆,同样设置验证集门槛,也不修改下游模型权重。在 τ²-Bench、SkillFlow 和 Terminal-Bench 2.1 上,它覆盖 10 个模型、37 组“模型×基准”组合,其中 35 组得到提升。GPT-5.6 Sol 在 τ-bench 上提高 17.8 个百分点;Claude Opus 5 提高 15.6 个百分点,达到 87.9%;最长任务中的最高增幅为 32.2 个百分点,常见长程失败最多减少 80%。
两者代表不同方向:WikiSkill 偏向知识管理,把经验沉淀为人类可读、可追溯且可跨模型迁移的 Wiki,主要面向数学、搜索和表格等中等长度任务;Recuris 更像带因果证据链的状态机,强调长任务中的故障定位和局部修复。
但 Recuris 的外部验证明显更弱。目前除论文、代码仓库和 HuggingPapers 转发外,尚未见独立第三方评测;作者机构信息也主要来自 GitHub 页面,而非 arXiv 摘要页。相关结论的可信度暂时不及核心数据可由原论文核对、且已有多家媒体报道的 WikiSkill。
这条路线今年一直很拥挤
2026 年综述《Self-Improvements in Modern Agentic Systems: A Survey》把 Agent 自我改进分为两类:直接更新模型权重,以及不碰权重、只更新外围系统。综述认为二者目前仍像“两个孤岛”;少数同时更新权重和外围系统的方案甚至把这种结合当作核心创新。
WikiSkill 和 Recuris 都属于后者。同期出现的 SkillClaw、SkillRL、OpenSpace、MetaSkill-Evolve、SkillEvolver 和 SkillRevise,共同形成了技能层自演化研究簇。产业界也在靠近:Anthropic 先推出 SKILL.md 渐进式加载机制,随后增加定期回顾会话与记忆、提炼模式的 Dreaming 流程,并为 Claude Managed Agents 开放持久记忆测试。
腾讯云 8 月开源的 TencentDB Agent Memory v2.0 更直接:它把对话、文档和代码转化为四类可复用资产,其中就包括“LLM-Wiki”和“Skill”。这是目前最接近把 WikiSkill 式构想产品化的产业信号。Mem0、Zep、Letta 等成熟框架则主要服务对话和交互记忆,与“经过验证的技能层”相邻但并不相同。
风险摆在明面上,而且还没解决
这条路线的优势很清楚:训练成本低、可解释、可跨模型和版本迁移,也不要求取得模型权重。但 Agent 并未真正把能力学进参数,只是不断为自己改写操作指南;指南本身仍可能出错。
同期研究《When Not to Write Memory: Governing False Promotion from Correlated Agent Traces》进一步追问:哪些经验根本不该进入永久记忆?其 GovMem 机制把错误晋升率从接近 60% 降至 4%,但在真实轨迹测试中,作者仍认为没有任何案例安全到足以自动写入永久记忆。
这揭示了验证集门控的边界:它只能判断一次修改是否提高分数,不能证明经验真实可靠,也无法回答经验何时过期、何时应被删除。可共享技能还可能携带恶意指令或泄露敏感信息。错误经验被反复强化、旧结论长期滞留,将是这类系统进入生产环境前必须解决的问题。
目前传播也仍限于技术圈小范围:Hacker News 的相关提交仅有 1 分、0 评论,X 上只有零星转发,尚未见 Google DeepMind 官方、Karpathy 本人或学术复现团队回应。The Decoder、XenoSpectrum 等媒体主要聚焦“9B 反超 27B”这一结果。
值得关注的地方
WikiSkill、Recuris 与腾讯云的产品动作集中出现,说明“不改权重、靠经验积累变强”正从论文原型向基础设施迁移。但工程能力已经跑到治理机制前面:性能验证不等于记忆可靠,更不等于内容具备时效性和安全边界。
接下来真正值得观察的,不只是 Agent 能否积累更多技能,而是系统能否识别偶然相关、主动淘汰过时经验,并阻止有害内容进入永久记忆。谁先把这套治理闭环补齐,谁才更可能把“会写经验的 Agent”变成真正可长期运行的系统。
信息来源
- WikiSkill 论文:arXiv:2608.27454
- Karpathy “LLM Wiki”构想原文:GitHub Gist
- WikiSkill 中文报道:Datawhale
- WikiSkill 英文报道:The Decoder
- Recuris 论文:arXiv:2608.24876
- Recuris 代码仓库:GitHub - Gen-Verse/Recuris
- Recuris 传播来源:HuggingPapers
- Self-Improvements 综述:arXiv:2607.13104
- 记忆治理研究“When Not to Write Memory”:arXiv:2607.02579
- 腾讯云 TencentDB Agent Memory v2.0:MarkTechPost
- Anthropic Agent Skills 与 Dreaming:Anthropic 工程博客、MindStudio 报道