三家模型巨头的加密推理轨迹:无状态便利把密文变成了可重放的能力票据
2026-08-12
一、触发新闻与一句话定义
Anthropic、OpenAI 与 Google 在 2026 年 8 月被公开证实,其 API 返回的加密推理块可跨会话、跨用户及同一供应商的不同模型重放;研究者用较弱模型把强模型的隐藏推理“模糊解码”为明文,三家在收到报告后采取了修补措施。论文于 8 月 10 日提交,研究者称修补后已无法再次发动同类攻击,但供应商尚未公开修补的具体层级。
本文研究的对象,是推理模型 API 中由客户端保存、下一次请求再原样传回的加密推理状态:它不是普通聊天记录,也不只是证明内容没被篡改的数字签名,而是一段服务端能够解密并重新放入模型上下文的隐藏计算状态。
先把最容易误解的地方说清楚。研究者没有拿到 Anthropic、OpenAI 或 Google 的密钥,也没有证明可以用传统密码分析逐字解密任意密文。他们做的是另一件更像现代 AI 系统的事:把强模型产生的合法密文交给同一家供应商的弱模型,再用越狱提示要求弱模型复述刚刚读到的隐藏内容。解码结果与原始推理到底逐字一致,研究者无法取得明文真值做最终比对,所以论文谨慎称其为“模糊解码”。但在 120 道 Codeforces 题上,解码文本重新编码后的长度与 API 计费所报告的推理 Token 数紧密对应;更有力的旁证,是解码结果找出了可独立核验、却没有出现在可见对话里的隐私数据。
这次事件真正击中的不是某个模型的单次越狱,而是一项被三家头部供应商分别采用的系统设计:为兼顾无状态调用、工具链连续性和零数据保留,服务端把隐藏推理装进不透明信封交还客户端;信封验证了“里面的内容是真的”,却没有充分验证“现在由谁、在哪个会话、交给哪个模型打开”。密文没有失效,失效的是它的使用边界。
二、纵向分析:从诞生到当下
1. 2022—2024:推理从提示技巧变成模型内部的计算预算
2022 年的 Chain-of-Thought 论文让“让模型一步步想”成为显式提示技术。那时的推理过程通常就是文本:模型把中间步骤和答案一起吐出来,开发者看得见,也能直接拿去做监督数据。它的好处很直观——复杂算术、符号推导和多步常识题更容易做对;它的代价也同样直观——错误思路、敏感信息和可复制的解题轨迹会一起暴露。
真正改变产品架构的是 2024 年 9 月的 OpenAI o1。OpenAI 不再把“多想一会儿”只当作 Prompt 技巧,而是把训练时强化学习与推理时计算量都做成模型能力。官方数据显示,早期 o1 在 AIME、Codeforces 等任务上远超 GPT-4o;更重要的是,官方同时作出一项产品决定:不向用户展示原始思维链,只展示模型生成的摘要。OpenAI 给出的理由有三层——用户体验、竞争优势,以及保留未经用户偏好训练的思维链供安全监控使用。
这一步埋下了此后两年的核心矛盾。推理轨迹越能提高能力,它就越像模型供应商的知识产权;推理轨迹越能记录模型如何调用工具、处理数据、越过死路,它又越像智能体的运行状态。前一种身份要求隐藏,后一种身份要求跨步骤传递。两种要求并不天然相容。
2. 2025 年初:隐藏推理遇上工具调用,状态必须穿过 API 边界
2025 年 2 月,Anthropic 发布 Claude 3.7 Sonnet,首次把普通回答和 extended thinking 合进同一个“混合推理模型”。API 用户可以指定思考预算,Claude 先产生 thinking block,再产生可见文本。早期产品强调推理可见;后续 Claude 模型逐步把可见内容改为摘要或直接省略,但仍在 thinking block 中返回一段 signature,保存完整推理的加密副本。
为什么不能生成完答案就扔掉?因为工具调用把一次回答拆成了多次网络往返。Claude 先思考,然后发出工具请求;客户端执行工具,再把结果送回来;Claude 必须知道自己为什么调用这个工具,才能沿着原计划继续。Anthropic 当前文档因此要求:在一个工具调用回合内,开发者必须把所有 thinking block 完整、原样传回;修改、换序或漏掉块都可能收到 400 错误。文档还写明,同一签名可以跨 Claude API、Amazon Bedrock 和 Google Cloud 使用。这种可移植性原本是多云部署能力,却也扩大了凭据的可用范围。
OpenAI 沿着另一条产品路径抵达同一地点。2025 年 3 月,Responses API 把文本、工具调用、文件搜索和计算机操作统一为 item;5 月又为零数据保留客户加入 reasoning.encrypted_content。当 store=false 时,OpenAI 不在服务端保留推理状态,而是把加密 reasoning item 返回给客户。客户在下一次请求中原样回放,o3、o4-mini 等模型便能在工具调用前后保留推理,减少重复思考、延迟和 Token 消耗。
这不是一个可有可无的调试字段。对长任务来说,隐藏推理承担了“未完成计划”的角色;删掉它,模型往往只能从可见对话重新猜测上一步为什么那样做。OpenAI 后来解释 Codex 智能体循环时说得更直接:为了无状态运行和支持 Zero Data Retention,Codex 不依赖 previous_response_id,而把 encrypted_content 随历史一起带回。无状态与零保留是企业客户想要的隐私属性,加密块正是让它们不牺牲多轮推理能力的交换条件。
Google 的演进稍晚但更彻底。Gemini 2.0 Flash Thinking 先试水,2025 年 3 月的 Gemini 2.5 把“思考”变成整个模型家族的默认方向。到函数调用阶段,Gemini 会在响应 part 中附上 thoughtSignature;客户端返回工具结果时,必须把签名连同原始 part 一起传回。Gemini 3 进一步要求函数调用签名必须存在,否则直接返回 4xx。Google 的官方 SDK 会自动处理这些字段,手写 REST 历史的开发者才需要直接接触它们。
三家的字段名不同,产品叙事也不同,但到 2025 年中,行业已经形成一套事实标准:原始推理不让客户端读取,服务端也不一定替客户端保存;一段不透明状态夹在工具调用和对话历史之间来回传递。
3. 2025—2026:便利开始形成路径依赖
一项 API 设计一旦进入智能体框架,就很难只用“安全或不安全”来决定是否删除。加密推理块同时解决了四个工程问题。
第一是连续性。模型能够记住工具调用前的假设、失败路线和下一步计划。第二是成本。先前已经生成的推理无需在每个步骤重新计算。第三是无状态扩展。供应商不必为每个客户长期维护完整会话数据库,客户端可自行管理历史。第四是合规选择。零数据保留客户可以不让供应商保存内容,同时继续使用多轮推理。
可移植性还让路由更灵活。昂贵模型先规划,便宜模型后执行;模型版本升级或降级;Claude 在不同云平台间迁移;Gemini 在有状态和无状态接口之间切换。这些都要求下一个端点读得懂前一个端点留下的状态。于是,原本只应属于某次计算的隐藏轨迹,逐渐获得了跨环境通行能力。
开发者体验也反向强化了这种选择。只要完整保存官方 SDK 返回的对象,工具循环通常能继续;一旦序列化层丢掉签名、开发者只保留可见文本,或把 reasoning item 与后续 message 拆开,API 就可能失败。2026 年 5 月,Google Python SDK 的一个公开 issue 报告称,SDK 在反序列化时丢掉 Gemini 3.1 的 thought_signature,多轮函数调用随即返回 400,报告者只能退回 Gemini 2.5。OpenAI SDK 也出现过 reasoning item 与 message 配对约束导致的 400 错误。签名既是安全边界,也是协议耦合点。
这段历史解释了为什么供应商会接受较宽的兼容范围。把密文牢牢绑定到完整历史,任何上下文压缩都会让后续签名失效;绑定到单一模型,自动路由和降级就会中断;绑定到一次会话,分叉、迁移和断点续跑都会变复杂。宽兼容不是工程师忘记加一个字段那么简单,它是状态可携带性被持续优化后的结果。
4. 2026 年 5 月:第一次警报指向“可重放”,但风险尚未闭合
论文称,独立研究者 Ben Green 在 2026 年 5 月已经向供应商报告:加密推理块可以脱离原会话、换序或跨会话重放。当时被揭示的是“这个信封能在别处继续用”,供应商没有把侧信道或重放视为明确安全后果。
这容易理解。单看密码学层,攻击者仍看不到明文,篡改密文也会破坏认证标签;单看模型层,强模型又接受过不泄露思维链的训练。两个局部控制都在工作,于是系统看上去仍然安全。
问题出在它们的交界处。密文验证只负责确认内容由供应商生成,模型拒绝训练只落在被直接请求的那个模型上。如果同系列较弱模型共享解密能力,却没有同等级的反提取训练,攻击者就能绕开最坚固的门,把合法信封拿到侧门打开。安全强度由模型家族中最弱的兼容解码器决定,而不是由生成轨迹的最强模型决定。
5. 2026 年 7—8 月:弱模型变成解密预言机
Alexander Panfilov 等八名研究者把这个缺口变成了可规模化攻击。他们先向强模型提出正常任务,取得 API 返回的加密推理块;再把块放进同供应商较弱模型的上下文,要求它在特定标签中复述自己的推理。Claude 侧使用 Haiku 4.5 解码 Opus 4.8,OpenAI 侧使用 GPT-5.6 Luna 兼容更早的 GPT 轨迹,Google 侧则用 Gemini Robotics 1.6 处理 Gemini 2.5 与 3.x 系列的轨迹。
三家的攻击难度并不相同。Haiku 4.5 可用一套固定 Prompt 批量处理;GPT-5.6 Luna 的反提取防护更强,需要更换模板、best-of-n 采样,并把输出切成少于 50 Token 的片段;Gemini 也有自己的注入位置和格式约束。这些差异说明攻击不是密文被一个通用算法破解,而是模型在服务端解密后,被诱导把读到的内容说出来。
论文列出四类后果。
其一是能力蒸馏。答案只告诉学生模型“终点在哪里”,推理轨迹还给出问题拆解、试错和中间判断。论文估算,以当时 Haiku 4.5 的价格,解码一万条、每条输入输出窗口各 1.2 万 Token 的轨迹,名义成本约 720 美元。供应商即便严密监控强模型端的批量提取,也可能看不到攻击,因为昂贵推理已由别的用户生成,攻击者只调用便宜解码器。
其二是隐私泄漏。团队从 GitHub 与 Hugging Face 收集 6,708 条公开智能体轨迹,解出 315,320 个推理块,识别出 367 项个人身份信息和 182 项凭据。只看真实用户会话,凭据包括 62 个 API key、33 个密码、24 个访问令牌和 7 个私钥。704 项真实会话中的隐私条目里,有 64 项完全没有出现在可见聊天历史中。一个反直觉的高风险动作是“清理日志”:模型为了删除敏感内容,会先在隐藏推理里重新列出待清理值;开发者擦掉明文后提交仓库,密文却把秘密保留下来。
其三是安全拒绝旁路。模型可以在隐藏推理中分析危险细节,最终只输出安全建议。研究者让强模型完成这种内部分析,再从弱模型取出隐藏内容。可见输出的合规过滤没有失败,但隐藏通道把被压住的信息带了出来。
其四是不可见提示注入。攻击者先让一个模型在推理块里内化恶意指令,再把这段合法签名的密文塞进公开智能体轨迹。受害者恢复任务时,强模型把它当作自己的既往思考继续执行。论文的概念验证中,一个与制作 PPT 有关的请求被悄悄加入上传文件到攻击者服务器的步骤。传统提示注入至少还能被日志扫描;这类载荷对客户端和外部监控器都是不可读的。
8 月 10 日,论文公开。研究团队在发布前已向 Anthropic、OpenAI、Google、Microsoft 和 Hugging Face 披露完整方法与初步数据。三家模型供应商确认收到了报告;研究者随后无法再复现同类攻击。
但时间线在这里没有一个干净的句号。公开材料没有说明三家是轮换了旧密钥、按用户或会话绑定了密文、隔离了模型,还是只强化了弱模型的拒绝与网关检测。修补阻断了已知攻击路径,不等于既有公开密文已经永久失效,也不等于下一种转录 Prompt 无法绕过模型侧防护。这是今天最重要的事实边界。
三、横向分析:竞争图谱
1. Claude:最强的跨平台连续性,也带来最大的信任域
Claude 的 thinking block 最接近一封结构清楚的密函:可见 thinking 字段可以是摘要,也可以为空;signature 保存完整推理的加密副本。工具调用期间必须原样返回整块,服务端验证它没有被改动。当前文档还允许跨 Anthropic API、Bedrock 和 Vertex AI 携带签名。
从开发者视角看,它的优势是明确。只要保留返回块,复杂工具循环能够跨云继续;display: omitted 还能跳过摘要流式输出,缩短首个正文 Token 的等待时间。代价是签名长、历史结构敏感,任何网关、数据库或 SDK 若截断、清洗或重新排列块,都可能使长会话突然报错。公开 issue 中,Bedrock 返回空 thinking signature 后被框架写入历史,数百条消息后的回放才触发“Invalid signature”,会话只能重置。这并非本次漏洞本身,却说明加密状态一旦成为协议骨架,可靠性与安全性会同时压在同一个不透明字段上。
Claude 此前的差异化优势——跨模型、跨平台延续推理——恰好是论文攻击矩阵里最宽的入口之一。研究者在 2026 年 7 月测试时发现,除 Fable 5 的轨迹外,多款 Claude 之间普遍可以互读;Haiku 4.5 又比 Opus 更容易被诱导转录。历史上为了混合模型与多云而扩大的信任域,横向上变成了弱模型替强模型承受安全边界。
2. OpenAI:用加密推理服务无状态与 ZDR,协议更像智能体事件流
OpenAI 的 reasoning 不是 Claude 消息里的一个内容块,而是 Responses API 输出序列中的独立 item。它通常与 message、function call 等项目保持顺序关系。使用服务端状态时,开发者传 previous_response_id 即可;使用 store=false 或零数据保留时,则要保存并回放 encrypted_content。
这条路线最适合事件流式智能体。规划、调用、工具结果、后续回答都能留在同一条 item 序列中,Codex 还能用加密 compaction item 压缩长历史。它的短板是协议约束较隐蔽:开发者只保留 message、不保留前置 reasoning item,或者序列化时补出不合法的空字段,都可能收到 400。官方推荐把所有响应 output item 原样带回,实质上是用更强的数据结构纪律换取无状态连续性。
安全上,OpenAI 的模型侧反提取似乎比 Claude 更难绕。研究者需要多套模板、小片段输出和重复采样才能让 GPT-5.6 Luna 解码。但“更难”不是密码学隔离。论文测试时,GPT-5.6 系列仍可读取多代早期 GPT 轨迹,弱模型依旧是兼容信任域中的一员。OpenAI 2024 年作出的原始选择——隐藏思维链以保护竞争优势并保留安全监控——到 2026 年出现了回环:为了隐藏而加密的轨迹,反而成为可批量搬运的高密度蒸馏材料。
3. Gemini:把 thought signature 变成函数调用的强制协议字段
Gemini 的特点不是加密思路不同,而是签名与函数调用结合得最紧。Gemini 3 在返回 function call 时附带 thought signature,下一步工具结果必须带回;漏掉就会得到 4xx。官方 SDK 自动处理历史,REST 或自行剪裁消息的开发者承担更多复杂性。新 Interactions API 又把 thought 变成独立 step,并建议有状态模式用 previous_interaction_id,让服务端自动管理签名。
这反映出 Google 的产品取向:签名首先是模型正确完成多步工具调用的必要状态,而不是供用户管理的安全对象。优点是规则明确,官方 SDK 的“完整对象回放”可以减少人为错误;缺点是开发者框架若尚未识别新字段,整个工具链会立即中断。2026 年 Gemini 3.1 的 SDK issue 正是这种版本耦合的缩影。
在论文的 7 月矩阵里,Gemini 各型号之间的兼容最广,多款模型能够接收彼此的轨迹;研究者选择 Robotics 1.6,是因为它还能处理 2.5 与 3.x 两代格式。Google 由 2.5 开始把 thinking 做成整个家族能力,这种统一接口提高了生态一致性,也让跨型号隔离更难在不破坏工作流的情况下突然收紧。
4. 四种替代路线:没有免费的安全边界
把三家放在一起看,竞争不是“谁的加密更强”,而是谁愿意为更窄的信任域支付什么代价。
| 路线 | 客户端拿到什么 | 连续性与成本 | 主要安全边界 | 主要代价 |
|---|---|---|---|---|
| 客户端加密块 | 可回放的隐藏推理密文 | 无状态、适合 ZDR,工具调用可续接 | 密文的用户、会话、模型绑定 + 模型拒绝 | 密文成为可搬运攻击面;SDK 必须精确保留结构 |
| 服务端状态 ID | 随机会话或响应 ID | 客户端简单,服务端直接恢复 | 鉴权、对象级授权、服务端存储隔离 | 增加存储和数据库成本;与严格零保留冲突 |
| 临时推理 | 生成答案后删除推理 | 每回合边界清楚 | 不存在可重放载荷 | 多步工具调用可能重复思考,成本与能力受损 |
| 明文或开源推理 | 可审计的完整轨迹 | 最易调试、可研究和蒸馏 | 访问控制与数据治理 | 暴露隐私、危险细节和模型知识产权 |
服务端状态 ID 是论文认为最稳健的结构性修复:客户端只拿随机引用,攻击者无法把密文喂给另一个模型。Google Interactions API 的有状态模式、OpenAI 的 previous_response_id 都已经提供了这条路。但企业的 ZDR 要求恰恰是不留服务器状态,因此它不可能完全替代客户端密文。
临时推理则把问题从根上切掉。每次调用结束就删除中间轨迹,下一步只依据可见历史和工具结果重新思考。Qwen 等模型提供过类似 preserve_thinking 开关。它安全边界清楚,却会牺牲工具循环中的计划连续性,并重复支付推理 Token。
明文推理站在另一端。它没有“用户看不见、模型却能执行”的隐蔽载荷,外部审计和社区研究都更容易;但个人信息、API key、危险步骤和可蒸馏策略也一览无余。对开放权重模型来说,这通常是已接受的发布选择;对把推理能力视为核心资产的闭源供应商,它很难成为默认方案。
因此,头部供应商的现实路线大概率仍是混合:普通会话尽量服务端有状态,ZDR 和自管历史继续用密文;高风险工具流程缩小跨模型兼容;需要共享的轨迹删除所有 opaque reasoning 字段;对旧密钥设置明确失效时间。它比“统一一种格式”更复杂,却更符合不同客户的真实约束。
四、横纵交汇洞察
1. 这不是加密失败,而是“能力票据”没有写清持有人
沿纵轴看,加密推理块从隐藏思维链出发,逐步承担连续性、成本优化、无状态扩展和 ZDR 四项职责。到横轴比较时,它已经不只是密文,更像一张能力票据:谁把它交回服务端,模型就能恢复一段过去的计算。
票据的内容有保密性,票据本身也有完整性,却没有足够强的受众限制。研究论文据公开行为推断,供应商的封装类似带关联数据的认证加密;真正缺少的是把 user_id、session_id、模型安全等级和上下文位置绑定进验证。于是“这是供应商签发的合法轨迹”被错误地等同于“它可以在这里使用”。
互联网安全史上,这种错误并不陌生。Cookie、访问令牌、云端预签名 URL 都曾经历从“随机且不可伪造”到“必须绑定受众、权限、作用域与期限”的演进。推理块只是更危险:普通令牌授权读取数据,推理块还会改变模型下一步如何思考和行动。
2. 模型路由的真实安全等级,由最弱兼容模型决定
三家公司过去两年的路线都在扩大模型家族:强模型负责难题,Flash、mini、Haiku 负责高频步骤,路由器按成本切换。产品上,这是降本;安全上,这会把多个不同对齐强度的模型放进同一个解密域。
传统的最小权限原则要求,每个执行主体只取得完成任务所需权限。跨模型推理兼容却反过来做:只要小模型需要承接一部分历史,它就可能获得读取强模型全部隐藏状态的能力。研究者没有攻破 Opus 4.8 的反提取防护,而是让 Haiku 4.5 代为开口;没有必要在 GPT-5.6 Sol 端形成异常流量,只要把既有轨迹拿给 Luna。
我的判断是,今后的模型路由不能只比较准确率、延迟和价格,还必须增加“推理状态安全等级”。便宜模型若要接手强模型任务,应拿到经过裁剪的计划摘要或限定作用域的状态,而不是默认获得完整隐藏推理。模型降级不应自动等于权限继承。
3. 零数据保留与客户端不可见,并不等于数据不存在
这次事件还纠正了企业 AI 中一个危险直觉:供应商不保存、客户也看不见,于是大家以为数据没有被留存。实际上,加密推理块由客户自己的日志、缓存、数据库和开源轨迹长期保存,只是客户无法检查里面有什么。
315,320 个公开块与 64 个“可见历史中完全不存在”的真实隐私条目,把这个矛盾量化了。日志脱敏系统只能处理看得见的字段;opaque blob 要么全删,要么全留,没有按姓名、密钥或客户数据精细清洗的空间。对银行、证券、保险和资管机构来说,这直接落到数据分级、跨境传输、留存期限、事件响应和审计可解释性:一个字段即便不可读,只要供应商模型可以恢复其中的个人信息,它就不能被当作无敏感内容的技术元数据。
实践上,机构应把 reasoning signature、encrypted_content、thoughtSignature 与明文会话按同一最高敏感等级管理。对外发布轨迹时默认删除,不因已经清理可见 Prompt 而保留;内部保存则要记录生成供应商、模型、账户、会话、时间和密钥代际,以便供应商轮换旧密钥后识别受影响资产。这里没有必要等待监管先给字段命名,数据是否敏感取决于可恢复内容,不取决于人眼能否直接阅读。
4. 修复会把今天的好体验变成明天的迁移成本
论文提出的上下文绑定很合理:把用户身份写入 AEAD 关联数据,跨用户立即拒绝;用会话 ID 与前序块形成哈希链,限制跨会话和乱序重放;按模型或安全等级隔离;轮换修复前密钥,使公开旧轨迹永久不可解;模型训练再拒绝转录式越狱。
每一项都在向过去两年的便利收税。绑定完整历史会破坏上下文压缩;绑定单一模型会破坏降级与路由;旧密钥轮换会让暂停数月的企业智能体无法续跑;一次性防重放需要服务端保存已消费状态,又削弱无状态优势。真正可用的方案可能是用户绑定加会话哈希链,并为分叉、压缩、迁移设计显式重签接口,而不是简单拒绝所有旧块。
这也解释了为什么“同类攻击已无法复现”仍不足以结束讨论。如果当前修补主要依赖弱模型拒绝或网关异常检测,协议的宽兼容可能仍在;如果采用密钥轮换,旧会话是否全部失效、企业是否得到迁移窗口,也需要公开说明。供应商接下来最有价值的披露,不是笼统宣称已修复,而是回答三件事:密文绑定到哪些身份与上下文;修复前的块是否还能被任何模型读取;跨模型和跨云兼容如今遵循什么权限规则。
5. 三个未来剧本
最可能的剧本:混合状态成为默认,opaque 字段被正式纳入数据治理。三家保留客户端加密块,但缩小跨用户、跨会话和跨安全等级模型的兼容;官方 SDK 负责重签、分叉和压缩。有状态 ID 成为普通开发者默认选择,store=false 与 ZDR 才暴露更复杂的自管模式。企业安全产品开始识别并清除三家的 reasoning 字段,公开数据集把“移除不透明模型状态”列入发布检查。能力连续性仍在,只是过去隐性的信任边界被写进协议。
最危险的剧本:补丁只封住转录 Prompt,历史密文继续长期有效。弱模型经过拒绝训练后不再响应 <thinking-copy>,研究者的现有脚本失效,于是事件被视为结束;但跨用户、跨模型密钥域没有改变。新的模型版本、第三方托管端点或多模态解码器一旦出现较弱防线,旧仓库里的密文又能被打开。更糟的是,攻击者不再追求明文,而是直接利用隐藏块影响智能体行动,传统泄漏检测连结果都看不到。
最乐观的剧本:推理状态从供应商私有字段进化为可验证、最小披露的协议。完整推理留在最窄的服务端安全域,跨模型只传结构化计划、工具依据和经过脱敏的必要状态;每个状态对象带明确受众、作用域、期限与一次性约束。用户可以验证某块是否包含敏感类别或是否已失效,却不能取得可蒸馏的完整轨迹。这个方向需要密码学、模型训练和智能体协议共同改造,短期最难,却能把“隐藏思维”从一团不可治理的密文变成真正有权限边界的计算状态。
回到这次新闻,最值得记住的不是“模型能破解加密”。更准确的说法是:系统把解密权交给了整个模型家族,而模型家族里总有一扇门比别的门薄。过去两年,行业一直在优化模型想得更久、状态带得更远、路由切得更便宜;从今天开始,另一条指标必须补上——这段状态究竟只属于谁。
五、信息来源
- Stealing Reasoning Traces from Proprietary LLM APIs(arXiv 论文)
- Stolen Thoughts 研究项目页
- Simon Willison:Stealing reasoning traces
- OpenAI:Introducing OpenAI o1-preview
- OpenAI:Learning to reason with LLMs
- OpenAI:New tools and features in the Responses API
- OpenAI API:Model guidance
- OpenAI:Unrolling the Codex agent loop
- Anthropic:Claude 3.7 Sonnet and Claude Code
- Anthropic API:Thinking
- Google:Gemini 2.5, our most intelligent AI model
- Google Developers Blog:Gemini 2.5 thinking model updates
- Google AI for Developers:Gemini thinking and thought signatures
- Google Python SDK issue:Gemini 3.1 multi-turn function calling loses thought signature
- OpenAI Python SDK issue:reasoning 与 message 配对约束导致多轮请求失败
- OpenClaw issue:Bedrock 空 thinking signature 导致长会话失效
- Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
- How to Steal Reasoning Without Reasoning Traces