💬 观点Simon Willison
Stealing Reasoning Traces from Proprietary LLM APIs — 研究者从专有LLM API中窃取隐藏推理链,揭示加密缺陷与安全漏洞。
研究者从专有LLM API中窃取隐藏推理链,揭示加密缺陷与安全漏洞。
2026-08-11原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
窃取专有LLM推理链
Anthropic、OpenAI、Google 返回加密思维链块,可跨会话、用户、模型重放
- 同族模型共用同一加密密钥
- 重放至最弱模型即可越狱
⚙️ 流程拆解
STEP 1获取加密推理块
STEP 2重放至弱模型
STEP 3越狱弱模型
STEP 4还原明文推理
🔗 涉及的概念与玩家
- Anthropic公司
- OpenAI公司
- Google公司
- Claude Haiku 4.5模型
- GPT-5.5模型
- chain-of-thought概念
- prompt injection方法
- Simon Willison人物
- Anthropic—返回加密→chain-of-thought
- OpenAI—返回加密→chain-of-thought
- Google—返回加密→chain-of-thought
- Claude Haiku 4.5—越狱还原→chain-of-thought
- GPT-5.5—泄露推理→chain-of-thought
- Simon Willison—报道→chain-of-thought
- 论文发现Anthropic、OpenAI和Google的模型使用相同加密密钥,可将推理块重放到较弱模型中,通过越狱恢复明文推理。
- 攻击利用Claude Haiku 4.5的漏洞,通过特定提示词诱导模型转录推理内容,而4.6版本已修复此问题。
- 泄露的推理痕迹显示模型内部思考过程,如GPT-5.5的CSS设计思路,表明这些内容并非为人类阅读设计。
- 提示注入变体:诱导模型在推理中思考数据外泄,再重放推理块,可提高指令遵循率,威胁数据安全。
原文:Stealing Reasoning Traces from Proprietary LLM APIs · 作者 Simon Willison
🕸 顺着图谱继续读
- Breaking Claude Code Opus 5 Auto Mode — Claude Code 自动模式被曝 80% 成功率绕过,安全机制反成漏洞。2026-08-27 · 共同涉及 Anthropic、Simon Willison、prompt injection
- Auto mode is now the default in Claude Code for Pro, — Anthropic 将 Claude Code 默认设为自动模式,并称其能抵御提2026-08-08 · 共同涉及 Anthropic、Simon Willison、prompt injection
- Quoting Boris Cherny — Anthropic Opus 5 大幅提升抗提示注入能力,系统卡数据证实。2026-07-25 · 共同涉及 Anthropic、Simon Willison、prompt injection
- How I tricked Claude into leaking your deepest, darkest — Claude web_fetch工具存在数据泄露漏洞,攻击者可利用嵌套链接窃取用2026-07-15 · 共同涉及 Anthropic、Simon Willison、prompt injection