推理模型時代,各家 API 都會把模型的思考過程回傳給開發者:Anthropic、OpenAI、Google 的做法是把它包成簽章或加密的區塊,看上去無法直接閱讀。8 月 10 日提交 arXiv、8 月 11 日在 Hacker News 引起熱烈討論的論文〈Stealing Reasoning Traces from Proprietary LLM APIs〉,在這個設計上鑿出一個出人意料的洞:思考區塊雖然加密,卻是可攜帶的。
論文來自 MATS Research、ELLIS Institute Tübingen、馬克斯普朗克智能系統研究所、Snyk 等機構的團隊。他們展示的攻擊最諷刺的地方在於:從頭到尾沒有人攻擊強模型本身——所有動作都發生在同一家廠商較弱的兄弟模型上。
攻擊怎麼做:兩次 API 呼叫
流程是這樣的。先把強模型(例如 Anthropic 的 claude-opus-4-8)產出的加密思考區塊,原封不動重放進同廠防護較鬆的較弱模型(claude-haiku-4-5)的對話裡;接著對弱模型越獄,要求它把這段「看不懂的輸入」逐字轉錄出來。兩次呼叫,強模型的推理原文就到手了。
OpenAI 側同樣成立:GPT-5.2 Codex 的思考軌跡被 GPT-5.6 Luna 解出;Google 的 API 也測出同樣問題。研究團隊用 120 道 Codeforces 題目驗證:還原出的推理長度與 API 回報的隱藏思考 token 數高度吻合,表示轉錄不是幻覺,而是真還原。
掃描公開軌跡:思考鏈裡藏著機密
攻擊之外,論文還做了一個更貼近現實的測量。團隊掃描了 6,708 條公開的代理執行軌跡,重建出 315,320 個思考區塊,從中找到 704 種隱私物件:62 組 API 金鑰、33 個密碼、24 個存取權杖、30 個個人信箱。其中 64 個物件只存在於推理內容裡,可見輸出中從未出現。
換句話說,思考鏈正在變成資料外洩的新邊界:使用者與代理把機密寫進「只有模型該看」的地方,而這個地方現在被證明讀得出來。
同一個洞的四種打法
論文歸納出四條攻擊線。第一,繞過反蒸餾防護:Anthropic、OpenAI、Google 都被示範可以取出推理鏈,想靠它擋住模型訓練資料外流的防線形同虛設。第二,大規模私密資料萃取,就是上一節的掃描結果。第三,思考區塊裡可以藏有害內容,而模型的可見回答完全正常——稽核輸出的人看不到。第四,隱形提示注入:指令可以直接寫進思考區塊,帶進後續對話。
補充實驗也值得記一筆:把推理內容預填充進 Moonshot Kimi-K3,會改變它的答案。這些區塊不只是文字,對模型行為有實際控制力。
根因與修法:問題不在加密強度
漏洞的核心不是密碼學被破解,而是設計決策:思考區塊跨對話、跨使用者、跨模型通用,等於一張不記名的票。團隊在負責任揭露後提出加密與系統層修法,方向是把思考區塊綁定到單一對話、單一使用者與單一模型。論文還點出一個常被忽略的細節:API 回傳的思考摘要可能與真實推理不符——監督機制若建立在摘要上,是可被操弄的。
對開發者的意義
三條實務建議。第一,別把機密放進送給模型的上下文:它可能被寫進推理又被還原出來。第二,公開代理軌跡(log、trace、示範資料)時,記得連思考區塊一起清理。第三,評估廠商時多問一句:思考區塊怎麼簽章、怎麼綁定對話。在推理模型時代,思考過程本身已經是需要存取控制的資產。
參考來源
- Stealing Reasoning Traces from Proprietary LLM APIs — stolen-thoughts.com
- Stealing Reasoning Traces from Proprietary LLM APIs — arXiv
本文由 AI 協助自上述來源整理,經人工審核後發布。
