Security

偷走 AI 的思考:兩次 API 呼叫還原隱藏推理鏈

德國研究團隊利用同家族較弱模型與越獄提示,兩次 API 呼叫還原加密思考區塊的推理原文;公開代理軌跡中更發現大量 API 金鑰與密碼。

偷走 AI 的思考:兩次 API 呼叫還原隱藏推理鏈 — 文章封面
本頁內容6 個段落
  1. 攻擊怎麼做:兩次 API 呼叫
  2. 掃描公開軌跡:思考鏈裡藏著機密
  3. 同一個洞的四種打法
  4. 根因與修法:問題不在加密強度
  5. 對開發者的意義
  6. 參考來源

推理模型時代,各家 API 都會把模型的思考過程回傳給開發者:Anthropic、OpenAI、Google 的做法是把它包成簽章或加密的區塊,看上去無法直接閱讀。8 月 10 日提交 arXiv、8 月 11 日在 Hacker News 引起熱烈討論的論文〈Stealing Reasoning Traces from Proprietary LLM APIs〉,在這個設計上鑿出一個出人意料的洞:思考區塊雖然加密,卻是可攜帶的。

論文來自 MATS Research、ELLIS Institute Tübingen、馬克斯普朗克智能系統研究所、Snyk 等機構的團隊。他們展示的攻擊最諷刺的地方在於:從頭到尾沒有人攻擊強模型本身——所有動作都發生在同一家廠商較弱的兄弟模型上。

攻擊怎麼做:兩次 API 呼叫

流程是這樣的。先把強模型(例如 Anthropic 的 claude-opus-4-8)產出的加密思考區塊,原封不動重放進同廠防護較鬆的較弱模型(claude-haiku-4-5)的對話裡;接著對弱模型越獄,要求它把這段「看不懂的輸入」逐字轉錄出來。兩次呼叫,強模型的推理原文就到手了。

OpenAI 側同樣成立:GPT-5.2 Codex 的思考軌跡被 GPT-5.6 Luna 解出;Google 的 API 也測出同樣問題。研究團隊用 120 道 Codeforces 題目驗證:還原出的推理長度與 API 回報的隱藏思考 token 數高度吻合,表示轉錄不是幻覺,而是真還原。

掃描公開軌跡:思考鏈裡藏著機密

攻擊之外,論文還做了一個更貼近現實的測量。團隊掃描了 6,708 條公開的代理執行軌跡,重建出 315,320 個思考區塊,從中找到 704 種隱私物件:62 組 API 金鑰、33 個密碼、24 個存取權杖、30 個個人信箱。其中 64 個物件只存在於推理內容裡,可見輸出中從未出現。

換句話說,思考鏈正在變成資料外洩的新邊界:使用者與代理把機密寫進「只有模型該看」的地方,而這個地方現在被證明讀得出來。

同一個洞的四種打法

論文歸納出四條攻擊線。第一,繞過反蒸餾防護:Anthropic、OpenAI、Google 都被示範可以取出推理鏈,想靠它擋住模型訓練資料外流的防線形同虛設。第二,大規模私密資料萃取,就是上一節的掃描結果。第三,思考區塊裡可以藏有害內容,而模型的可見回答完全正常——稽核輸出的人看不到。第四,隱形提示注入:指令可以直接寫進思考區塊,帶進後續對話。

補充實驗也值得記一筆:把推理內容預填充進 Moonshot Kimi-K3,會改變它的答案。這些區塊不只是文字,對模型行為有實際控制力。

根因與修法:問題不在加密強度

漏洞的核心不是密碼學被破解,而是設計決策:思考區塊跨對話、跨使用者、跨模型通用,等於一張不記名的票。團隊在負責任揭露後提出加密與系統層修法,方向是把思考區塊綁定到單一對話、單一使用者與單一模型。論文還點出一個常被忽略的細節:API 回傳的思考摘要可能與真實推理不符——監督機制若建立在摘要上,是可被操弄的。

對開發者的意義

三條實務建議。第一,別把機密放進送給模型的上下文:它可能被寫進推理又被還原出來。第二,公開代理軌跡(log、trace、示範資料)時,記得連思考區塊一起清理。第三,評估廠商時多問一句:思考區塊怎麼簽章、怎麼綁定對話。在推理模型時代,思考過程本身已經是需要存取控制的資產。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵