Benchmarks

MosaicLeaks 基準:研究代理的對外查詢正在洩漏企業機密

ServiceNow 團隊發布 MosaicLeaks 基準:深度研究代理混合私有文件與網路搜尋時,攻擊者只看外流查詢紀錄就能拼出企業機密,而 PA-DR 訓練法把洩漏率從 34% 壓到 9.9%。

MosaicLeaks 基準:研究代理的對外查詢正在洩漏企業機密 — 文章封面
本頁內容6 個段落
  1. 馬賽克效應:威脅模型
  2. 一千零一條多跳研究鏈
  3. 三個發現:提示詞救不了,任務訓練更糟
  4. PA-DR:把隱私訓練進模型
  5. 限制與後續
  6. 參考來源

2026 年 6 月 18 日,ServiceNow 研究團隊在 Hugging Face 部落格發布 MosaicLeaks 基準,搭配 5 月底送上 arXiv 的同 名論文。它要回答的問題只有一個:會把私有文件與網路搜尋混用的深度研究代理,究竟會透過對外查詢洩漏多少機密?答案並不令人安心。

馬賽克效應:威脅模型

MosaicLeaks 針對的是「馬賽克效應」:單看每一次網路查詢都人畜無害,但持續觀察查詢紀錄的攻擊者,可以把私有企業事實重新拼湊出來。威脅模型刻意設計得從嚴——攻擊者看不到私有文件,也看不到代理的推理過程,唯一能看的只有外流的查詢字串。

洩漏程度分為三級,嚴重度遞增:意圖洩漏,從紀錄推斷代理在調查哪些私人問題;答案洩漏,結合問題本身從紀錄推出答案;全資訊洩漏,在沒有任何提示的情況下,陳述可驗證為真的私有事實。

一千零一條多跳研究鏈

資料集包含 1,001 條多跳研究鏈,劃分為 559 條訓練、98 條驗證與 344 條以極限公司為對象的測試鏈。每條鏈交錯本地與網路子問題,前一跳的答案會成為下一跳查詢必需的「橋接實體」。本地文件來自 DRBench 式的企業任務,網路文件取自 BrowseComp-Plus。

論文給的例子很具體:代理先在本地文件讀到 MediConn 完成 70% 雲端遷移、一月有里程碑,接著為了查證資安事件,搜尋微軟 2024 年一月的國家級攻擊披露——查詢字串裡帶著的公司名、70%、一月,就是足以拼出全貌的碎片。代理架構改自 DRBench,提供 Plan、Choose、Read、Resolve 四個工具,主要測試模型是 Qwen3-4B。

三個發現:提示詞救不了,任務訓練更糟

基準結果有三個重點。第一,提示沒有用:加上「不要洩漏」的指示,洩漏率只從 34.0% 降到 25.5%,成功率還從 48.7% 掉到 44.5%——模型只是減少查詢次數,並沒有把查詢變得更安全。第二,純任務訓練反而更糟:任務導向的強化學習把成功率推上 59.3%,洩漏率卻升到 51.7%,因為資訊更豐富的查詢更好檢索,也更容易外洩。第三,各個模型家族、各種規模,都會在三個層級上頻繁洩漏。

PA-DR:把隱私訓練進模型

團隊提出的解法是 Privacy-Aware Deep Research(PA-DR)。它由兩個部分組成:情境式任務獎勵,把同一階段、同一跳的工具呼叫互相比較後給分;再加上學出來的隱私獎勵——一個 Qwen3-4B 分類器對直接洩漏與馬賽克洩漏兩種風險評分,取較重者懲罰。

結果相當鮮明:成功率 58.7%,略低於純任務訓練,但答案與全資訊洩漏壓到 9.9%,甚至低於完全未訓練的基線。有趣的是,代理發出的查詢數量不減反增,只是把「15%」「2024」這類揭露性細節剝掉。樣本效率是另一個亮點:情境式獎勵用約 18.3 萬個樣本,達成純結果式強化學習需要約 96.3 萬個樣本才能到達的約 55% 成功率。團隊的結論一句話說完:「隱私沒辦法提示進去,只能訓練進去。」

限制與後續

作者對研究範圍相當誠實:合成文件、固定的網路語料、三家公司情境、單一代理架構,以及多跳問答而非開放式研究。換句話說,這是受控環境下的基準,不是對已部署系統的量測。

但對任何把企業文件接上搜尋工具的代理產品,這份研究提供了第一個可重現的洩漏量尺,並示範了一條緩解路徑。它同時提醒所有人:看起來無害的查詢紀錄,本身就是攻擊面。在代理產品把「檢索外部資訊」當成標配的 2026 年,這個問題只會越來越尖銳。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵