Cybersecurity

Cisco 實測 15 個封閉前沿模型:多輪攻擊無一倖免

2026 年 5 月 27 日,Cisco 發表研究,對 OpenAI、Anthropic、Google、Amazon、xAI 共 15 個封閉模型發動近 7,000 次多輪攻擊,最高成功率達 88.3%,沒有任何模型免疫,連設定旗標都會大幅改變風險。本文解析測試方法、各模型數字與採購建議。

Cisco 實測 15 個封閉前沿模型:多輪攻擊無一倖免 — 文章封面
本頁內容6 個段落
  1. 測試怎麼做
  2. 五種攻擊策略
  3. 數字會說話
  4. 設定旗標的隱藏風險
  5. 給採購與治理團隊的建議
  6. 參考來源

2026 年 5 月 27 日,Cisco 的 AI 威脅研究團隊在官方部落格發表研究「Proprietary Problems: No Frontier Model Is Multi-Turn Immune」,針對五家實驗室的 15 個封閉模型,比較單輪與多輪攻擊的成功率。結論寫在標題裡:沒有模型對多輪攻擊免疫,成功率最高衝到 88.30%。

這不是邊角研究。Cisco 是企業資安市場的主要供應商,AI Defense 與 LLM Security 排行榜直接影響企業選型。當它說「單輪分數不能代表安全」,依賴模型卡與公開評測的採購團隊就得重新檢視流程。

測試怎麼做

研究使用同一套框架與題庫:30,090 個單輪提示(每模型 2,006 個),加上 1,456 個對話中的 6,986 次多輪攻擊。對象涵蓋 OpenAI GPT-5.2 與 GPT-5.4 家族、Anthropic Claude Opus 4.5/4.6、Sonnet 4.5/4.6、Haiku 4.5、Google Gemini 3 Pro、Amazon Nova Lite、Nova Micro、Nova 2 Lite,以及 xAI Grok 4.1 Fast 的推理與非推理設定。

這是 2025 年 11 月開放權重研究「Death by a Thousand Prompts」的續篇——該研究發現多輪攻擊對 Mistral Large-2 的成功率高達 92.78%。這次把戰場延伸到封閉模型,結論一致:多輪脆弱性是結構性問題,與開源與否、對齊哲學無關。

五種攻擊策略

多輪攻擊不是把壞問題問很多次,而是把惡意請求拆解、重組、逐步升溫。Cisco 歸納出五個策略家族:角色扮演、語境誤導、拒絕重構、資訊分解重組,以及漸進升級(crescendo)。Cisco 研究負責人 Amy Chang 說得直白:「真實的對手不會在第一次被拒絕後就停下來。」

數字會說話

  • 多輪攻擊成功率區間為 7.89% 至 88.30%;單輪只有 2.19% 至 64.91%
  • Claude 家族單輪 2.19–3.64%,多輪升至 11.16–16.20%,仍是全場最佳防線
  • GPT-5.4 從 2.74% 跳到 24.68%,相差約 9 倍
  • Gemini 3 Pro 從 18.10% 漲到 73.35%,暴增逾 55 個百分點
  • Grok 4.1 Fast 非推理設定以 88.30% 居冠;開啟推理模式後腰斬至 43.47%
  • Amazon Nova 2 Lite 反向:單輪 34.05%,多輪卻是全場最低的 7.89%

過半模型的兩種成績差距逾 15 個百分點,且兩種測法產出不同的排名與失效地圖。Chang 對基準測試的批評一針見血:「單輪基準分數展示的是模型在攻擊者不會使用的情境下的表現。」

設定旗標的隱藏風險

研究最值得警惕的細節是推理模式開關:同一個 Grok 4.1 Fast,切一個設定就讓成功率變動逾 40 個百分點。這種差異不會出現在公開評測或模型卡上,兩個部署「相同模型」的團隊,安全水位可能天差地遠。這也與更大的提示注入版圖互相印證——例如近期以網域偽裝藏身的注入攻擊,同樣繞過靜態防線。

給採購與治理團隊的建議

Cisco 提出三個具體動作:

  • 每次模型發布都公布分策略家族的成功率,而非只給總分
  • 以前三大失效程序與內容類型做部署閘門,回歸逾 3 個百分點就擋下審查
  • 兩種測法差距逾 15 個百分點的模型列入人工審查——這條規則會抓到 15 個模型中的 8 個

NIST AI RMF、草擬中的 NIST IR 8596 與 EU AI Act 第 15 條都要求對抗性測試,但都沒規範「互動輪數」維度。Cisco 的最終訊息很清楚:沒有基礎模型在迭代攻擊下是安全的,防線必須移到模型之外——執行期防護、監控與應用層政策。正如 Chang 所言:「防護欄能降低風險,但不能消除風險。」

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵