2026 年 4 月 23 日,Google 的威脅情資團隊在官方安全部落格發表研究「AI threats in the wild: The current state of prompt injections on the web」,首次系統性掃描公開網路,尋找真實存在的間接提示注入(indirect prompt injection)攻擊——藏在網頁裡、專門等 AI 系統前來讀取的惡意指令。
時機值得注意:AI agent 越來越常代替使用者瀏覽網頁、摘要內容、執行任務,而且讀到什麼就信什麼。這份研究等於替整個產業量測了這條新攻擊面的實際樣貌,結論是:攻擊者還在實驗,但數字已經在往上走。
掃描方法:Common Crawl 加 Gemini 分類
研究團隊掃描 Common Crawl 的網頁快照——每月約 20 到 30 億頁、以靜態英文內容為主的部落格、論壇與留言。方法由粗到細:先用特徵比對抓出已知注入簽章(例如「ignore … instructions」、「if you are an AI」),再把可疑文字交給 Gemini 分類,最後人工驗證。團隊坦承誤報不少——研究論文與資安文章本身就充滿這類字串;社群媒體則不在這次範圍,留待後續研究。
現場的六種樣貌
- 無害惡作劇:例如用隱形文字要求 agent 改變說話語氣
- 善意指引:引導 AI 產生更好的摘要,但同一套手法轉個彎就是攻擊
- SEO 操縱:誘使 AI 助理推銷特定商家,部分已是自動化產生的複雜提示
- 驅趕 AI agent:阻止 AI 爬取內容,甚至把 agent 引向無限文字流來浪費資源
- 惡意外洩:少數資料竊取嘗試,成熟度偏低;2025 年論文展示過的進階外洩提示並未大規模出現
- 惡意破壞:企圖刪除使用者機器上的所有檔案,被評估為難以成功
惡意案例三個月成長 32%
研究唯一的量化結論來自對快照版本的重複掃描:惡意類別在 2025 年 11 月到 2026 年 2 月之間成長 32%。Google 的整體判讀是,攻擊者尚未把進階間接提示注入規模化上線,但隨著 agent 能力增強與攻擊自動化,規模與成熟度都會上升。
Google 的防禦主張
文末列出 Google 自家的防線:模型層持續強化、對 Gemini 進行紅隊測試、透過 AI 漏洞回報獎勵計畫(AI VRP)收集外部研究,以及對威脅的即時處理。同月另有針對 Workspace 的緩解措施文章,處理 agent 讀取文件與郵件時的注入風險。The Register 同週的評論把提示注入類比為釣魚:兩者都是靠「夠漂亮的請求」騙人或騙模型交出秘密,而且短期內都不會消失。
服務層的工程回應
產業端也開始把緩解做進基礎設施。Fireworks 在 4 月 24 日的工程部落格指出一個更底層的漏洞:多數開源模型的服務堆疊用 Jinja 聊天模板把整段對話渲染成單一字串再編碼,若使用者輸入拼得出 im_end 這類控制 token 的字面,就會被編成真正的控制 token——示範中一段使用者訊息就能中斷回合、偽造系統訊息,讓 Kimi K2.6 從英文切成西班牙文。Fireworks 的解法是在 Chat Completions API 加入 safe_tokenization 參數,保證使用者內容永遠不會被編碼成特殊 token,支援 DeepSeek、Kimi、Qwen、Llama、GLM 等模型,額外開銷可忽略。
對產品團隊的提醒:這類攻擊不需要突破模型本身,只需要你的 agent 去讀一個被安排好的網頁;而第三方 AI 工具一旦出事,成本會直接外溢到客戶——Vercel 的 Context AI 事件就是最近的例子。
參考來源
- AI threats in the wild: The current state of prompt injections on the web — Google Security Blog
- Just like phishing for gullible humans, prompt injecting AIs is here to stay — The Register
- How we fixed prompt injection for all models on Fireworks — Fireworks AI
本文由 AI 協助自上述來源整理,經人工審核後發布。
