AI Safety

OpenAI 首度無法排除 Astra 達 Critical 網路門檻

OpenAI 內部評估首度無法排除 Astra 觸及 Preparedness Framework 的 Critical 網路安全門檻:agentic coding 與 cyber 能力大幅躍進,五層控制與思緒監控已啟動,外部紅隊測試是下一個觀察點。

OpenAI 首度無法排除 Astra 達 Critical 網路門檻 — 文章封面
本頁內容7 個段落
  1. Critical 門檻的兩個定義
  2. 「無法排除」是什麼意思
  3. OpenAI 的應對:五層控制
  4. 前例:2025 年 6 月的生物能力公告
  5. 對安全研究者與 builder 的意義
  6. 讀法與限制
  7. 參考來源

2026 年 8 月 7 日,OpenAI 發布了一篇短得反常的能力公告:內部評估顯示,即將推出的模型 Astra 在 agentic coding 與 cybersecurity 兩個方向都有顯著進展,幅度大到該公司無法排除它已觸及自家 Preparedness Framework 的 Critical 等級。上一個接受同套 frontier cyber 評估的 GPT-5.6-Sol,結論是 High——這是兩個不同的世界。

先講清楚性質:Astra 還沒部署,這不是事故報告,而是一次部署前的能力預警。官方同時明確否認 Astra 涉入先前的 Hugging Face 被利用事件——這句否認本身值得注意:它預設了讀者會把「能力評估」與「實際攻擊」直接連在一起,而 OpenAI 選擇在第一時間切開。

Critical 門檻的兩個定義

Preparedness Framework 最早發布於 2023 年 12 月,當時的模型離這個等級還很遠;門檻是提前畫好的線,不是事後補上的。按 OpenAI 的定義,Critical 網路能力指模型能做到以下兩件事之一:其一,在沒有人類介入的情況下,對許多 hardened real-world critical systems 開發各嚴重度的 functional zero-day exploits——不是概念驗證,是可運作的漏洞利用,且涵蓋從低到高的各種嚴重度。其二,只給定高層級目標,就能對 hardened targets 設計並執行 end-to-end 的新穎攻擊策略——從規劃到執行一手包辦,中間不需要人類補位。

這兩個定義的重量落在「無人類介入」與「end-to-end」這幾個字上。攻擊者拿模型當輔助工具是一回事;模型自己跑完整條攻擊鏈是另一回事,後者才是 Critical 門檻要攔的世界。

「無法排除」是什麼意思

初步評估的性能夠強,強到目前無法排除 Critical capability level——這句話的認識論狀態要讀準。它不是「已確認達到 Critical」,而是「現有證據不足以把 Critical 排除掉」。對一家以能力評估為業的公司來說,承認自己的量測收窄不了這個區間,本身就是重要資訊:模型能力已經追到評估工具的解析度邊緣。

歷史對照強化了這一點:先前模型(包含 GPT-5.6-Sol)在同樣的評估下落在 High 而非 Critical。從「確認 High」到「無法排除 Critical」,是這套框架啟用以來第一次跨線的警示。

OpenAI 的應對:五層控制

公告後半是已經執行中的措施,可以整理成五層:

層次 措施
測試 擴大 safeguards 與 security controls 的 robustness testing
隔離 isolated testing environments、restricted network 與 tool access
保護 model weight 保護與加密
執行 sandboxed execution、監控與偵測
暫停 暫停 Astra 所有未達強化安全控制要求的內部活動

其中最有技術含量的是 universal monitoring:對 Astra 所有 agentic 應用——涵蓋訓練與評估——實施全面監控,monitor 會檢視模型的 Chain of Thought,發現高風險時觸發 security response 審查並中斷活動。把監控對象放進推理過程、而不只看外部行為,等於承認高風險可能先出現在「想」的階段。

前例:2025 年 6 月的生物能力公告

這套「先公告、再強化」的模式不是第一次上路。2025 年 6 月,當模型接近 biology 的 High 門檻時,OpenAI 也公開過類似步驟;這次公告明確表示套用相同原則。對外部觀察者,這代表該模式已經制度化:能力逼近門檻 → 公開評估結論 → 啟動強化控制 → 引入外部測試。它不再是一次性公關動作,而是可預期的治理程序。

對安全研究者與 builder 的意義

外部測試這條線最值得追蹤:OpenAI 將與政府機構及特定 AI safety 組織合作測試 Astra,並對 third-party testing partners 提供建議的 security controls。換句話說,「Critical 等級的模型該怎麼安全地測」正在被整理成一套可傳播給第三方的規範——這對做紅隊與評估服務的團隊是直接的情報。

對產品建構者,影響可以讀成三層(此段為我的詮釋):第一,依賴 OpenAI 模型做 security-sensitive 任務的產品,部署標準只會越來越嚴,API 層過濾不會是終點;第二,那五層控制可以直接當自己 agentic workflow 的稽核清單——隔離環境、限縮網路與工具、監控推理、暫停機制,每一項都搬得動,而且現在搬比日後被迫搬便宜;第三,把「模型能力快速成長」當成架構預設,在每條 high-blast-radius 的路徑上保留人為介入點。

讀法與限制

這篇公告全文約五百個英文字,沒有量化數據、沒有攻擊實例,所有評估都是定性的。這不是批評——預警公告本來就不會附漏洞細節——但有幾件事確實無法從本文得知:Astra 的實際評估表現、量測的具體方法、「無法排除」的信心區間有多寬。官方的收尾立場是先進 cyber 能力應該讓 defenders 先於攻擊者修補漏洞,並承諾與 governments 等對象合作負責任且廣泛地部署;這個宣示能否兌現,取決於後續外部測試的透明度,而不是這篇公告本身。合理的追蹤節奏是把系統卡、外部測試結果與部署決策當成下一批證據,而不是把本文當結論。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵