Gemini

Gemini 3.5 Flash 內建電腦操作:OSWorld 78.4 追平 Sonnet

Google DeepMind 把電腦操作能力直接內建到 Gemini 3.5 Flash,OSWorld 拿下 78.4 分追平 Claude Sonnet 4.6,並配上對抗訓練與兩項企業級安全防護,透過 Gemini API 與企業代理平臺開放。

Gemini 3.5 Flash 內建電腦操作:OSWorld 78.4 追平 Sonnet — 文章封面

2026 年 6 月 24 日,Google DeepMind 宣布把「電腦操作」(computer use)能力直接內建到 Gemini 3.5 Flash。過去這項能力只以獨立的 Gemini 2.5 電腦操作模型形式存在,如今成為主線 Flash 模型的原生工具,與函式呼叫、Search grounding、Maps grounding 並列。開發者可以在同一個模型裡組合這些工具,打造能「看、推理並在瀏覽器、行動裝置與桌面環境中行動」的代理。

官方由產品經理 Mateo Quiros 發布,定位在長時程與企業自動化任務,例如持續性軟體測試,以及跨專業應用程式的知識工作。Google 展示了兩個示範:模型分析 Gemini 應用程式後回傳分類過的功能清單,以及審查自家文件的無障礙問題。

從獨立模型到原生工具

這次更新的重點不只是「多了新能力」,而是能力的位置變了。過去要做電腦操作,開發者得呼叫一個專門的舊模型,再想辦法把結果接回主流程;現在 Gemini 3.5 Flash 本身就能操作圖形介面,代理可以在同一輪推理裡決定要呼叫 API、搜尋網路,還是直接動手點選畫面。

這對代理架構是實質簡化。電腦操作最適合的場景,是沒有 API 可用的舊系統與桌面軟體;當它變成 Flash 級模型的內建工具,等於把「最後一哩的介面自動化」補進 Google 的代理工具鏈。

取得途徑同步開放:開發者與企業可透過 Gemini API 與 Gemini Enterprise Agent Platform 使用,另有限定互動示範環境與 GitHub 上的參考實作可直接取用。

OSWorld:78.4 分落在哪

The Decoder 的報導引述 OSWorld 基準成績:Gemini 3.5 Flash 拿下 78.4 分。對比其他模型:超過 Gemini 3 Flash 的 65.1、GPT-5.4 mini 的 72.1、Gemini 3.1 Pro 的 76.2,追平 Anthropic Claude Sonnet 4.6 的 78.4,距離 GPT-5.5 的 78.7 僅一步之遙;目前榜首是 Anthropic Opus 4.8 的 83.4。

把這些數字放在一起看,圖像很清楚:電腦操作已進入「前排互咬」階段,前幾名差距在誤差範圍內,沒有一家拿到斷層領先。Google 官方稱這是該公司在代理式電腦操作任務上「迄今最佳表現」,但沒有提供獨立第三方驗證。

安全設計:對抗訓練與企業防護

能操作真實介面的代理,最大風險是提示注入:惡意網頁或文件中的指令,可能劫持代理去執行非預期動作。Google 的第一道防線是針對性的對抗訓練,降低模型在線上環境被注入攻擊誤導的機率。

第二道防線是兩項可選的企業級防護:其一,敏感或不可逆的動作必須先取得使用者明確確認;其二,偵測到間接提示注入時自動中止任務。Google 同時建議採取多層防禦:安全沙箱、人類在環驗證與嚴格的存取控制,三者缺一不可。

對代理開發者的實際意義

三個直接影響。第一,選型邏輯改變:當 Flash 級模型在 OSWorld 與旗艦模型打成平手,「要不要為電腦操作多付旗艦價」變成值得重新計算的問題。第二,安全預設值成為差異點:確認機制與注入中止是開箱選項,等於把企業採購最在意的安全條款做進平臺層。第三,電腦操作從展示技術走向日常工程——文件審查、無障礙檢查、持續測試這類枯燥但高價值的流程,是它最先落地的地方。提示注入風險仍需自行評估,沙箱與人類監督不可省略。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵