Google DeepMind

Gemini Robotics 2 進場:從腳到指尖的機器人全身智能

2026 年 7 月 30 日 Google DeepMind 發表 Gemini Robotics 2,以 VLA、ER 與 On-Device 三個模型讓人形機器人全身控制、綁繩結、組隊合作,並公布 ASIMOV-Agentic 安全基準。

Gemini Robotics 2 進場:從腳到指尖的機器人全身智能 — 文章封面
本頁內容7 個段落
  1. 一套系統、三個模型
  2. 全身控制與雙手靈巧度
  3. 代理式推理與機器人團隊合作
  4. On-Device 2:幾小時學會新機體
  5. 安全設計:ASIMOV-Agentic 基準
  6. 對機器人開發者的意義
  7. 參考來源

2026 年 7 月 30 日,Google DeepMind 發表 Gemini Robotics 2,把一年多來的「視覺—語言—動作」路線再往前推一步:機器人不再只動上半身,而是從腳到指尖的全身控制。DeepMind 機器人部門負責人 Carolina Parada 在公告中把這一代定位為「下一代真正可適應機器人的智能層」。

一套系統、三個模型

Gemini Robotics 2 由三個模型組成。Gemini Robotics 2 本體是最強的視覺—語言—動作模型(VLA),把視覺與語言輸入直接轉成馬達控制,能完整控制人形與雙臂機器人;Gemini Robotics ER 2 是具身推理模型(VLM),擔任機器人的高層大腦,負責與人溝通、規劃長達數分鐘的多步驟任務;Gemini Robotics On-Device 2 則是效率優先的 VLA,專為在本機硬體上離線運行而設計。ER 2 已上架 Google AI Studio,並在 Gemini Enterprise Agent Platform 私人預覽;另兩個模型開放給早期存取夥伴。

全身控制與雙手靈巧度

展示裡最有感的是全身任務。對 Apptronik 的 Apollo 2 人形機器人說「把灑水壺放進下層架子的綠色箱子」,它會自己走向桌子、拿起灑水壺、走到架子前放好——前幾代只能控制上半身做桌面任務。靈巧操作方面,同一個模型檢查點可以驅動 Apollo 2 上 22 自由度的 SharpaWave 五指手,完成綁繩結、密封夾鏈袋這類細膩動作,也能操作 Franka Duo 平台的標準二指夾爪做緊密裝箱。DeepMind 也坦言,多指靈巧操作的成功率仍是挑戰。

代理式推理與機器人團隊合作

ER 2 的角色更像代理:觀察環境、推演步驟、指揮 VLA 執行、追蹤進度,步驟失敗時自我修正。這一代能穩定執行長達數分鐘、涉及數百個決策的任務序列,模型也懂判斷任務的開始與結束、標定關鍵事件發生的時刻。新功能「多機器人協作」則讓不同類型的機器人互相溝通、分工接下單機做不來的工作流——清理凌亂房間的示範裡,機器人會組隊加速完成。

On-Device 2:幾小時學會新機體

許多機器人應用不能依賴網路。On-Device 2 延續 Gemini Robotics 1.5 的「動作遷移」技術,原生支援多機體:面對形狀、感測器、自由度截然不同的新機器人,通常只要不到 200 筆範例、數小時的適應時間就能上手,示範平台涵蓋 Dexmate、SO101 與 Trossen。對硬體新創來說,「買模型、套機體」又便宜一級。

安全設計:ASIMOV-Agentic 基準

能力變強,安全測試跟著升級。DeepMind 推出 ASIMOV-Agentic 基準,衡量具身推理代理能否拒絕 VLA 發出的不安全工具呼叫、預判任務是否可行,並在不確定時主動請求人類介入。ER 2 同時是 DeepMind 迄今在「安全約束遵循」與「人機接近」基準上最安全的機器人模型:能偵測有人靠近、觸發安全工具呼叫,並讓機器人安全停止,符合協作安全標準的關鍵要求;細節見隨發布的安全技術報告。

對機器人開發者的意義

三個訊號值得注意。第一,「ER 規劃、VLA 執行」的分層架構正在成形,對應軟體工程裡代理規劃、工具執行的分工。第二,多機體適應門檻降到幾小時、兩百筆資料,機器人新創能更專注在機體設計,而不是從零訓練模型。第三,Google 把 ER 2 放進 AI Studio 與企業代理平台,物理 AI 進入一般開發者工具鏈。DeepMind 明言,這是通往「在物理世界解開 AGI」路上的里程碑——這一步把人形機器人從展示影片推向可用任務。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵