Generative AI

Waymo World Model 登場:用 Genie 3 生成超擬真自駕模擬世界

2026 年 2 月 6 日,Waymo 發表建構在 Genie 3 之上的 World Model,同時生成相機影像與光達點雲,支援路線重模擬與罕見情境測試。本文解析三種控制機制、預訓練的槓桿,與對自駕安全驗證的意義。

Waymo World Model 登場:用 Genie 3 生成超擬真自駕模擬世界 — 文章封面
本頁內容6 個段落
  1. 什麼是 Waymo World Model
  2. 三種控制:路線、場景、語言
  3. 為什麼選 Genie 3:預訓練的槓桿
  4. 長尾情境與安全驗證
  5. 對開發者與 AI 團隊的啟示
  6. 參考來源

2026 年 2 月 6 日,Waymo 發表 World Model:以 Google DeepMind 通用世界模型 Genie 3 為基礎、經專門後訓練的生成模型,用於大規模、超擬真的自駕模擬。它同時生成相機影像與光達資料——包括可互動檢視的 4D 點雲——讓 Waymo 在虛擬世界重現、改寫與擴充情境。

分量要看數字:Waymo 已累積約 2 億英里全自動真實道路里程,虛擬世界裡跑過的則是數十億英里等級。World Model 是 Waymo「可證明安全的 AI」三大支柱中負責生成模擬環境的一根。當自駕安全爭論聚焦長尾情境,能把長尾變成可量產測試素材的人,就掌握驗證主導權。

什麼是 Waymo World Model

官方定位是「為大規模、超擬真自駕模擬立下新標竿的前沿生成模型」,由 Chiyu Max Jiang、Xander Masotto、Bo Sun 發表。最有意思的是多模態輸出:不只生成影片,還生成與 Waymo 硬體對應、且與畫面一致的 3D 光達點雲。

這來自對 Genie 3 的專門後訓練——把 Genie 從大量影片學到的 2D 世界知識,轉移成 Waymo 感測器規格的 3D 輸出。Ars Technica 稱之為「駕駛重模擬」:拿實際錄下的影片,用提示改變行駛路線,重播「如果當時別這樣開」的平行版本。

三種控制:路線、場景、語言

World Model 有三種控制。駕駛動作控制:重播一段錄製行駛,可照原路線也可換新路線,做反事實測試——同一個路口,「開得積極一點」與「提早讓行」的結果可直接比較。場景布局控制:調整道路、號誌與其他用路人。語言控制:用文字指定時間、天氣,甚至生成全合成場景。

Waymo 拿它與 3D Gaussian Splatting 這類重建式方法對比:重建方法偏離錄製路線時會因缺乏觀測而畫面崩壞,學習式模型則維持合理。這是「重建過去」與「生成可能」的分野,也是世界模型的賣點。

為什麼選 Genie 3:預訓練的槓桿

多數自駕模擬器「從零開始、只用自家路測資料」訓練,能模擬的範圍被車隊見過的世界框住。Genie 3 在大型多元影片上預訓練,Waymo 因此能模擬車隊從未遇過的情境,這是通用模型的槓桿。對 DeepMind,Genie 也從研究計畫變成有內部客戶的基礎設施。

效率版本以一點品質換長時間滾動模擬,示範以 4 倍速播放。它還能把行車紀錄器或手機影片轉成 Waymo Driver 視角的多模態模擬。

長尾情境與安全驗證

官方展示的清單本身就是說明:龍捲風、洪水、金門大橋上的積雪、大象、獅子、穿暴龍裝的行人、汽車大小的風滾草。這些情境要麼一輩子遇不到,遇到了也不能拿來練習。World Model 把它們變成可重複、可控制的測試案例:先虛擬演練,再建立安全基準。

對開發者與 AI 團隊的啟示

三個啟示。第一,世界模型正從展示走向工程:生成環境可控、可重播、可對照感測器規格時,模擬就從成本中心變成驗證資產。第二,預訓練加領域後訓練再次生效——與其從零蓋模擬器,不如站在通用模型肩上轉移,機器人與工業自動化團隊同樣適用。第三,反事實測試是評估代理系統的通用手法:同一情境、不同策略並排比較,比成功率更能暴露行為差異。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵