2026 年 2 月 6 日,Waymo 發表 World Model:以 Google DeepMind 通用世界模型 Genie 3 為基礎、經專門後訓練的生成模型,用於大規模、超擬真的自駕模擬。它同時生成相機影像與光達資料——包括可互動檢視的 4D 點雲——讓 Waymo 在虛擬世界重現、改寫與擴充情境。
分量要看數字:Waymo 已累積約 2 億英里全自動真實道路里程,虛擬世界裡跑過的則是數十億英里等級。World Model 是 Waymo「可證明安全的 AI」三大支柱中負責生成模擬環境的一根。當自駕安全爭論聚焦長尾情境,能把長尾變成可量產測試素材的人,就掌握驗證主導權。
什麼是 Waymo World Model
官方定位是「為大規模、超擬真自駕模擬立下新標竿的前沿生成模型」,由 Chiyu Max Jiang、Xander Masotto、Bo Sun 發表。最有意思的是多模態輸出:不只生成影片,還生成與 Waymo 硬體對應、且與畫面一致的 3D 光達點雲。
這來自對 Genie 3 的專門後訓練——把 Genie 從大量影片學到的 2D 世界知識,轉移成 Waymo 感測器規格的 3D 輸出。Ars Technica 稱之為「駕駛重模擬」:拿實際錄下的影片,用提示改變行駛路線,重播「如果當時別這樣開」的平行版本。
三種控制:路線、場景、語言
World Model 有三種控制。駕駛動作控制:重播一段錄製行駛,可照原路線也可換新路線,做反事實測試——同一個路口,「開得積極一點」與「提早讓行」的結果可直接比較。場景布局控制:調整道路、號誌與其他用路人。語言控制:用文字指定時間、天氣,甚至生成全合成場景。
Waymo 拿它與 3D Gaussian Splatting 這類重建式方法對比:重建方法偏離錄製路線時會因缺乏觀測而畫面崩壞,學習式模型則維持合理。這是「重建過去」與「生成可能」的分野,也是世界模型的賣點。
為什麼選 Genie 3:預訓練的槓桿
多數自駕模擬器「從零開始、只用自家路測資料」訓練,能模擬的範圍被車隊見過的世界框住。Genie 3 在大型多元影片上預訓練,Waymo 因此能模擬車隊從未遇過的情境,這是通用模型的槓桿。對 DeepMind,Genie 也從研究計畫變成有內部客戶的基礎設施。
效率版本以一點品質換長時間滾動模擬,示範以 4 倍速播放。它還能把行車紀錄器或手機影片轉成 Waymo Driver 視角的多模態模擬。
長尾情境與安全驗證
官方展示的清單本身就是說明:龍捲風、洪水、金門大橋上的積雪、大象、獅子、穿暴龍裝的行人、汽車大小的風滾草。這些情境要麼一輩子遇不到,遇到了也不能拿來練習。World Model 把它們變成可重複、可控制的測試案例:先虛擬演練,再建立安全基準。
對開發者與 AI 團隊的啟示
三個啟示。第一,世界模型正從展示走向工程:生成環境可控、可重播、可對照感測器規格時,模擬就從成本中心變成驗證資產。第二,預訓練加領域後訓練再次生效——與其從零蓋模擬器,不如站在通用模型肩上轉移,機器人與工業自動化團隊同樣適用。第三,反事實測試是評估代理系統的通用手法:同一情境、不同策略並排比較,比成功率更能暴露行為差異。
參考來源
- The Waymo World Model: A New Frontier For Autonomous Driving Simulation — Waymo
- Waymo leverages Genie 3 to create a world model for self-driving cars — Ars Technica
- Waymo Introduces the Waymo World Model — MarkTechPost
本文由 AI 協助自上述來源整理,經人工審核後發布。
