2026 年 6 月 10 日,成立於 2023 年的新創 Decart 發表 Oasis 3:一個可透過 API 直接呼叫的互動式世界模型。輸入文字提示,它即時生成攝影級、可持續演化的駕駛環境,並隨機器人動作閉環變化。Decart 稱其為「第一個從第一天起就以 API 開放的世界模型」,執行長 Dean Leitersdorf 宣示:「每台機器人都將在世界模型內完成訓練,這個時代從今天開始。」
意義在於:世界模型正從實驗室展示變成按量付費的運算服務;對自駕車團隊而言,暴雪、隧道、鏡頭遮蔽這類長尾情境的產生器,第一次有了公開價目表。
什麼是 Oasis 3
Oasis 3 建立在 Decart 的即時影片基礎模型 Lucy 與推論堆疊 DOS(Decart Optimization Stack)之上,採自回歸式「Live Stream Diffusion」架構:逐框生成,以前序畫面與機器人動作為條件。與前代以鍵盤滑鼠輸入為主不同,Oasis 3 以機器人動作為條件,用幾何感知架構輸出同步的三鏡頭畫面(一前二側),對應自駕車感知系統的真實配置。
環境由文字提示驅動、可無上限閉環生成,官方宣稱長會話具備漂移修正能力;訓練採用 NVIDIA 的 Physical AI Open Dataset,運行於 CoreWeave 的 HGX B200 叢集。定位用途有四:線上強化學習、部署前策略評估、高保真遙控操作產生專家資料、模擬難以安全搭建的罕見事件。
效能數字與定價
官方規格:22 FPS、512×768×3(三鏡頭)、延遲低於 200 毫秒,DOS 宣稱約 100 倍效率提升。API 定價每秒 0.02 美元。Leitersdorf 給出規模感:每框約 8,000 tokens,以每秒數十框計,即每秒數十萬 tokens 的吞吐。使用者可與環境互動長達數小時;Decart 社群逾 10 萬名開發者,多在 Lucy 之上。
實測的限制
TechCrunch 當天實測則冷靜許多:紐約市提示的場景逐漸漂移成「西部城市」,原本的路口完全消失;方向控制經常失效;車輛互相穿越——物理並未真正被模擬,測試者形容為「一場夢境般、斷裂的意識流」。自回歸設計也讓上下文視窗迅速填滿;團隊坦承長記憶與 token 壓縮仍在研究,下一版可能從影片起始。Leitersdorf 對此很坦白:好的駕駛資料遠多於事故資料。
商業盤算
真正的戰略是生態系:Leitersdorf 直言這讓他想起「LLM 早期、OpenAI 發明了模型 API」的時刻,並預期「將有一整個開發者社群在這之上長出來」。資金也充足:五月中由 Radical Ventures 領投的 3 億美元輪,迎來 NVIDIA、Toyota Ventures、Adobe 與 eBay Ventures,TechCrunch 報導估值近 40 億美元;他補充,公司成立以來的燒錢金額「遠低於」1 億美元。
世界模型競賽中的位置
2026 年的世界模型賽道已相當擁擠:Google 的 Genie 3、World Labs 的 Marble、Runway 與 Luma 都已卡位,我們在年初的 2026 AI 開局展望整理過這條賽道。Decart 靠垂直整合差異化:自研模型加推論堆疊,DOS 跨 NVIDIA、Google 與 Amazon 硬體,Leitersdorf 宣稱因此比對手便宜一個數量級以上。世界模型是否重演 LLM 的 API 商業化劇本,幾季內可見分曉;物理一致性仍是共同的硬課題。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
