ByteDance Seed 團隊 7 月 31 日發表新一代影片創作模型 Seedance 2.5。它建構在 Seedance 2.0 的統一多模態架構上,延續聲音與畫面聯合生成的路線,這代把力氣花在兩處:把基礎生成的長度與穩定性再往上推,以及把參考生成做成主力功能。發表當天,模型已上架即夢(Jimeng AI)網頁版與豆包 Pro 的影片生成功能,BytePlus ModelArk 的 API 則標註「即將推出」。上線消息很快登上 Hacker News 首頁,一天內累積超過 400 點,討論集中在同一個問題:這次又把實用門檻拉高了多少。
30 秒單次生成,多輪延伸可到數分鐘
前代 Seedance 2.0 的單次生成上限是 15 秒,2.5 直接翻倍到 30 秒,而且不是靠事後拼接。更關鍵的是多輪延伸:逐段續拍時,角色、場景與節奏能夠保持一致,幾個 30 秒就能接成多分鐘的成片。官方也強調,單次生成內就能完成多鏡頭敘事,情節有鋪陳、轉折與收尾,鏡頭切換比前代乾淨。
畫質改進集中在過去最容易穿幫的位置:紋理、皮膚與眼部細節、打光,還有那些一眼假的雜訊——亂入的字幕、憑空出現的背景音樂,都被點名要壓掉。
一次可引用 30 張圖、10 段影片、10 段音訊
參考生成是這代的主打。單次生成最多可引用 30 張圖片、10 段影片與 10 段音訊,多個角色的長相與聲音能在複雜場景裡保留下來。三類參考各有定位:實物渲染(clay render)參考讓創作者先用 3D 塊狀模型定下構圖、運鏡與光影;動作參考負責轉移肢體表演;創意參考則承接風格。對熟悉真人拍片流程的團隊,這比較像「先選角、先走位,再開拍」,而不是抽獎。
時間戳級編輯,綠幕也升級
編輯能力細到時間戳層級,可以在生成中與生成後指定「第幾秒改什麼」。綠幕合成不再只是換背景,還會處理主體對新環境的物理反應;運鏡視角與基於參考的編輯也一併升級。對拍短劇、廣告與教育內容的團隊來說,能針對特定幾秒修正,比整段重來省下太多時間。
不發跑分,先講邊界
Seedance 2.5 沒有公布基準測試成績。團隊點名了目標場景——教育、製造、具身智能與自動駕駛——也直白承認還沒解決的問題:複雜動作的物理合理性,以及多主體互動的穩定性。在同行發表即甩榜單的風氣下,先把做不到的事說清楚,反而少見;對評估導入的人來說,這比漂亮數字更有參考價值,因為它直接告訴你哪些場景先別碰。
對創作者與開發者的意義
三點。第一,30 秒加多輪延伸把單支影片的可用長度推進到分鐘級,短劇與廣告可以開始把生成素材放進正式流程,而不是只拿來發想。第二,聲音與畫面聯合生成表示配音與音效不再是後製外掛,既有工作流得重排,成本結構也跟著變。第三,API 還沒開放,想自動化的團隊只能等 BytePlus ModelArk;專案頁在 seed.bytedance.com/seedance2_5。眼下最實際的路徑,是先在即夢與豆包上驗證需求,並把流程設計圍繞參考生成與時間戳編輯展開——這兩個能力最可能決定它在生產環境的存活率。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
