Video Generation

ByteDance Seedance 2.0 登場:音視訊統一生成,15 秒多鏡頭立體聲

2026 年 2 月 12 日,ByteDance Seed 團隊發布 Seedance 2.0,以統一多模態架構一次生成 15 秒多鏡頭影片與同步立體聲音軌,支援文字、圖片、音訊、影片四種輸入混合,先在中國上線,再經第三方平台走向海外。

ByteDance Seedance 2.0 登場:音視訊統一生成,15 秒多鏡頭立體聲 — 文章封面
本頁內容6 個段落
  1. 一次請求、四種輸入:統一音視訊架構
  2. 15 秒多鏡頭與多軌立體聲
  3. 先中國、後全球的上線節奏
  4. 官方承認的限制與肖像授權紅線
  5. 對創作者與產品團隊的意義
  6. 參考來源

2026 年 2 月 12 日,ByteDance Seed 團隊正式發布新一代影片生成模型 Seedance 2.0。最大的改動寫在架構裡:上一代 Seedance 1.5 把音訊與視覺分開處理,2.0 改為「統一多模態音視訊聯合生成架構」,文字、圖片、音訊、影片四種輸入可以在同一個請求中組合,單次輸出帶有同步聲音的多鏡頭影片。

發布時點同樣值得注意。Reuters 同日以「DeepSeek 衝擊一週年」為題的報導,把 Seedance 2.0 的亮相列為低成本中國 AI 模型浪潮的最新案例;而 2 月上旬模型發布一路密集,也正是 2026 開年觀察裡「模型加速」路線的延續——只是這次戰線從語言模型延伸到了影片生成。

一次請求、四種輸入:統一音視訊架構

Seedance 2.0 的輸入上限相當寬鬆:單一請求最多可參考 9 張圖片、3 段影片與 3 段音訊,再搭配自然語言指令。官方強調「多模態全方位參考」——模型會從輸入抽取構圖、鏡頭語言、動作節奏與聲音特徵,也接受文字分鏡腳本作為輸入。架構上,音訊與視覺在同一趟生成中一起產出,並對畫面中的動作維持影格級的感知;相較 1.5「先生成影片、再配音」的兩段式流程,聲音與畫面的因果關係明顯更自然。

15 秒多鏡頭與多軌立體聲

輸出規格是 15 秒、多鏡頭、雙聲道立體聲的影片,音軌可包含背景音樂、環境音與配音等多軌內容,並與畫面同步。官方展示的案例包含雙人花式滑冰的跳躍與拋舉、武俠竹林對決與 1920 年代查爾斯頓舞——重點不在題材,而在多主體互動與物理合理性,這正是影片模型最常出錯的地方。模型還支援由 prompt 驅動的運鏡規劃、針對既有片段的角色或劇情編輯,以及「續拍」式的影片延伸。對中文內容創作者另有加分項:官方宣稱對方言、傳統戲曲與演唱場景的指令遵循明顯改善。

先中國、後全球的上線節奏

與多數中國模型一致,Seedance 2.0 先在中國境內上線,國際版本隨後透過第三方平台提供。以 getimg.ai 為例,Seedance 2.0 與 Google Veo 3.1、Sora 2 Pro、Kling 3.0 Pro 並列在同一個訂閱方案內,月費 8 美元起。對海外創作者來說,接入門檻是「多一個下拉選單」,而不是一筆新的採購決策;對 ByteDance 來說,這條通路讓模型直接進入與美國模型同一張比較表。

官方承認的限制與肖像授權紅線

官方部落格罕見地逐條列出已知弱點:細節穩定性、超寫實人像、偶發的音訊失真、多主體一致性、文字渲染與複雜編輯效果。更值得注意的是授權紅線——若以真實人物的肖像作為主體參考,必須通過身分驗證或取得事先的法律授權。在深偽訴訟升溫的 2026 年,這條規則對產品團隊的重要性不亞於模型能力本身:任何「上傳照片生成影片」的功能,都必須先把這道驗證流程設計進去。

對創作者與產品團隊的意義

三個觀察。第一,「帶聲音的 15 秒」會改變短影音工作流:配音、音效與剪輯原本是三個步驟,現在是同一個 prompt 的輸出。第二,多模態參考把「素材庫」變成輸入介面——9 張圖加 3 段影片,足以支撐一支廣告腳本需要的視覺與角色延續性。第三,平台戰局已經定型:Veo、Sora、Kling 與 Seedance 出現在同一個訂閱方案裡競爭,差異化將轉向控制精度、多主體一致性與授權合規,而不是單純比拚畫質。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵