Video Generation

開鏡頭前先比價:四條 image-to-video 模型線的時長、解析度與控制取捨

OpenRouter 比較 Veo 3.1、Seedance、Kling 與 Grok Imagine Video 的每秒成本、幀控制與時長上限,影響你的模型選型。

開鏡頭前先比價:四條 image-to-video 模型線的時長、解析度與控制取捨 — 文章封面
本頁內容6 個段落
  1. 先確定第一幀之後要發生什麼
  2. 兩種用圖方式,兩個請求欄位
  3. 四條線各自的甜蜜點
  4. 送出前先驗證圖片 URL,並關掉提交的重試
  5. 收下來的實用結論
  6. 參考來源

先確定第一幀之後要發生什麼

如果你手上已經有影片的起始圖片,選 image-to-video 模型時真正決定成本與架構的,不是排行榜分數,而是第一幀之後的具體需求:影片要不要精準結束在第二張圖、需不需要超過幾秒的長度、要不要模型生成音訊、每秒預算是多少。

OpenRouter 在 2026 年 9 月 29 日發表的一篇比較文章,把這四個變數攤開來對照了四條模型線:Veo 3.1、Seedance、Kling 和 Grok Imagine Video。資料取自 9 月 11 日查詢的模型目錄與各模型頁面價格,而且所有模型都走同一個 video generation API,提交、輪詢、下載的生命週期一致——換模型不需要改管線,只需要改參數。這一點對打算做多模型路由的團隊特別重要,我在先前的文章(開鏡頭前先算帳:四條 image-to-video 模型線的成本與控制取捨)裡也討論過類似的取捨邏輯。

兩種用圖方式,兩個請求欄位

文章區分了圖片在請求中的兩種角色:

  • image-to-video:圖片被固定為首幀、尾幀或兩者。產品影片必須準確開在某張產品照上,就用這個模式。
  • reference-to-video:模型收到參考素材但不固定到幀位置,例如同一角色的多張圖,讓生成的新鏡頭維持外觀。

API 上對應兩個欄位:frame_images(帶 first_frame 或 last_frame 的 frame_type)與 input_references。不是每個模型都支援兩種幀角色,送出前要查目錄裡的 supported_frame_images。若兩個欄位同時送出,frame_images 優先,任務會被當成 image-to-video。

四條線各自的甜蜜點

按 OpenRouter 整理的規格,選型可以這樣切:

八秒內、要生成音訊選 Veo 3.1 系列。三款都生成 4、6 或 8 秒片段,支援首尾幀控制與 generate_audio 選項;Veo 3.1 與 Fast 最高 4K,Lite 到 1080p。Lite 起價 $0.03/秒,Veo 3.1 是 $0.20/秒,所以在 prompt 和運動還在反覆調整的階段,用 Lite 或 Fast 比較省。另外 Fast 與 Lite 的模型說明列了 SynthID 浮水印,有溯源或浮水印要求的流程要留意。

要 20 或 30 秒一鏡到底、或多參考素材選 Seedance 2.5。它是這次比較中唯一能一次生成 20 或 30 秒片段的模型(4 至 30 秒,480p 或 720p),並接受最多 50 個圖片、影片、音訊參考資產,起價 $0.1028/秒(480p)。如果用不到這些上限,Seedance 2.0 線在 4 至 15 秒內以更低起價(Mini 為 $0.03363/秒)覆蓋同樣的首尾幀流程,且 2.0 支援到 4K。注意:Seedance 價格其實是按 video token 計費(高 × 寬 × 時長 × 24 ÷ 1024),表列每秒數字是 480p 的起始費率。還有一個部署限制——全系列僅提供 hosted API,沒有公開權重,無法本地或離線部署。

3 至 15 秒、要首尾幀控制選 Kling v3.0。Standard 與 Pro 都是 720p,音訊選配會影響價格(Std $0.084/秒無音訊、$0.126 有;Pro 為 $0.112 與 $0.168)。只需 5 或 10 秒的鏡頭,Kling Video O1 以 $0.112/秒覆蓋同樣的幀角色。

只要固定開場、時長彈性大選 Grok Imagine Video 1.5。1 至 15 秒、480p 到 1080p、七種長寬比,模型說明提到會生成音效、氛圍聲與對白,但 supported_frame_images 只列 first_frame——無法固定結尾。若片段必須結束在第二張精確圖片,只能用 Veo、Seedance 或 Kling。

送出前先驗證圖片 URL,並關掉提交的重試

文章還給了兩個省錢的實務細節。第一,來源圖片必須透過穩定、可直接下載的 HTTPS URL 提供:能在瀏覽器開啟不代表 provider 抓得到(session cookie、HTML 轉址、bot 檢查都會讓抓取失敗),先用 curl -I 確認回傳 200 與圖片 content type 再花額度。

第二,TypeScript SDK 預設對 5XX 錯誤做最長一小時的指數退避重試,但影片提交一旦被伺服器接受就是計費工作——如果 job ID 還沒回到你手上就遇到暫時性錯誤,自動重試會送出第二個付費任務。文章建議在提交呼叫時傳 { retries: { strategy: "none" } },讓失敗浮現為錯誤、由你決定是否重新提交。

收下來的實用結論

大多數模型按秒計費,所以時長本身就是成本決策:以 Seedance 2.5 的起始費率算,4 秒片段約 $0.41 起,30 秒約 $3.08 起。實際做法是把「時長上限、幀角色、音訊、解析度」四個條件當過濾器先砍名單,再比剩下模型的單價——並記得各模型的支援設定以 GET /api/v1/videos/models 的即時回傳為準,價格以模型頁為準,因為費率會隨解析度、音訊與輸入類型變動。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵