Open Models

MiniMax H3 開源:一次生成 2K 影片與立體聲的全模態模型

MiniMax 於 7 月 31 日發表 Hailuo 後繼者 H3,數日後釋出權重:33B 全模態 Transformer 同時生成最長 15 秒、768p 起步 2K 的影片與原生立體聲,ComfyUI Day-0 支援,量化後 RTX 3060 也能本地運行。

MiniMax H3 開源:一次生成 2K 影片與立體聲的全模態模型 — 文章封面
本頁內容6 個段落
  1. 從 Hailuo 到 H3:把寶押在任務泛化上
  2. 33B 全模態 Transformer:架構細節
  3. 開放,但不是全部
  4. 在消費級顯卡上跑起來
  5. 對創作者與開發者的意義
  6. 參考來源

7 月 31 日,MiniMax 發表 Hailuo 後繼者 H3,標語是「打破任務與模態之間的邊界」:文字、圖片、影片與音訊放進同一個上下文理解,輸出是帶原生立體聲的影片。公告承諾「未來幾天內」開放權重——8 月 3 日權重上架 Hugging Face,ComfyUI 當天宣布 Day-0 支援。

商業影片模型多是封閉權重,只能走 API、按秒付費;H3 把「開源」從願景寫成時程表,而且兌現了。

從 Hailuo 到 H3:把寶押在任務泛化上

H3 的核心主張寫在公告裡:「我們相信任務泛化是不可逆的趨勢,架構上的小聰明應該讓位給模型本身的定義方式。」落到功能上,一個模型同時吃下文生影片、圖生影片、首尾幀、參考影片,加上對白、音效與配樂,一次生成,不必事後拼接音訊。

規格:單段最長 15 秒、24fps、32kHz 立體聲,預設 768p,最高原生 2K。2K 的做法巧妙:H3 不掛超解析度模組,而是讓基礎模型「重新生成」自己剛產出的低解析度結果,官方稱為 In-Context Regeneration;配合 H3-VAE 的四倍等效序列長度才可行。官方宣稱 2K 每秒成本低於主流模型的三分之一。

33B 全模態 Transformer:架構細節

權重上架後,細節攤在 Hugging Face 模型卡與 GitHub 上:核心是 33B 參數的稠密單流 Omni-Transformer,約 13B 位於 AdaLN 相關分支,推理時可快取或跳過;編碼器復用 Qwen3-VL-32B 完整權重,取其第 50 層隱狀態——開源模型疊開源模型的案例。

位置編碼是橫跨時間、高度、寬度的 3D MM-RoPE;VisualVAE 做 16 倍空間、4 倍時間壓縮;AudioVAE 把 32kHz 立體聲轉成 40Hz 的潛空間 Token,聲音與畫面同序列訓練、生成。兩個開放檢查點對應兩種用法:FL2VA 吃文字或首尾幀,Ref2VA 吃最多 9 張圖、3 段影片與 3 段音訊;對白支援 11 種語言。

開放,但不是全部

H3 採用 Community License,開放範圍要說精確:三段式架構裡只有 H3-Base 開源。解析指令與前處理的 H3-Context-IR 走託管服務,能升到 2K 的 H3-Regenerate-2K 尚未開源,稀疏注意力也延後釋出。拿到手的是完整 768p 管線,2K 仍要走官方 API。

在消費級顯卡上跑起來

讓 H3 在社群爆紅的,是 ComfyUI 的 Day-0 支援。瘦身手段很直接:約四成調變權重剪枝後換成功能等價的查找表,疊上 int8 量化與自訂核心,峰值 VRAM 從全精度 123.6GB 降到 42.5GB,少 66%;配上動態卸載,一張 RTX 3060 就能本地跑。SGLang Diffusion 則給出兩張 RTX 5090 或一張 RTX Pro 6000 的方案。

ComfyUI 文章的總結一針見血:「音訊是模型的屬性,不是後處理。」影音在同一模型裡出生,同步性天生有保證。

對創作者與開發者的意義

三件事值得記下。第一,影音一體生成壓短了後期鏈條——對白、音效、配樂不必分頭生成再對齊,11 種語言的對白直接內建。第二,消費級顯卡能跑的開源影片模型,讓本地管線、離線場景與量產工作流變得現實;Qwen3-VL 編碼器的復用也提醒大家,開源生態的複利正在累積。第三,要看清授權與模組邊界——H3 開了主幹,2K 與指令解析仍握在官方手裡,直接影響架構設計。MiniMax 也預告下一代 H 系列將整合 M 系列語言模型能力——影片模型與 LLM 的融合才剛開始。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵