Generative AI

Stable Audio 3.0 發表:開放權重、6 分 20 秒完整作曲

2026 年 5 月 20 日 Stability AI 發表 Stable Audio 3.0 四模型家族:三款開放權重、最長 6 分 20 秒完整作曲,Small 可在手機端生成 2 分鐘音樂,全家族以完全授權資料訓練,正面挑戰纏訟中的 Suno 與 Udio。

Stable Audio 3.0 發表:開放權重、6 分 20 秒完整作曲 — 文章封面
本頁內容6 個段落
  1. 四個模型,從手機到資料中心
  2. 開放權重與社群授權的界線
  3. 授權資料是護城河
  4. 技術亮點與人事訊號
  5. 對開發者與創作者的意義
  6. 參考來源

2026 年 5 月 20 日,Stability AI 發表 Stable Audio 3.0 模型家族,一次推出四個模型:Small SFX、Small、Medium 與 Large。官方定位是「為藝術實驗而生的開放權重模型家族」,其中 Medium 與 Large 能生成最長 6 分 20 秒的完整樂曲,並維持音樂結構與旋律基調——比 2024 年的 Stable Audio 2.0 多出一倍以上。三個模型以開放權重釋出,而且全家族都以完全授權的資料訓練。

這個組合正好踩在音樂生成市場最痛的兩個點上:輸出長度與訓練資料的合法性。當 Suno 與 Udio 還在跟唱片工業纏訟,Stability 用自家與環球、華納簽下的合約繞開了戰場。

四個模型,從手機到資料中心

  • Small SFX(4.59 億參數):手機與消費級筆電上的裝置端音效生成
  • Small(4.59 億參數):裝置端完整作曲,最長 2 分鐘;Stability 稱它是目前唯一能在裝置端完成完整作曲的模型
  • Medium(14 億參數):強化結構、旋律連貫與樂句處理,曲目最長 6 分 20 秒
  • Large(27 億參數):家族中最強的音樂性,鎖定高流量、對延遲敏感的音樂平台

對照組很殘酷:2024 年 6 月的 Stable Audio Open 只能生成 47 秒,Open Small 更只有 11 秒;新的 Small 直接把裝置端能力拉到 2 分鐘。生成長度支援秒級粒度的變長控制。

開放權重與社群授權的界線

Small SFX、Small 與 Medium 已上架 Hugging Face,採 Community License:輸出歸你所有,可以自由散布與商業化。但年營收超過 100 萬美元的組織必須取得企業授權,內含賠償保障與選配的白手套微調。Large 不開放權重,只透過 Stability API 與企業自架提供,後續也會登上 ComfyUI 等合作平台。

授權資料是護城河

公告裡最尖銳的一段是對競爭對手的暗示:Stability 稱其他開放音樂模型「要嘛限制商業使用,要嘛冒著用未授權音樂訓練的風險」。底氣來自 2025 年的兩張合約:10 月與環球音樂(UMG)的策略聯盟、11 月與華納音樂(WMG)的下一代工具合作。當對手還在法庭上解釋訓練資料從哪來,授權本身就是差異化。Stability 的判斷寫得很白:「以藝術家為中心的 AI 要贏,唯一的方式是讓授權平台上的產品體驗更好。」

技術亮點與人事訊號

  • 全新的語義—聲學 autoencoder 架構,並同步發表研究論文
  • LoRA 微調支援,搭配新釋出的文件
  • Inpainting 支援單段與多段編輯,加上因果延續——把曲目往結尾之後繼續寫

人事面同樣有訊號:前 Universal Audio 與 Fender 數位長 Ethan Kaplan 加入,掌管專業音樂產品線,音樂人導向的產品套件已在開發。整個產業都在搶音樂圈老手:Suno 找來前 Merlin 執行長 Jeremy Sirota,ElevenLabs 則從 Kobalt 挖來 Derek Cournoyer。

對開發者與創作者的意義

三個實際影響。第一,裝置端音樂生成首次有堪用的開放權重選項:2 分鐘的離線作曲可以塞進手機 App,離線音效、遊戲素材與互動裝置都是直接受惠者。第二,百萬美元營收的授權門檻劃出一條清楚的線——個人與小團隊免費用,公司要賠償保障就付費,這是開放權重商業化的新基準姿勢。第三,Google 的 Lyria 3 Pro(3 月)與 ElevenLabs 的音樂 App(4 月)已先後進場,Stability 用「開放權重+授權資料」卡進第三個位置;音樂生成的競爭正從「誰生成得久」轉向「誰能合法地商業化」。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵