Qwen

Qwen3.5-Omni 登場:原生全模態、聽 113 種語言、說 36 種

阿里巴巴 Qwen 團隊推出原生全模態模型 Qwen3.5-Omni,單一管線處理文字、影像、音訊與視訊並即時說話,256K 上下文、可聽逾 10 小時音訊,Plus 版宣稱在一般音訊任務超越 Gemini 3.1 Pro。

Qwen3.5-Omni 登場:原生全模態、聽 113 種語言、說 36 種 — 文章封面
本頁內容6 個段落
  1. 原生全模態,不是外掛拼裝
  2. 三個版本與帳面數字
  3. 113 種語言與即時互動設計
  4. Audio-Visual Vibe Coding:自己長出來的能力
  5. 開源與否的路線問題
  6. 參考來源

阿里巴巴的 Qwen 團隊在 3 月 30 日發表 Qwen3.5-Omni,一個原生(native)全模態模型:文字、影像、音訊與視訊從同一管線輸入,直接輸出即時語音,不必先轉文字再交給語言模型。它提供 Plus、Flash、Light 三個版本,旗艦 Plus 宣稱在 215 項子任務上取得最佳成績。

對產品開發者來說,重點不是又一個多模態模型,而是「原生」兩個字:當語音的理解與生成在模型內部一體完成,延遲、情緒表達與對話輪替這些過去要靠外掛元件拼裝的體驗,第一次變成模型本身的規格。

原生全模態,不是外掛拼裝

架構上採用 Thinker-Talker 設計搭配 Hybrid-Attention 混合專家(MoE),而非在文字骨幹上外接現成語音編碼器。負責聽覺的原生 Audio Transformer(AuT)編碼器,預訓練用了超過 1 億小時的音訊與視訊素材。

帳面規格:256K 上下文;可連續輸入逾 10 小時音訊,或 400 秒以上、每秒 1 幀取樣的 720p 視聽內容。場景很具體:會議逐字稿、長篇訪談分析、長時間監控摘要——過去必須切段處理的素材,現在放進單次推理。

三個版本與帳面數字

三個版本各司其職:Plus 走高複雜度推理,Flash 主打高吞吐低延遲,Light 側重效率。官方部落格與技術報告列出的基準數字包括:VoiceBench 93.1,語音辨識在 LibriSpeech、WenetSpeech、FLEURS、CommonVoice 上領先;RealWorldQA 84.1、MVBench 79.0、OCRBench 91.3、IFEval 89.7、MMLU-Redux 94.2。

與 Gemini 3.1 Pro 的對比:一般音訊理解、推理與翻譯宣稱勝出,音訊視覺理解打平;跨 20 種語言的穩定性測試也稱低於 ElevenLabs、GPT-Audio 與 Minimax。這些是官方數字,獨立驗證尚未出現,採用前建議以自家 workload 實測為準。

113 種語言與即時互動設計

語言覆蓋是這一代最明顯的跳躍:語音辨識從前代的 19 種語言與方言擴增至 113 種,語音生成從 10 種擴增至 36 種。

即時互動設計同樣值得注意。ARIA(Adaptive Rate Interleave Alignment)用來穩定串流語音與文字的對齊;原生對話輪替能區分「嗯嗯」這類附和與真正的打斷,這些能力直接做進 API,而非交給下游處理。API 另提供語音複製,以及原生的網頁搜尋與函式呼叫。

Audio-Visual Vibe Coding:自己長出來的能力

最有趣的展示是「Audio-Visual Vibe Coding」:拍下介面問題、同時用說的描述需求,模型直接產出可運行的 Python 或前端原型。阿里強調此能力「未經專門訓練」,是全模態預訓練中自然湧現的。

湧現能力不保證可靠,但它示範了新的互動假設:輸入頻寬從文字擴充到「語音加畫面」,除錯與原型製作可以脫離鍵盤。對行動場景與非工程師,這可能比基準分數更實際。

開源與否的路線問題

取用管道有三條:Alibaba Cloud API、Qwen Chat,以及 Hugging Face 上的展示。但權重是否開放,訊號趨向保守——WinBuzzer 報導指出阿里此次維持閉源,僅提供 API 與展示。我們在年初的2026 開年觀察提過,模型公司今年在開源與閉源路線上的分歧持續擴大:Qwen 過去以開源建立生態,如今旗艦全模態能力改走閉源,把最先進的多模態能力收回計費牆內。

對建立在 Qwen 開源權重上的團隊,這是必須追蹤的分岔:開源線與閉源旗艦的能力差距,會決定自架與呼叫 API 的成本邊界。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵