Mistral

Mistral 開源 Voxtral Transcribe 2:即時轉錄挑戰雲端大廠

2026 年 2 月 4 日,Mistral 發表 Voxtral Transcribe 2:批次與串流兩款轉錄模型,FLEURS 詞錯誤率約 4%,即時版以 Apache 2.0 開源、4B 參數可跑邊緣裝置,API 每分鐘 0.003 美元起。本文解析其延遲與準確度取捨和生態定位。

Mistral 開源 Voxtral Transcribe 2:即時轉錄挑戰雲端大廠 — 文章封面
本頁內容6 個段落
  1. 兩個模型:批次與串流
  2. 延遲與準確度的取捨
  3. 開源權重與邊緣部署
  4. 計價與周邊生態
  5. 對開發者與產品團隊的意義
  6. 參考來源

2026 年 2 月 4 日,Mistral 發表 Voxtral Transcribe 2,一次推出兩個模型:批次轉錄的 Voxtral Mini Transcribe V2 與串流的 Voxtral Realtime。後者以 Apache 2.0 開源權重(Voxtral-Mini-4B-Realtime-2602,8.87 GB),4B 參數可直接跑在邊緣裝置。API 計價:批次每分鐘 0.003 美元、即時每分鐫 0.006 美元。

在 FLEURS 基準上,Mistral 報出約 4% 的詞錯誤率(WER)。這次發布的意義有二:語音轉錄的成本地板再一次下移;串流轉錄首次有開源權重做到「接近批次品質」。這也是繼 2025 年 7 月第一代 Voxtral 之後最大的升級。

兩個模型:批次與串流

批次版鎖定離線工作負載:說話者分離(附起訖時間,重疊語音通常歸為同一人)、context biasing(最多 100 個自訂詞彙引導專有名詞,英文最佳)、詞級時間戳,以及 13 種語言(英、中、印地、西、阿、法、葡、俄、德、日、韓、義、荷)。抗噪針對工廠與客服中心環境,單次請求最長 3 小時音訊。Voxtral Realtime 走串流路線,延遲可組態到 200ms 以下。

延遲與準確度的取捨

串流轉錄的難點是「等多久、錯多少」。Mistral 的數據:延遲 2.4 秒時,即時版準確度與批次版持平;壓到 480ms 時,WER 只增加 1 到 2 個百分點。橫向比較上,Mistral 宣稱勝過 GPT-4o mini Transcribe、Gemini 2.5 Flash、Assembly Universal 與 Deepgram Nova;對比 ElevenLabs Scribe v2 則快約 3 倍、成本約五分之一。宣稱照例要自行驗證,但串流與批次只差 1 到 2 個百分點,已把即時應用的可行邊界往外推。

開源權重與邊緣部署

即時版開源是這次發布最重要的一部分。Apache 2.0、4B 參數的體積,讓本地跑即時轉錄從整合專案變成下載即用。Mistral 明確瞄準隱私敏感場景:GDPR 與 HIPAA 合規的本地或私有雲部署。在 2026 年開源路線分歧擴大的背景下(見年初觀察),開源權重是對抗雲端鎖定的籌碼,而語音正是資料最敏感的模態之一。

計價與周邊生態

每分鐘 0.003 美元,等於每小時 0.18 美元。API 端點是 /v1/audio/transcriptions,model ID 為 voxtral-mini-latest 與 voxtral-mini-transcribe-realtime-2602。Mistral Studio 同步上線音訊 playground,可上傳 10 個檔案(mp3、wav、m4a、flac、ogg,各 1GB)。Simon Willison 實測評價正面——demo 能即時處理快速語音與 Django、WebAssembly 這類術語,文字稿帶說話者標籤,可匯出純文字、SRT 或 JSON。

對開發者與產品團隊的意義

三個判斷。第一,若轉錄是變動成本大頭,0.003 美元/分鐘值得重新試算,尤其是對照既有供應商的帳單。第二,需要即時字幕、語音代理或合規記錄的產品,多了一條開源、可自架、480ms 延遲的路徑。第三,評估請用自己的資料:基準橫跨 FLEURS、Switchboard、CallHome、AMI,但工廠噪音與多說話者重疊仍要實測——分離在重疊語音上的限制,是官方寫明的邊界。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵