2026 年 3 月 26 日,Cohere 發布並開源其語音辨識模型 Transcribe(模型識別碼 cohere-transcribe-03-2026):20 億參數,採 Conformer 編碼器加 Transformer 解碼器架構,以 Apache 2.0 授權上架 Hugging Face。發布當日,它以 5.42% 的平均詞錯率(WER)登上 Hugging Face Open ASR 排行榜第一名。
定位明確:不是通用語音助理模型,而是衝著企業音訊而來——把錄音、客服通話、會議轉成可搜尋、可分析、可自動化的文字,且可完全在本地跑。
模型設計:2B 參數的取捨
Transcribe 支援 14 種語言:9 種歐洲語言(英、法、德、義、西、葡、希臘、荷蘭、波蘭)、4 種亞太語言(華語、日語、韓語、越南語)與阿拉伯語。Cohere 在部落格詳列訓練資料、模型卡與評測方法,並強調緊湊體積可在標準消費級硬體上執行——是 Apache 2.0 之外另一個瞄准本地部署的訊號。
這個尺寸刻意留在「單卡可跑」的範圍內,用一點上限換部署彈性,與只存在於雲端 API 後面的閉源模型走相反的路。
5.42% WER:開源 ASR 進入比分咬合期
在 Hugging Face Open ASR 排行榜(Cohere 引用版本截至 2026 年 3 月 26 日)上,Transcribe 以 5.42% 的平均 WER 居首,領先一整排強勁對手:Zoom Scribe v1 為 5.47%、IBM Granite 4.0 1B Speech 為 5.52%、NVIDIA Canary Qwen 2.5B 為 5.63%、Qwen3-ASR-1.7B 為 5.76%、ElevenLabs Scribe v2 為 5.83%,而 Whisper Large v3 是 7.44%。
值得注意的是前段班的擁擠程度:Cohere 引述的前六名彼此差距不到 0.45 個百分點。開源 ASR 的精度競賽已進入比分咬合期,單靠 WER 很難拉開差距,差異化正轉向吞吐、延遲與部署主權。
人類評估與吞吐量表現
WER 之外,Cohere 補上人類偏好評估:受測者平均 61% 的比例偏好 Transcribe 的輸出。分對手看,對 IBM Granite 4.0 差距最大(78%),對 Whisper Large v3 為 64%,對 ElevenLabs Scribe v2 僅 51%——幾乎五五波,可見在頂尖模型之間,評測數字與人類聽感的相關性仍然有限。
吞吐量方面,Cohere 稱其在 10 億參數以上的開源模型中具備最佳 RTFx(處理速度與音訊時長之比);對批次消化大量錄音的企業場景,這往往比 WER 更能決定總成本。
三種部署路徑
Transcribe 的發布刻意鋪了三條落地路徑:其一是從 Hugging Face 下載權重,在本地或邊緣裝置執行;其二是使用 Cohere 提供的免費 API(有速率限制);其三是透過 Model Vault 做生產級部署與微調。建議場景包括錄音應用、聯絡中心、會議系統,以及金融、醫療等受監管產業。
TechCrunch 當日報導聚焦其「專為轉錄打造」的定位;MarkTechPost 則以「企業語音智慧」框架解讀。Cohere 的路線圖還包括更多語言、串流與批次 API,以及領域微調技術。
對語音應用開發者的意義
三個實際影響。第一,開源 ASR 榜首再次換人,且 Apache 2.0 無額外使用限制,商業產品可直接採用。第二,本地部署路徑對資料出境受限的場景(客服錄音、醫療對話、內部會議)是硬需求,Transcribe 的尺寸設計正對準這一塊。第三,免費 API 加 Model Vault 的組合,顯示開源模型公司把模型當入口、變現放在部署與平台層——採用權重容易,整條工作流才是護城河。
參考來源
- Cohere Transcribe: Open-Source Speech Recognition — Cohere
- Cohere launches an open-source voice model specifically for transcription — TechCrunch
- Cohere AI Releases Cohere Transcribe: A SOTA ASR Model — MarkTechPost
本文由 AI 協助自上述來源整理,經人工審核後發布。
