Copilot

微軟 MAI 三模型上線 Foundry:轉錄、語音與影像

2026 年 4 月 2 日,微軟把自研的 MAI-Transcribe-1、MAI-Voice-1、MAI-Image-2 送上 Microsoft Foundry 公開預覽:轉錄 GPU 成本砍半、一秒生成一分鐘語音、影像模型首發衝上 Arena.ai 第三名。

微軟 MAI 三模型上線 Foundry:轉錄、語音與影像 — 文章封面
本頁內容6 個段落
  1. 三個模型走進 Foundry
  2. 轉錄與語音:第一方音訊堆疊
  3. MAI-Image-2:首發衝進前三
  4. 定價與責任 AI 但書
  5. 對開發者與產品團隊的意義
  6. 參考來源

2026 年 4 月 2 日,Microsoft AI 執行長 Mustafa Suleyman 宣布三個自研模型進入 Foundry 與 MAI Playground 公開預覽:語音轉錄的 MAI-Transcribe-1、語音生成的 MAI-Voice-1,以及影像生成的 MAI-Image-2。這批模型讓微軟第一方 AI 能力跨出文字,補上音訊與視覺,走企業級 API 路線。

三個模型走進 Foundry

官方說明把 Foundry 定位為「最完整的 AI 與 app agent 工廠」。MAI-Transcribe-1 與 MAI-Voice-1 部署在既有的 Azure AI Speech 資源上,不必重建管線;MAI-Image-2 走 Foundry 標準模型目錄。同一批模型也驅動 Copilot、Bing Image Creator、PowerPoint 與 Azure Speech——第一方與對外 API 用同一套權重。

轉錄與語音:第一方音訊堆疊

MAI-Transcribe-1 主打 25 種語言的準確率:在 FLEURS 前二十五大語言中拿下 11 個第一,其餘 14 個勝過 Whisper-large-v3,其中 11 個再勝 Gemini 3.1 Flash。GPU 成本宣稱比領先方案省約 50%,批次轉錄比 Azure Fast 快 2.5 倍,定價每小時 0.36 美元,已扛起 Copilot 語音模式的轉錄與聽寫。微軟並坦承模型內嵌文獻記載的人類偏見,且公開說明處理方式。

MAI-Voice-1 訴求長篇幅內容的情緒範圍與說話者音色一致,微軟形容用它寫語音「更像繪圖而不是聽寫」。單張 GPU 不到一秒就能生成一分鐘語音,每百萬字元 22 美元。個人語音用 10 秒樣本即可複製聲音,但必須過審核流程——刻意加的摩擦。

MAI-Image-2:首發衝進前三

MAI-Image-2 在 Arena.ai 影像排行榜首發即第三名,微軟稱家族穩居前三,速度比上一代快至少一倍。文案特別強調圖內文字渲染——在圖片中直接生成可讀文字,向來是擴散模型的弱項。WPP 全球創意長 Rob Reilly 稱它是「真正的遊戲規則改變者」。Copilot、Bing 與 PowerPoint 會分階段換上。

定價與責任 AI 但書

帳面數字:轉錄每小時 0.36 美元、語音每百萬字元 22 美元、影像輸入每百萬 token 5 美元、輸出每百萬 token 33 美元。微軟明顯在用第一方基礎設施壓單價——與我們在 Replit 免費模式分析看到的模型經濟學戰爭同一條戰線:誰能把每單位智慧的邊際成本壓得更低,誰就拿到分發權。但書也清楚:語音複製要審核,模型內建防護,責任 AI 約束設計進產品而非事後補上。

對開發者與產品團隊的意義

三個實際影響。第一,音訊管線多了供應商選項:轉錄與語音共用一個 Azure Speech 資源,遷移成本低。第二,同一模型驅動第一方產品,代表用量規模真實——Copilot 的日常流量就是壓力測試。第三,影像 API 定價(輸出每百萬 token 33 美元)值得放進選型表,特別是大量圖內文字的行銷場景。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵