AI

微軟MAI-DxO診斷AI 準確率近八成勝醫師

2025年6月30日微軟發表MAI-DxO診斷系統,搭配OpenAI o3在NEJM複雜病例上達79.9%準確率,遠高於21位醫師的19.9%,成本更低,並稱之為通往醫療超智慧之路。

微軟MAI-DxO診斷AI 準確率近八成勝醫師 — 文章封面
本頁內容6 個段落
  1. 發表:會「看診」的診斷編排器
  2. SDBench:79.9%對19.9%
  3. 成本:比單用o3便宜近七成
  4. 「醫療超智慧」與就業說法
  5. 對開發者的意義
  6. 參考來源

2025年6月30日,微軟公布一套名為MAI-DxO(Microsoft AI Diagnostic Orchestrator)的AI診斷系統:在一系列取自《新英格蘭醫學期刊》(NEJM)的疑難病例上,系統搭配OpenAI的o3模型解出79.9%的病例,而21位來自美英的資深醫師只解出19.9%。Guardian與The Decoder當天報導了這項研究。

數字之外,更值得留意的是微軟替它選的形容:這是「通往醫療超智慧的一條路」。由Mustafa Suleyman領軍的微軟AI部門,把診斷當成下一個攻堅目標。

發表:會「看診」的診斷編排器

MAI-DxO的設計模仿真實臨床醫師的工作方式:逐步詢問特定問題、開立檢驗、再收斂到最終診斷。例如患者出現咳嗽與發燒症狀時,系統會先安排血液檢查與胸部X光,才得出肺炎的判斷。這種編排器架構讓模型不只做單輪問答,而是像醫師一樣序列式地收集資訊。微軟批評傳統評測依賴美國醫師執照考試(USMLE)這類選擇題,偏好背誦答案而非深入理解,可能高估AI模型的真實診斷能力——因此他們另闢了新的評測方式。

SDBench:79.9%對19.9%

研究團隊建立了名為SDBench的基準,從NEJM選出304個「診斷複雜、智力要求高」的病例。在「逐步看診」設定下,MAI-DxO搭配o3達到79.9%的準確率;對照組是21位美英資深醫師,在不能查閱教科書、不能諮詢同事、不能使用聊天機器人的條件下,準確率為19.9%。約四倍的差距構成了這次發表的主要賣點,不過研究也自陳限制:病例僅來自NEJM的疑難案例,成本估算以美國市場為基礎,且結果尚待同儕審查。

成本:比單用o3便宜近七成

效率是另一個核心指標。單獨使用o3雖然診斷能力強,但平均每個病例要呼叫約7,850美元的推理成本;MAI-DxO透過有序的測試選擇,把平均成本壓到每例約2,397美元,比單用模型降低近70%,也低於對照醫師群的每例約2,963美元。微軟強調,這套系統比人類醫師更有效率地安排檢驗,是成本優勢的主要來源。

「醫療超智慧」與就業說法

微軟以「通往醫療超智慧」形容這項研究的方向,但同時淡化對醫師職位的衝擊,並在部落格中寫道:臨床角色遠不只是做出診斷,醫師需要在不確定中導航、與病人及家屬建立信任,「這些是AI尚未被設計來做到的」。Suleyman則對《衛報》表示,這類系統可望在5到10年內接近零錯誤,屆時將是全球醫療體系肩頭上的一大解脫。一邊是超智慧級的願景,一邊是「輔助而非取代」的保證,兩種敘事並存,正是這次發表最耐人尋味的地方。

對開發者的意義

對開發者而言,這份研究的方法論比榜單更有參考價值:與其比拚單一模型的原始能力,不如在模型之上加一層模仿專業工作流程的編排器——分步提問、選擇性花費、收斂結論,就能同時提高準確率並壓低成本。這個「編排器乘以強模型」的模式,正在診斷之外的多個專業領域被複製。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵