2025年6月30日,微軟公布一套名為MAI-DxO(Microsoft AI Diagnostic Orchestrator)的AI診斷系統:在一系列取自《新英格蘭醫學期刊》(NEJM)的疑難病例上,系統搭配OpenAI的o3模型解出79.9%的病例,而21位來自美英的資深醫師只解出19.9%。Guardian與The Decoder當天報導了這項研究。
數字之外,更值得留意的是微軟替它選的形容:這是「通往醫療超智慧的一條路」。由Mustafa Suleyman領軍的微軟AI部門,把診斷當成下一個攻堅目標。
發表:會「看診」的診斷編排器
MAI-DxO的設計模仿真實臨床醫師的工作方式:逐步詢問特定問題、開立檢驗、再收斂到最終診斷。例如患者出現咳嗽與發燒症狀時,系統會先安排血液檢查與胸部X光,才得出肺炎的判斷。這種編排器架構讓模型不只做單輪問答,而是像醫師一樣序列式地收集資訊。微軟批評傳統評測依賴美國醫師執照考試(USMLE)這類選擇題,偏好背誦答案而非深入理解,可能高估AI模型的真實診斷能力——因此他們另闢了新的評測方式。
SDBench:79.9%對19.9%
研究團隊建立了名為SDBench的基準,從NEJM選出304個「診斷複雜、智力要求高」的病例。在「逐步看診」設定下,MAI-DxO搭配o3達到79.9%的準確率;對照組是21位美英資深醫師,在不能查閱教科書、不能諮詢同事、不能使用聊天機器人的條件下,準確率為19.9%。約四倍的差距構成了這次發表的主要賣點,不過研究也自陳限制:病例僅來自NEJM的疑難案例,成本估算以美國市場為基礎,且結果尚待同儕審查。
成本:比單用o3便宜近七成
效率是另一個核心指標。單獨使用o3雖然診斷能力強,但平均每個病例要呼叫約7,850美元的推理成本;MAI-DxO透過有序的測試選擇,把平均成本壓到每例約2,397美元,比單用模型降低近70%,也低於對照醫師群的每例約2,963美元。微軟強調,這套系統比人類醫師更有效率地安排檢驗,是成本優勢的主要來源。
「醫療超智慧」與就業說法
微軟以「通往醫療超智慧」形容這項研究的方向,但同時淡化對醫師職位的衝擊,並在部落格中寫道:臨床角色遠不只是做出診斷,醫師需要在不確定中導航、與病人及家屬建立信任,「這些是AI尚未被設計來做到的」。Suleyman則對《衛報》表示,這類系統可望在5到10年內接近零錯誤,屆時將是全球醫療體系肩頭上的一大解脫。一邊是超智慧級的願景,一邊是「輔助而非取代」的保證,兩種敘事並存,正是這次發表最耐人尋味的地方。
對開發者的意義
對開發者而言,這份研究的方法論比榜單更有參考價值:與其比拚單一模型的原始能力,不如在模型之上加一層模仿專業工作流程的編排器——分步提問、選擇性花費、收斂結論,就能同時提高準確率並壓低成本。這個「編排器乘以強模型」的模式,正在診斷之外的多個專業領域被複製。
參考來源
- The Decoder:Microsoft’s MAI-DxO boosts AI diagnostic accuracy and cuts costs by nearly 70 percent
- The Guardian:Microsoft says AI system better than doctors at diagnosing complex health conditions
本文由 AI 協助自上述來源整理,經人工審核後發布。
