2026 年 6 月 1 日,史丹佛法學院發布盲測研究 “Law Professors Prefer AI Over Peer Answers”:16 位美國法學教授針對 40 題契約法提問,把自己寫的答案與 AI 生成的答案匿名混在一起互評,在近 3,000 次盲評中,AI 在 75% 的兩兩對決裡勝出。
這不是「AI 又贏了一個 benchmark」的故事。評分者是最擅長挑剔論證的族群之一——法學教授;評的是教學答疑,不是考試分數;而且 AI 答案被評為「教學上有害或誤導」的比例(3.5%)還低於教授同儕答案(12%)。研究由史丹佛法學院 Julian Nyarko 教授主持(Legal Innovation through Frontier Technology Lab,簡稱 liftlab),第一作者為 liftlab 研究者 Alejandro Salinas,共同作者包括耶魯法學院的 Sarath Sanga,以及來自 NYU、芝加哥大學等機構的學者。
研究怎麼做
設計要點有三。第一,題目很日常:40 個契約法問題,都是學生下課後或 office hours 會問的類型,不是競賽題或刁鑽題。第二,評分是雙盲的:教授先自己寫答案,再對匿名化後的答案評分,全程不知道某個答案出自 AI 還是同事。第三,為了公平,AI 的回應被事先調校到與人類答案相近的長度與結構,避免「看長度猜來源」,並採用多種評估方法交叉驗證。
16 位教授、近 3,000 次匿名比較——樣本談不上巨大,但盲測設計把品牌光環與身分偏見都控制掉了,這正是多數「AI 比 X 強」研究缺少的東西。
核心數字
- AI 在 75% 的兩兩對決中勝過教授寫的答案
- AI 的整體表現與研究中最好的人類講師相當
- AI 答案被標為「教學上有害或誤導」的比例為 3.5%,同儕教授的答案則為 12%
第三個數字常被忽略,卻可能是最重要的:教授盲評時,對 AI 答案的安全顧慮低於對同事答案的。這與「AI 會誤導學生」的普遍直覣正好相反。
測了哪些系統
研究檢視了商用家教系統與 Google 的 NotebookLM,各系統表現不一。官方新聞稿未列出完整模型清單;論文全文以 PDF 公開,並掛在 SSRN(編號 6849678)。值得留意的是,受測的都是現成可用的產品,不是特調模型——任何學生今天都拿得到同樣的工具,這讓研究的現實感比實驗室評測高得多。
限制與作者自己的警告
Nyarko 特別強調,這項研究只評估「答案品質」,「如何把這些工具落地、真正改善學習成效,仍是開放問題」。換句話說:AI 答得好,不等於用了 AI 的學生學得更好。盲測本身也有邊界——40 題全部集中在契約法一科,16 位教授的樣本無法代表整個法學教育,更不用說其他學科。
研究公布後在 Hacker News 湧入大量討論(417 分、356 則留言),多數爭論正是圍繞「答疑品質」與「教育成效」之間的落差。
對教育科技的意義
三個觀察。第一,「入門級答疑」可能是 AI 在高等教育裡最先被大規模採用的場景——它高頻、耗時,而且有可盲測的客觀品質指標。第二,當 AI 答案在盲測中勝過授課者自己,學校要處理的問題就從「要不要禁用」變成「如何重新設計答疑與評量」——禁令擋不住已經人人可用的工具。第三,NotebookLM 這類接地於課程自有教材的工具進入嚴謹研究視野,代表「AI + 自有教材」的教育應用開始有了可量測的證據基礎,而不只是行銷話術。
參考來源
- AI outperforms law professors in Stanford Law study — Stanford Law School
- Law Professors Prefer AI Over Peer Answers — Stanford Law School Publications
- Salinas et al. 論文 PDF — Stanford Law School
本文由 AI 協助自上述來源整理,經人工審核後發布。
