2026 年 4 月 13 日,論文《Introspective Diffusion Language Models》掛上 arXiv(編號 2604.11035),隔天衝上 Hacker News 首頁。這是 Together AI、UIUC、Princeton、Stanford 與 UT Austin 的 15 人合作,作者群包含 Tri Dao、James Zou 等熟悉名字,共同第一作者為 Yifan Yu 與 Yuqing Jian。論文宣稱做出第一個能在同參數規模下追平自回歸模型的擴散語言模型:I-DLM。
擴散語言模型(DLM)一直被視為平行生成的希望:一次前向傳遞可以同時產出多個 token,理論上吞吐量遠高於逐字生成的 AR 模型。但品質落差始終補不上,多數團隊寧可留在 AR 陣營。I-DLM 的價值在於先講清楚落差的原因,再給出一套能直接落在現有推理基礎設施上的解法。
擴散語言模型卡在哪裡
DLM 的生成方式是不斷去噪:從全 MASK 的序列出發,逐步填回 token。麻煩在於模型可以同時填多個位置,而這些位置在當下彼此看不見——同一段落這次填 A,重新來一次可能換成 B。論文把這稱為「內省一致性」(introspective consistency)的失敗:模型學會了去噪,卻沒學會認得自己寫過什麼。量化指標是內省接受率:AR 模型對自身先前輸出的接受度約 0.984,SDAR 等擴散模型只有 0.699,一般 DLM 落在 0.57 到 0.70 之間。
內省一致性:自回歸的隱藏優勢
AR 模型的因果遮罩讓每個 token 只看得到前文,logit shift 又讓訓練與推論的分佈一致,這兩件事順帶強制了自我一致。I-DLM 的訓練配方直接借用同樣的機制:嚴格因果注意力、「Dream shift」logit 偏移與全遮蔽訓練目標,把預訓練好的 AR 權重轉成擴散模型。成本出乎意料地低:I-DLM-8B 只用 45 億 tokens、8 張 H100、兩個 epoch 就完成,訓練時採用逐步拉大步長的課程設計(先 N=2 再 N=3)。
內省式跨步解碼怎麼運作
核心演算法是內省式跨步解碼(ISD):每次前向傳遞,模型一邊在 MASK 位置提出 N 個新 token,一邊回頭驗證先前生成的段落,以 min(1, p(x)/q(x)) 的準則決定保留或重寫。這套接受準則與 speculative sampling 同源,論文證明它能讓輸出分佈對齊原本的 AR 模型。另有無損變體 R-ISD:以 rank 128 的 gated LoRA、約 1.12 倍開銷,讓輸出與基礎 AR 模型逐位元一致——等於把平行解碼當成純粹的加速器使用。
基準與吞吐數字
I-DLM-8B 由 Qwen3-8B 轉換而來,在知識、數學、程式、指令遵循四大類共 15 項基準上追平原模型;對上一代 DLM 則是全面拉開:AIME-24 拿 69.6,參數多一倍的 LLaDA-2.1-mini 16B 只有 43.3;LiveCodeBench-v6 是 45.7 對 30.4。放大到 32B 之後,AIME-24 83.3、AIME-25 80.0、LCB-v6 57.1,論文宣稱勝過 100B 級的 LLaDA-2.1-flash。吞吐方面,並發 64 時比 LLaDA-2.1-mini 與 SDAR 快 2.9 到 4.1 倍;單張 H100、並發 32 下每請求約 186 到 193 tokens/s。更值得注意的是批次擴展斜率:SDAR 僅 84,I-DLM 達 549,代表批次越大越划算,這正是平行解碼該有的經濟學。
直接跑在 SGLang 上的工程意義
過去 DLM 需要專用推理引擎,等於重練整套基礎設施。I-DLM 的服務端直接疊在 AR 生態的優化上:相容 SGLang,再疊加 CUDA graphs(提升 42 到 76%)、靜態批次調度(11 到 21%)、argmax 提案(11 到 15%)與分頁核心(10 到 14%),整體比樸素基線快 2.1 到 2.5 倍。對工程團隊的意義很實際:導入門檻從「更換推理堆疊」降為「更換 checkpoint」。程式以 BSD 3-Clause 授權開源在 GitHub,8B、32B 模型與 LoRA 介面卡都已放上 Hugging Face。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
