2026 年 6 月 29 日,Ai2 在部落格介紹 DiScoFormer(Density and Score Transformer):一個用單一 Transformer、從有限樣本同時估計機率密度與分數的模型。對應的技術報告最早於 2025 年 11 月上傳 arXiv,2026 年 6 月更新至第四版,並獲選 ICML 2026 口頭報告。
密度告訴你資料聚在哪裡;分數是對數密度的梯度,是擴散模型、貝氏取樣與粒子模擬背後共同的引擎。幾乎每個生成式模型、許多科學運算任務,最底層都在估計這兩個量。兩者其實是同一個物體的兩種視角,這也是「一次同時估出兩者」的方法值得注意的原因。
老問題:免訓練與高維準確的二選一
傳統工具是核密度估計(KDE):不必訓練,拿到樣本就能算,但在高維度急速失效。神經分數匹配模型在高維度仍然準確,代價是每換一個分布就要從頭重訓。這個取捨在實務上很痛:每個新資料集、每個更新後的後驗分布、每個模擬的物理系統,都是一個新分布。DiScoFormer 的目標是合併兩邊的優點:訓練一次,之後對任意新分布直接推論,不需要針對每個問題重新訓練。
方法:共享主幹、兩個輸出頭、免標籤一致性損失
模型把整組樣本當作輸入,經共享的 Transformer 主幹,一次前向傳播同時輸出密度與分數,並用交叉注意力在任意查詢點取值。因為整組樣本都在上下文裡,模型先看到分布的整體形狀,再對每個查詢點作答,而不是逐點孤立判斷。理論上,單一注意力頭的權重可以近似高斯核,因此一個交叉注意力區塊就足以重現 KDE——DiScoFormer 是 KDE 的推廣,而不是取代。
兩個輸出頭之間還有一條物理約束:分數必須等於對數密度的梯度。任何不一致都能當作免標籤的一致性損失,甚至在推論階段繼續優化,讓模型在訓練時沒見過的分布上自我調適——等於自帶一條物理檢查,不需要任何正確答案標籤。訓練資料則靠高斯混合分布自動生成:每個批次抽一個新的混合分布,封閉解同時給出密度與分數,等於無限量的監督訊號;而高斯混合可以任意逼近任何密度,訓練分布永遠不會用完。
高維度成績:分數誤差低約 6.5 倍、密度誤差低逾 37 倍
在 100 維實驗中,DiScoFormer 的分數誤差比最佳調校的 KDE 低約 6.5 倍,密度誤差低超過 37 倍,而且維度越高差距越大。樣本數持續增加時它仍不斷進步,KDE 則先撞上記憶體上限——核方法必須儲存並比對每個樣本點,成本隨資料量成長,而固定大小的 Transformer 只是消化更多證據。它也泛化到訓練時沒見過的更高混合數,以及拉普拉斯、Student-t 等非高斯形狀。KDE 仍保有小型資料集上的速度優勢,低維度、小樣本的快速檢視仍是它的主場。
對生成模型與科學運算的意義
技術報告把 DiScoFormer 描述為即插即用的預估器:訓練一次,推論時直接套用到任意分布與樣本量,並展示分數去偏 KDE 與 Fokker-Planck 偏微分方程等下游應用。對需要反覆估計密度與分數的團隊,這代表每換一個分布就重訓一個模型的成本可以省掉——今天「每個實驗訓一個小分數網路」的工作流,可能收斂成載入預訓練估計器、跑一次前向傳播。對擴散模型、貝氏推論與科學運算,則多了一個可以共用的底層元件;ICML 口頭報告的席位,說明方法論社群也看到了同樣的潛力。
參考來源
- DiScoFormer: One transformer for density and score — Ai2
- DiScoFormer: Plug-In Density and Score Estimation with Transformers — arXiv
本文由 AI 協助自上述來源整理,經人工審核後發布。
