AI for Science

把兩階段訓練拿掉之後:SimpleDesign 對蛋白質設計流程的意義

Apple 的 SimpleDesign 直接在資料空間訓練序列與結構共同設計模型,挑戰先訓練 autoencoder 的兩階段慣例。

把兩階段訓練拿掉之後:SimpleDesign 對蛋白質設計流程的意義 — 文章封面

蛋白質設計的模型訓練,長期以來有一套看起來很合理、但其實很貴的流程:先訓練 autoencoder 把序列與結構壓成 latent representation,再訓練生成模型在 latent space 裡工作。Apple ML Research 在 2026 年 9 月 11 日發表的 SimpleDesign 論文,直接質疑這個前提是否必要。

被拿掉的那一階段

根據 Apple ML Research 的論文頁面,SimpleDesign 是一個直接在資料空間訓練的多模態蛋白質設計模型,採用單階段端到端目標:序列用離散 cross-entropy,結構用 regression objective。作者群的假設是,要得到表現良好的 co-design 模型,多階段訓練並非必要。

這件事對做產品的人有意義,因為兩階段訓練的成本不只是算力。它把 pipeline 切成兩個獨立的失敗點:autoencoder 的 latent 品質決定上限,生成模型只能在那個上限裡工作。當你發現最終輸出不好,很難判斷問題出在壓縮階段還是生成階段。單階段目標把這個診斷問題收斂成一個。

模態差異怎麼處理

序列是離散的,結構是連續的,硬把兩者塞進同一個表徵會互相牽制。論文提到,SimpleDesign 用 Transformer-based multimodal backbones,允許 modality-specific processing,同時在兩個模態上保留 global self-attention。

這是架構上的取捨,不是魔法。保留全域注意力意味著模型仍要付出跨模態計算的代價,換來的是序列與結構之間的對應關係不會在早期就被壓扁。作者在超過 200 萬組 sequence-structure pairs 上訓練,並在 co-design 與無條件序列/結構生成 benchmark 上取得具競爭力的表現。

值得注意的是,論文用「competitive」而不是「state-of-the-art」。對要選模型的團隊來說,這個措辭差異決定了 SimpleDesign 是替代方案還是對照組。

對建置流程的實際影響

如果你正在評估蛋白質設計的模型堆疊,這篇論文提供一個可檢驗的方向:先問「這個 latent space 真的在幫我,還是只是歷史慣例」。同樣的問題在別的領域也出現過——把生物序列當成搜尋空間、用代理縮短前期探索,這類做法的價值往往來自減少中間層,而不是增加中間層。

延伸閱讀可以參考站上這篇:把生物序列當搜尋空間:Codex 與 ChatGPT 如何縮短抗菌分子前期探索,它談的是同一個大方向——讓模型更靠近原始資料,而不是更靠近人類設計的中介表徵。

還沒被回答的部分

supplied RSS summary 沒有提供推論成本、模型規模或與既有 co-design 方法的逐項比較數字,因此無法判斷單階段訓練在實際部署時省下多少資源。論文標註部分作者的工作是在 Apple 期間完成,第一作者同時隸屬 Mila 與 Université de Montréal,這些隸屬關係對後續維護與授權的影響,來源也沒有說明。

實務上的下一步很簡單:如果你的 pipeline 目前卡在 latent 品質與生成品質難以歸因,SimpleDesign 的單階段目標值得當成一個對照實驗來讀,而不是直接當成替換方案。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵