Qwen

Qwen3.8-Flash-Next 發表:新架構把啟用參數壓到 6B

2026 年 8 月 26 日,Qwen 開源 Qwen3.8-Flash-Next:125B 主模型加 51B n-gram 嵌入表,每個 token 只啟用 6B 參數,原生 262K 上下文,官方定位是極致成本效率。

Qwen3.8-Flash-Next 發表:新架構把啟用參數壓到 6B — 文章封面
本頁內容6 個段落
  1. 發布與成績單
  2. 三個不尋常的零件
  3. 效率優先
  4. 本機部署的現實
  5. 對開發者的意義
  6. 參考來源

2026 年 8 月 26 日,Qwen 開源 Qwen3.8-Flash-Next,副標直接把立場寫在臉上:「新架構,邁向極致成本效率」。這是一個總參數約 180B、每個 token 只啟用 6B 的視覺語言模型:125B 主模型,外加 51B 的 n-gram 嵌入表與 4B 的 MTP 模組。發布當天,這則消息在 Hacker News 拿到超過 700 點、兩百多則留言,是當週開源圈討論度最高的發布之一。

發布與成績單

官方數字先看一輪:GPQA Diamond 91.7、LiveCodeBench v6 91.9、SWE-bench Multilingual 81.0、SWE-bench Pro 62.5、AndroidWorld 84.5、HLE 35.9。原生上下文 262,144 tokens,用 YaRN 可延展到一百萬。官方另外給了一個成本對比:訓練成本約為 Qwen3.7-Plus 的九分之一,表現卻全面超越。時間軸也值得注意——模型卡 8 月 24 日建立,ModelScope 前一天先以「125B A6B」預告,26 日正式連技術報告一起釋出。

三個不尋常的零件

第一,n-gram 嵌入表:約兩千萬條 bigram 與 trigram 統計,讓模型不靠 RAG 就能召回事實,而且這張表可以卸載到記憶體、甚至從 NVMe 分頁讀取,效能損失有限。第二,混合注意力:Gated DeltaNet 搭配 Qwen Sparse Attention(QSA),把長上下文的注意力成本壓下來。第三,MTP 多 token 預測層,解碼時可以一次預測多個 token 換速度。MoE 部分是 512 個專家、每 token 啟用 10 個路由專家加 1 個共享專家,共 48 層。有開發者從 llama.cpp 的報錯訊息裡挖出新架構代號「qwen4exp」,認為這次發布也是在為 Qwen 4 鋪路。

效率優先

啟用 6B 的直接後果是服務成本低:每個 token 的計算量與一個 6B 稠密模型相當,卻帶著 125B 主體的知識容量。官方把它定位成高吞吐、低延遲的主力機型——代理式工作流動輒消耗幾十萬 token,成本曲線直接決定能不能大規模跑。代價同樣清楚:n-gram 表偏靜態,召回靠統計而非語義,長尾知識仍要依靠主模型參數或外部工具補齊。

本機部署的現實

啟用參數只有 6B,不等於本機好跑。n-gram 表與全部權重仍要佔記憶體:Unsloth 文件建議至少 75GB RAM 或統一記憶體,最小的量化檔也有約 73GB。社群實測的量級是——DGX Spark 用 nvfp4 約每秒 12 個 token,開 MTP 後到 16 至 20;Strix Halo 約 35;128GB 的 M5 Max 在 18 萬 token 上下文下用約 100GB 記憶體仍可運行。方向很清楚:這不是給 16GB 筆電用的模型,而是把「一張卡跑大型 MoE」的成本壓到工作站等級。

對開發者的意義

三件事值得注意。第一,如果 llama.cpp 的架構代號屬實,Flash-Next 就是 Qwen 4 的架構預告,現在評估技術選型時值得把這條遷移路徑納入考量。第二,262K 原生上下文加上可卸載的 n-gram 表,對需要長文件、長對話、又不想維護向量資料庫的應用來說是新的選項。第三,本機部署的門檻在記憶體而不是算力——規劃硬體時按 80GB 起步估算,比按「6B 啟用」估算更接近現實。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵