Open Models

GLM-5.3 權重開放下載:753B 旗艦的本地部署現實

2026 年 8 月 25 日,Z.ai 把 753B 參數的 GLM-5.3 權重放上 Hugging Face,三天後在 Hacker News 衝上 806 分。本文解析其 MoE 架構、自訂授權條款與本地部署實測。

GLM-5.3 權重開放下載:753B 旗艦的本地部署現實 — 文章封面
本頁內容6 個段落
  1. 從 API 獨占到權重可下載
  2. 753B MoE 加稀疏注意力:硬體門檻有多高
  3. 自訂授權:能下載,但要先讀條款
  4. 社群實測:速度與代價
  5. 對開發者的意義
  6. 參考來源

2026 年 8 月 25 日,Z.ai 把旗艦模型 GLM-5.3 的權重放上 Hugging Face。對開源社群而言,這是從「公告裡的開源」到「真的可以下載」的關鍵一步:這個 8 月 14 日發表時只能透過 API 使用的 753B 參數模型,現在能抓下來自己跑。8 月 28 日,「GLM-5.3 is now open-weight」登上 Hacker News 首頁,拿下 806 分、281 則留言,是當週開源圈討論度最高的帖子之一。

從 API 獨占到權重可下載

GLM-5.3 在 8 月 14 日發表時,官方定位是「最強的開源權重程式碼模型」,但權重實際上架是 8 月 25 日的事。模型卡重申兩個重點:它沿用 GLM-5.2 的基座,所有進步都來自後訓練;官方自測的 Z.ai Code Bench 成績比 GLM-5.2 提升約五成。程式碼基準的數字確實亮眼:Terminal Bench 2.1 拿下 88.2,FrontierSWE 78.1,DeepSWE 66.9,搭配工具的 HLE 也有 62.5。安全圈更關注的是 CyberGym 84.5 的漏洞挖掘成績——Z.ai 在發表時就主動承認,模型的網路攻擊能力「發展得比我們預期更快」,這句誠實的警告隨著權重開放顯得更迫切。

753B MoE 加稀疏注意力:硬體門檻有多高

先說結論:這不是一張消費級顯卡能對付的模型。GLM-5.3 總參數量 753B,架構是混合專家(MoE)搭配稀疏注意力,權重檔案約 756 GB、切成 141 個 safetensors 分片,絕大多數參數以 FP8 精度存放。想自己架,得準備多卡伺服器,或者大記憶體的 CPU 推理環境。推理框架的選擇倒是很齊:SGLang、vLLM、Transformers、KTransformers、Unsloth 與 TokenSpeed 都在官方支援之列,也列入了華為昇騰 NPU。不想折騰硬體的話,Hugging Face 頁面已列出六家託管推理供應商:Z.ai、Together、Novita、Fireworks、DeepInfra 與 Baseten。

自訂授權:能下載,但要先讀條款

值得注意的是,這次上架用的不是 MIT,而是名為「glm-5.3」的自訂條款,在 Hugging Face 上標為「其他」授權。對照 8 月 26 日智譜把小得多的 GLM-5.3-Flash 以 MIT 授權開源,策略意圖相當清楚:小模型放行、搶生態與開發者心智,旗艦則保留控制權。「開放權重」和「開源軟體」在這裡是兩件事——權重人人可下,商用的邊界由條款說了算。想認真導入 GLM-5.3 的團隊,法務審查這一步省不掉。

社群實測:速度與代價

HN 討論串很快變成大型硬體實測現場:兩台 DGX Spark 以 NVFP4 量化跑到每秒 20 到 30 個 token;一套約 6,000 美元的組合機約 14;EPYC 加 DDR4 配幾張 3090 大約 10;十年前的雙 Xeon 老機器只剩 1 上下。該不該買 512 GB 統一記憶體的 Mac Studio、值不值得為「擁有整個推論棧」花錢,留言區吵了幾百樓,隱私、合規與供應商風險是支持者的主要理由。少數人的共識是:753B 旗艦的本地化成本仍然很高,真正能當日常主力的還是小模型。

對開發者的意義

三件事。第一,模型路由多了一個可自架的頂級選項:需要高階程式碼能力、又想避開閉源 API 的團隊,終於有能落地的前沿開源權重可以當後備。第二,自訂授權是合規紅線,導入前先把條款讀完,別被「可下載」三個字誤導。第三,CyberGym 那一列分數提醒所有人:開放權重的攻擊能力是真的,拿它做紅隊演練或安全研究時,隔離環境的預算不能省。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵