2026 年 8 月 26 日,智譜 AI(Z.ai)正式開源 GLM-5.3-Flash,同時揭曉一個懸案:先前匿名掛上 OpenRouter、直接衝上程式碼模型榜首的「Ox Alpha」,就是 GLM-5.3-Flash 的預覽版本。消息公布後,智譜港股收盤大漲逾 12%,報 1,160 港元。
這次發布有兩層值得拆開看:一層是行銷手法——先讓模型匿名證明實力,再揭露身份;另一層是基礎設施——整個預覽期的推理服務跑在十萬顆中國自產晶片上。
Ox Alpha 之謎:先稱霸排行榜,再揭曉身份
預覽期間,Ox Alpha 在 OpenRouter 與 OpenCode 兩個平台合計處理了 62 兆 tokens。身份揭曉後的頭三天,光是 OpenRouter 就湧入超過 11 兆 tokens,被平台稱為「史上最大規模的發布」。截至 8 月 27 日(週四),它是 OpenRouter 上排名第一的程式碼模型,單週處理 10.3 兆 tokens,約占全平台週流量的 31%。
對開發者社群來說,這種「盲測先行」的模式並不陌生,但很少有大陸模型用匿名方式在全球平台上拿下這樣的佔比。真實負載資料比任何 benchmark 截圖都更有說服力。
十萬顆中國晶片上的推理服務
《南華早報》報導的重點在硬體:GLM-5.3-Flash 的高調預覽全程跑在一個由十萬顆中國自產晶片組成的叢集上。在北京推動降低對 Nvidia 先進晶片依賴、美國出口管制持續收緊的背景下,這被視為「中國本土硬體能否承載大規模全球推理負載」的一次實戰檢驗——而這次,服務撐住了 62 兆 tokens 的需求。
模型定位與開源條款
GLM-5.3-Flash 是 GLM-5 系列第一個原生多模態模型,支援文字與視覺輸入,應用場景包括影像描述、視覺問答與文件理解。Emergent 的報導指出,官方在發布當下未公布詳細的 benchmark 分數與參數規格,定位明確:給延遲與成本敏感、不需要峰值精度的使用場景,對標 Claude 3.5 Haiku、GPT-4o mini 與 Gemini 1.5 Flash 這一級的輕量模型。
授權採 MIT——允許無限制的商用、修改與再散布,比 Apache 2.0 或自訂研究授權更寬鬆,沒有廠商鎖定與授權金問題。權重可在 Hugging Face 與 GitHub 下載,API 則透過智譜自有平台與 Cloudflare 等第三方供應,也納入 GLM Coding Plan,並與主流 coding agent 相容。
對開發者的實際意義
三個觀察。第一,輕量開源模型的競爭軸線已經從「分數」轉向「每 token 成本 × 可自由部署」;MIT 授權讓 GLM-5.3-Flash 在後者給到最滿。第二,OpenRouter 的實際用量數據是比 benchmark 更可靠的採購參考——31% 週流量代表大量開發者已經用生產負載投票。第三,供應鏈多元化不再只是政策口號:一個能承載全球流量的非 Nvidia 推理叢集已經實際運轉過。
參考來源
- Zhipu AI shares jump as viral ‘Ox Alpha’ model revealed as GLM-5.3-Flash running on Chinese chips
- Zhipu AI Launches GLM-5.3-Flash: Fast Multimodal Model
- GLM-5.3-Flash — Z.ai Blog
本文由 AI 協助自上述來源整理,經人工審核後發布。
