Moonshot 發布 Kimi K3:總參數 2.8T 的 Mixture-of-Experts 模型,原生視覺能力、100 萬 token context,是全球第一個開源的 3T 級模型,定位長程 coding、知識工作與推理。值得先記下的誠實定位:官方明言整體表現仍落後最強的專有模型 Claude Fable 5 與 GPT 5.6 Sol,但在自家評測套件中達到 frontier 水準、穩定勝過其他受測模型。完整權重承諾於 2026 年 7 月 27 日前開放,架構與訓練細節將隨技術報告發布。
架構:Delta Attention、Attention Residuals 與 Stable LatentMoE
K3 的骨幹是兩個架構更新:Kimi Delta Attention(KDA)提供跨序列長度擴展 attention 的高效基礎;Attention Residuals(AttnRes)則讓表徵跨深度「選擇性檢索」而非均勻累加。稀疏度方面採 Stable LatentMoE——896 個專家中有效啟動 16 個,並用 Quantile Balancing(從 router 分數分位數直接推導專家分配,移除敏感的平衡超參數)與 Per-Head Muon(逐 attention head 獨立優化)解決此規模下路由與訓練穩定的一階難題。官方宣稱相較 K2 有約 2.5 倍的整體 scaling 效率提升。
工程細節也值得注意:SFT 階段起就做 quantization-aware training(MXFP4 權重、MXFP8 激活)以換取硬體相容性;大規模 expert-parallel 下用靜態形狀、免主機同步的全平衡訓練法避免專家不均衡拖慢吞吐;KDA 對傳統 prefix caching 不友善,團隊直接把對應實作貢獻給 vLLM 社群,隨模型一同發布。部署建議:supernode 組態 64 卡以上加速器。
Coding 案例:從 GPU kernel 到一顆晶片
官方用幾個案例展示長程能力。GPU kernel 優化測試中,各模型在相同沙盒獨立作業、上限 24 小時,跨 NVIDIA Hopper 與另一家供應商的 GPGPU 優化四個任務——K3 與 Fable 5(含 fallback,第三方評估)表現相當,明顯勝過 Opus 4.8、GPT 5.6 Sol 與 GPT 5.5。
更硬核的是 MiniTriton:K3 從零打造一個 Triton 式編譯器,含 tile 級 IR(建於 MLIR 之上)、優化 passes 與 PTX code generation;在支援的 roofline 基準上與 Triton、torch.compile 相當或更好,某些 workload 勝過 Triton,且能端到端跑通 nanoGPT 訓練、loss 曲線與參考線貼合。晶片設計則是 48 小時全自主 run:用開源 EDA 工具在 Nangate 45nm 上為自家架構的 nano model 設計晶片,4 mm² 內 100 MHz 收斂時序、模擬中支撐每秒 8,700+ tokens 解碼、1.46M 標準單元與 INT4 MAC 陣列。
科學運算側同樣有實例:重現計算天文物理的 I–Love–Q 關係時,K3 約兩小時完成資深研究者一至兩週的工作——交叉驗證 20+ 篇論文、實作完整數值管線、評測 300+ 組 state equations、指出已發表公式的矛盾、產出 3,000+ 行 Python 與互動式儀表板。
知識工作:互動研究報告與 Widgets
在 Kimi Work 場景,官方展示三個案例:42 年 ASIC 產業研究的互動網站(120+ 輪遞迴自我改進、2.8k+ 次網頁搜尋抓取、1.1k+ 次終端機資料拉取、涵蓋 87 份季報與 99 份原始 PDF);融合能產業顧問級報告(時間軸、甘甘圖、漏斗圖);以及用 20+ 併發 subagents 分析 391 個重力波事件。配套新功能 Widgets(聊天內生成互動元件、可接本地資料與外部插件)與 Dashboard(把重要 widgets 組成持久檢視)。影片編輯同樣被點名——K3 用 56 個素材剪出自己的預告片,含動作匹配剪接與逐格節拍同步,官方估計這密度的工作量約為資深剪輯師一至兩個工作日。
取得方式與定價
K3 現已上架 Kimi App(iOS/Android/HarmonyOS)、Kimi Work 桌面版(3.1.0+)、Kimi Code(終端機 /model 切換)與 Kimi API Platform(模型名 kimi-k3)。API 定價:cache-hit input $0.30/MTok、cache-miss input $3.00/MTok、output $15.00/MTok——底層是 Mooncake 分離式推理架構,官方稱 coding 工作負載 cache 命中率超過 90%,這是低輸入單價的基礎。企業版提供個人與組織帳號完全分離的資料隱私與成員管理。
採用前的現實檢查
三件事要想清楚。第一,官方自己也說整體仍落後 Fable 5 與 GPT 5.6 Sol——「開源最強」不等於「最強」,選型時按任務對照 benchmark(注意評測條件:max reasoning effort、溫度 1.0,且各家 harness 不同,Fable 5 在 SWE Marathon 評測中 35% 任務觸發 fallback)。第二,部署門檻真實存在:建議 64 卡以上 supernode,且 KDA 的 prefix cache 需要其 vLLM 貢獻版本才有效率。第三,預設 max thinking effort 意味著成本與延遲按最高檔走,low/high 模式是後續更新才會提供——初期導入的成本估計應以 max 為準。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
