NVIDIA

NVIDIA 開源 Nemotron 3 Super:120B 混合 MoE 模型瞄準 Agent 推論吞吐

NVIDIA 於 2026 年 3 月 11 日開源 Nemotron-3-Super-120B-A12B:混合 Mamba 與 Latent MoE 架構、1M token 上下文、每秒 478 token 輸出,連同訓練資料集與 RL 環境一併釋出,瞄準 Agent 工作負載的推論成本。

NVIDIA 開源 Nemotron 3 Super:120B 混合 MoE 模型瞄準 Agent 推論吞吐 — 文章封面
本頁內容6 個段落
  1. GTC 前的開源棋
  2. 混合架構:Mamba 加 Latent MoE
  3. 效率數字與第三方評測
  4. 開放釋出包含什麼
  5. 對開發者與平台團隊的意義
  6. 參考來源

2026 年 3 月 11 日,NVIDIA 開源 Nemotron-3-Super-120B-A12B:1,200 億總參數、120 億活躍參數的混合 MoE 模型,配上 100 萬 token 上下文視窗。它不搶「最聰明模型」頭銜:第三方評測的智慧分數遠落後 Gemini 3.1 Pro 與 GPT-5.4,但每秒 478 個輸出 token 是 Artificial Analysis 量過的最快紀錄。NVIDIA 的算盤明確:Agent 時代的瓶頸不是單次回答的智商,而是長任務多輪呼叫疊加的推論成本。

這是 Nemotron 3 家族第二款模型,距 2025 年 12 月的 Nemotron 3 Nano(30B)僅 86 天,發表日落在 GTC 前一週。

GTC 前的開源棋

The New Stack 點出細節:原始路線圖是 100B/10B,最終放大到 120B/12B,恰好對上 OpenAI 的 gpt-oss-120B。開源模型市場在 2026 年已是正面交鋒(我們在開年觀察提過路線分歧),NVIDIA 選擇開得更徹底:不只權重,連資料集和訓練環境一起給。

混合架構:Mamba 加 Latent MoE

Nemotron 3 Super 的賣點在架構組合:

  • Latent MoE:一次啟動 4 個專家,只付 1 個專家的成本
  • Mamba-Transformer 混合層:官方稱記憶體與運算效率比純 Transformer 高 4 倍,利於長任務的上下文追蹤
  • Multi-Token Prediction:官方稱推論速度快 3 倍
  • 100 萬 token 上下文,可整包載入大型 codebase

這些設計指向同一個問題:Agent 的「上下文爆炸」。NVIDIA 估計 agent 每步產生的 token 可達一般對話的 15 倍,加上推理模型的「思考稅」,成本在多輪工具呼叫中複利放大。

效率數字與第三方評測

官方數字:相較上一代 Nemotron Super,吞吐最高 5 倍、準確度 2 倍;在 Blackwell 以 NVFP4 執行,比 Hopper 的 FP8 快 4 倍且不損精度;對 Qwen3.5-122B 有 7.5 倍推論吞吐優勢,並讓 NVIDIA AI-Q 在 DeepResearch Bench 兩代評測拿下第一。

第三方數字較冷靜:Artificial Analysis 給它智慧分數 36,略高於 gpt-oss-120B 的 33,但落後 Gemini 3.1 Pro 與 GPT-5.4 的 57,也輸給 Qwen3.5-122B、DeepSeek V3.2 與 GLM-5。不過速度是真的:478 tokens/s 是該機構量過最快的輸出,gpt-oss-120B 以 264 排第二。這是刻意用智慧換吞吐;當任務要跑幾百次工具呼叫,取捨恰恰合理。

開放釋出包含什麼

NVIDIA 這次「開」的範圍比多數對手大:

  • 模型權重,採 NVIDIA Nemotron Open Model License
  • 超過 10 兆 token 的前訓練與後訓練資料集(含前沿推理模型的合成資料)
  • 15 個 RL 訓練環境、評測配方與完整技術報告
  • NeMo 微調的完整路徑

取得管道涵蓋 build.nvidia.com、Hugging Face、OpenRouter(目前免費)、Perplexity、Google Vertex AI 與 Oracle Cloud(Bedrock、Azure 即將上線),並打包成 NIM microservice 供多雲與地端自架。

對開發者與平台團隊的意義

第一,「夠聰明、極快、可自架」的組合有實際場景:Perplexity、CodeRabbit、Factory、Palantir、Cadence 等已採用,集中在整包 codebase 載入、長文件分析與可靠工具呼叫。第二,釋出範圍含資料集與 RL 環境,微調者能重現訓練路徑而非只拿最終權重,對領域特化是實質差異。第三,更大的 Nemotron 3 Ultra(550B)還在後頭;若延續同樣的取捨哲學,開源與閉源前沿的差距會繼續用「效率」而非「分數」衡量。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵