Cerebras 在 8 月 19 日發表新一代 CS-4 機架級系統與 WSE-3T「Turbo」晶圓。官方說法:單一機架可提供比 GPU 高 30 倍的推理速度,目標是把上一代的每瓦吞吐量再推十倍。The Register 與 The Next Platform 當天都做了拆解報導,第一批 CS-4 系統預計本季上線。
這家以「一片晶圓就是一顆晶片」聞名的公司,這次最有趣的決定是:不做新晶片。
不做新晶片,把同一片晶圓催得更兇
WSE-3T 的「T」是 Turbo,但它不是新矽。製程、46,225 平方毫米的晶圓面積、電晶體數、核心數與 44 GB 的晶上 SRAM,全部與兩年前的 WSE-3 相同。改變在供電:新的電力傳輸設計能把兩倍的功率灌進晶圓,把時脈拉高。The Register 估計時脈從 1.4 GHz 提到約 2.8 GHz。
結果是規格全面翻倍:每片晶圓 250 PFLOPS 的 AI 運算(稀疏值)、43.2 PB/s 的記憶體頻寬、2.4 Tbps 的片外連接頻寬(原為 1.2 Tbps),晶片間延遲則從 5 微秒壓到 2 微秒。
機架長什麼樣:背包、電源架與 2D 環面
CS-4 每套系統最多裝三片 WSE-3T,採「背包」形式:控制電路內建在模組上,從機架背面插入,正面是電源架。The Register 估計單機架功耗約 120 到 140 kW——驚人,但對照年底要出的 240 到 250 kW GPU 機架,反而保守。
互連是另一個亮點。CS-4 不用交換器,晶片以 2D 環面直接互連(網格兩端環繞相接),官方宣稱可支援到 50 兆參數的模型;想走交換式架構也行,支援 RoCE,只是延遲會高一點。低延遲讓它可以用最簡單的管線並行:權重沿晶片序列攤開,一顆接一顆算。
拆開推理流程:提示詞交給 Trainium 和 Instinct
這一代最大的架構轉變,是 Cerebras 不再想獨力跑完整條推理管線。吃算力的提示詞處理(prefill)交給 AWS Trainium 與 AMD Instinct GPU 分擔,Cerebras 晶圓專注在自己最擅長的解碼段——晶上 SRAM 讓權值與 KV 快取貼著運算單元擺。過去 GPU 叢集跑兆級模型要兩千顆加速器,現在幾十片晶圓就夠,取決於權重精度。
數字很漂亮,但要看懂前提
Artificial Analysis 實測:單一 CS-4 系統跑 gpt-oss-120b,每位使用者可達 4,400 tok/s,目前最快的 GPU 推理服務約 350 tok/s。The Register 同時提醒兩件事:250 PFLOPS 依賴稀疏性,換算成稠密 FP16 約 25 PFLOPS,仍強但沒帳面誇張;43.2 PB/s 的記憶體頻寬恐怕也是理論峰值——上一代 WSE-3 推理時就從未餵飽過自己的 SRAM。
對開發者與採購團隊的意義
三件事值得記住。第一,機架成為競爭單位:NVL72、Helios、CS-4 都以機架定義部署規模,採購談判從「幾張卡」變成「幾個機架」。第二,異構拆分成為常態——連 Cerebras 都承認 prefill 不必用自己的晶片,自建推理服務更沒理由綁死單一硬體。第三,第一批 CS-4 本季上線,正在為低延遲語音或代理式工作負載挑推理後端的團隊,多了一個值得實測的新選項。
參考來源
- Introducing Cerebras CS-4 — Cerebras
- Cerebras CS-4 rack systems juice chips for every last drop of AI performance — The Register
- Cerebras Overclocks WSE-3 Waferscale Engine to Boost Inference in “Nexus” CS-4 — The Next Platform
本文由 AI 協助自上述來源整理,經人工審核後發布。
