← 所有主題

Model Serving

此主題的繁體中文文章,最新優先。

8 篇文章
繁體中文

2026

7 篇文章

  1. AWS

    把模型快取放進節點:HyperPod 推論冷啟動的實務取捨

    Amazon SageMaker HyperPod 推出模型快取,把權重與容器映像預載到節點 NVMe,讓擴容從數十分鐘縮到數秒。

    閱讀文章 ↗

  2. AI Infrastructure

    Megakernel 不是炫技:把 decode 從「等 kernel」改成「等資料」的實作取捨

    Cohere 用單一 CUDA 檔把 North Mini Code 的 decode 做成 persistent megakernel,batch size 1 吞吐從 vLLM 的 185 tok/s 拉到 292 tok/s。

    閱讀文章 ↗

  3. AWS

    前綴感知路由:讓 KV cache 不再被隨機打散

    SageMaker Inference 新增前綴感知路由,把相同 prompt 開頭固定送到同一台機器,讓 prefix caching 真正累積成可重用的 KV cache。

    閱讀文章 ↗

  4. AI Infrastructure

    Cerebras CS-4 登場:三片 Turbo 晶圓的機架級推理系統

    Cerebras 於 8 月 19 日發表 CS-4 機架級系統與 WSE-3T 晶圓:不做新矽,把同一片晶圓灌兩倍功率,宣稱推理比 GPU 快 30 倍,並把提示詞處理交給 AWS 與 AMD 加速器分擔。

    閱讀文章 ↗

  5. Voice AI

    Nari Labs 把 Qwen3-TTS 壓進 50 毫秒內開口

    Nari Labs 於 8 月 19 日公開 Qwen3-TTS 1.7B 優化成果:單張 H100 上達到每秒 10 次請求、p95 首音延遲低於 50 毫秒,並開源整套服務實作與基準測試。

    閱讀文章 ↗

  6. AI Infrastructure

    AMD 收購 Taalas:把模型權重直接蝕刻進晶片

    2026 年 8 月 6 日 AMD 宣布收購多倫多新創 Taalas:以權重蝕刻加 SRAM 快取的專用推理晶片路線,HC1 已在 Llama 3.1 8B 跑出每秒近 1.7 萬 token。

    閱讀文章 ↗

  7. AWS

    Amazon 擬對外出售 Trainium 晶片,劍指 NVIDIA

    Bloomberg 報導,Amazon AI 主管 Peter DeSantis 證實 AWS 正與潛在買家洽談對外出售 Trainium 晶片;執行長 Andy Jassy 估算晶片事業獨立運作的年營收可達約 500 億美元,直接挑戰 NVIDIA 在資料中心 AI 晶片市場的主導地位。

    閱讀文章 ↗

2025

1 篇文章

  1. GPU

    AMD 發表 MI350 系列:4 倍算力、35 倍推論

    2025 年 6 月 12 日,AMD 在 Advancing AI 活動發表 Instinct MI350 系列:288GB HBM3E、原生 FP4/FP6,宣稱對 MI300X 算力最高 4 倍、推論最高 35 倍;MI350X 與 MI355X 已量產出貨,並預告 2026 年 Helios 機架與 MI400。

    閱讀文章 ↗