← 所有主題

vLLM

此主題的繁體中文文章,最新優先。

2 篇文章
繁體中文

2026

2 篇文章

  1. AWS

    在 SageMaker HyperPod 上部署 Qwen3.8-2.4T-A95B:單節點跑 2.4T 開源模型的實戰配置

    AWS 示範如何在單一 p6-b300 節點上用 NVFP4 量化與 vLLM 部署 2.4T 參數的 Qwen3.8,省下多節點成本。

    閱讀文章 ↗

  2. Voice AI

    Nari Labs 把 Qwen3-TTS 壓進 50 毫秒內開口

    Nari Labs 於 8 月 19 日公開 Qwen3-TTS 1.7B 優化成果:單張 H100 上達到每秒 10 次請求、p95 首音延遲低於 50 毫秒,並開源整套服務實作與基準測試。

    閱讀文章 ↗