Open Source

Ultralytics 推出 YOLO26:去 NMS、更快的邊緣視覺模型

2026 年 1 月 14 日,Ultralytics 發布 YOLO26:原生 NMS-free 端到端偵測、移除 DFL、Nano 版 CPU 推理提速最多 43%,五種尺寸對應邊緣到伺服器,採 AGPL-3.0 與企業雙授權。

Ultralytics 推出 YOLO26:去 NMS、更快的邊緣視覺模型 — 文章封面
本頁內容6 個段落
  1. 砍掉 NMS:一次端到端的賭注
  2. 數字攤開:從 2.4M 到 55.7M 參數
  3. 為邊緣裝置而生的部署清單
  4. 訓練配方的三個改動
  5. 授權與生態現實
  6. 參考來源

2026 年 1 月 14 日,Ultralytics 正式發布 YOLO26,透過 Ultralytics Platform 與 Python 套件對外供應。這次改版的重點不是堆參數,而是拆掉部署面的摩擦:原生 NMS-free 的端到端推論、移除 DFL 的更輕偵測頭,以及 Nano 版在標準 CPU 上最高快 43% 的 ONNX 推理。

在大型實驗室競相發表更大模型的同一週,YOLO26 走反向路線:給無人機、智慧攝影機與嵌入式裝置一個更容易落地的即時視覺模型。官方新聞稿形容它是「邊緣優先(edge-first)」的新標準,創辦人兼執行長 Glenn Jocher 強調,最大挑戰是「讓使用者充分發揮 YOLO26 的同時,仍維持頂級效能」。

砍掉 NMS:一次端到端的賭注

Non-Maximum Suppression(NMS)是物件偵測的標準後處理,也是模型匯出與部署時最容易出狀況的一段。YOLO26 加入一對一(one-to-one)偵測頭,可以關閉 NMS 直接跑端到端預測,每張影像最多輸出 300 個偵測框;原本的一對多頭仍然保留,兩個頭在訓練時都會更新。代價寫在文件裡:端到端頭的分數比非端到端版本低約 1 到 2.3 AP。這是一筆把工程便利換一點準確率的明確交易,負責部署的人可以自己決定要不要接受。

數字攤開:從 2.4M 到 55.7M 參數

官方文件引述的論文數據:YOLO26 在 COCO 偵測跨五個尺寸拿到 40.9 至 57.5 mAP,T4 TensorRT 延遲 1.7 至 11.8 ms;最小的 yolo26n 只有 2.4M 參數,最大的 yolo26x 為 55.7M。與 YOLO11 相比,偵測最多提升 2.5 box AP,實例分割最多 3.7 mask AP,姿態估計 7.2 AP,旋轉框在 DOTA-v1.0 上 3.4 mAP。開放詞彙版本的 YOLOE-26x 用文字提示在 LVIS 上拿到 40.6 AP。

為邊緣裝置而生的部署清單

任務面涵蓋偵測、實例與語義分割、深度估計、分類、姿態與旋轉框,全部支援訓練、驗證、推論與匯出。匯出格式包括 TensorRT、ONNX、CoreML、LiteRT 與 OpenVINO,匯出時會融合掉僅訓練用的輔助分支,進一步縮小模型體積。DFL 的移除讓偵測頭更簡單、匯出流程更乾淨,對要把模型塞進手機 App 或無人機的團隊是直接收益。要注意的是 P2(小物件)與 P6(大輸入)變體目前只釋出 YAML 架構,沒有官方權重,需要的人得自己訓。

訓練配方的三個改動

MuSGD 是混合 Muon 與 SGD 的最佳化器,把 LLM 訓練圈的技巧搬進視覺模型;ProgLoss(Progressive Loss)把監督訊號逐步移到推論時實際使用的那個頭;STAL(Small-Target-Aware Label Assignment)改善小目標的正樣本標籤覆蓋率,對遠距或小物體場景有實際幫助。資深機器學習工程師 Jing Qiu 的說法是「不趕進度」,只專注把速度與準確率的平衡磨好。

授權與生態現實

YOLO26 維持雙授權:AGPL-3.0,或購買 Ultralytics 企業授權(含正式支援、長期維護與可擴展的邊緣部署)。閉源商業產品得把這筆授權費先算進成本。整體來看,YOLO26 不跟旗艦多模態模型比氣勢,而是把「2.4M 參數、跑得動 CPU、一行指令匯出到任何裝置」做到更徹底。在這波 2026 開局的模型競賽裡,邊緣視覺這條安靜的進化線,同樣值得放進雷達。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵