AI

把視覺模型塞進輪椅之後:RAMMP 專案揭露的邊緣部署取捨

Meta 的 DINO 與 SAM 被用於匹茲堡大學 RAMMP 輔助行動平台,重點不是模型多強,而是邊緣裝置上的精度與即時性取捨。

把視覺模型塞進輪椅之後:RAMMP 專案揭露的邊緣部署取捨 — 文章封面

對輪椅使用者來說,感知延遲不是效能指標,而是安全問題。Meta AI 部落格在 2026 年 7 月 27 日發布的文章指出,美國每年有超過 10 萬件輪椅相關傷害送進急診,常見原因是絆倒與跌落;全美估計有 550 萬名輪椅使用者。當輔助科技跟不上真實世界的複雜度,失去的不只是便利,還有信心與人身安全。

這正是匹茲堡大學 Human Engineering Research Laboratories(HERL)主導的 RAMMP 專案要處理的問題。該專案由 ARPA-H 支持,最高 4,150 萬美元資金,並與 ATDev 合作,把機器人、AI 與使用者中心設計放進同一個平台。

為什麼選 DINO 與 SAM,而不是自己標資料

RAMMP 採用 Meta 的開源視覺模型 DINO 與 Segment Anything Model(SAM)。根據 Meta AI 部落格的說明,DINO 是自監督視覺 transformer,能從未標註資料學到視覺表徵,適合標註資料稀缺的場景;SAM 則能在極少提示下辨識並描出影像或影片中的任何物件。

實際的管線是這樣組起來的:RAMMP 的感知系統建立在 RF-DETR 之上,用 DINOv2 embeddings 微調,訓練資料則由 SAM 自動標註。這樣團隊才能快速產生涵蓋各種角度、高度、背景與光照的高品質標註。換句話說,SAM 負責生出資料,DINOv2 提供表徵,RF-DETR 負責跑推論。

這種「用大模型產資料、用小模型上線」的分工,和把兩階段訓練拿掉的 SimpleDesign 對蛋白質設計流程的意義 是同一個思路:把昂貴的部分留在離線,把便宜且穩定的部分留在使用者身邊。

邊緣裝置上的真實取捨

把 DINOv3 與 SAM 放進電池供電的硬體,要面對電池續航、散熱、不穩定的網路連線,以及嚴格的體積與重量限制。Meta 的文章描述,工程團隊會針對邊緣裝置最佳化模型:縮小記憶體佔用、在合適時使用較低精度、採用符合實際條件的部署格式,並以實用解析度與有效率的分批處理維持速度。

代價是明確的:有時得犧牲一點邊界精度或特徵細節,換取使用者移動時需要的速度與穩定度。RAMMP 專案幕僚長 Sivashankar Sivakanthan 在文中直接點出,輔助機器人的表現不是看 benchmark 準確率,而是看系統能不能在日常生活的不可預測中穩定運作。

DINOv3 在這裡的角色像是一顆精簡的「視覺大腦」:通用基礎之上再疊加任務專屬的輕量模組,做物件偵測或移動追蹤,讓視覺資料能重複使用、節省電力。

已經進到原型,但難題還沒結束

Meta 的文章指出,RAMMP 團隊已把這套功能整合進第一個原型,用 DINO 相關工具查詢機器人的影像感測器,偵測自動門按鈕、杯子,以及路緣與地面以輔助導航。接下來的重點是語音與觸控輸入,讓使用者能選取並操作周遭的特定物件。

這裡多了一層工程挑戰:除了模型輸出的準確度與時間一致性,還要確保系統在不同使用者提示與輸入下都夠穩定、可預測。團隊未來會繼續整合 SAM 3.1 與 DINOv3,強化時間一致性、跨真實條件的穩健度,以及與決策控制系統的整合。

值得注意的是,這個專案並非只靠技術堆疊。HERL 在設計過程中納入輪椅使用者、臨床人員與倡議團體,合作夥伴還包括 Kinova Robotics、LUCI Mobility、ATDev,以及 Carnegie Mellon、Cornell、Northeastern、Purdue 等學術單位。

對產品開發者的實際啟示

如果你的產品要在裝置端跑視覺模型,RAMMP 的做法提供一個可借鏡的分工:用大型模型處理離線的資料標註與表徵學習,用微調過的輕量模型處理即時推論,並且把「精度換速度」當成設計參數,而不是失敗。

同時要記得,這類系統的驗收標準和使用者體驗綁在一起。當使用者必須一邊操作輪椅、一邊用語音描述環境,任何介面摩擦都會直接變成認知負擔。把自然語言與影像資料結合來查詢環境,目的就是減少這種負擔與情境切換。

目前公開的資訊來自 Meta AI 部落格對 RAMMP 的描述,專案的實際部署規模與長期成效,仍待後續的真實世界測試結果來說明。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵