Machine Learning

OIST 研究:讓 AI「自言自語」再配上工作記憶,學得更快也更會舉一反三

沖繩科學技術大學院大學(OIST)1 月 28 日發表研究:在主動推論框架上加入多槽工作記憶與「內在語言」機制,讓 AI 在稀疏資料下學會泛化與多工切換,表現明顯提升,為不依賴海量資料集的輕量學習路線提供新證據。

OIST 研究:讓 AI「自言自語」再配上工作記憶,學得更快也更會舉一反三 — 文章封面
本頁內容6 個段落
  1. 主動推論:不靠堆資料的學習框架
  2. 工作記憶加內在語言:架構怎麼運作
  3. 在稀疏資料下泛化與多工
  4. 下一步:更吵更亂的真實世界
  5. 對 AI 工程師的啟發
  6. 參考來源

2026 年 1 月 28 日,沖繩科學技術大學院大學(OIST)發表新研究:讓 AI「自言自語」,再加上仿人類的工作記憶,系統在多工與多步驟任務上的表現顯著提升,而且不需要海量訓練資料。論文〈Working Memory and Self-Directed Inner Speech Enhance Multitask Generalization in Active Inference〉已於 2025 年 12 月 22 日刊於 MIT Press 的《Neural Computation》。

在主流路線把每一次進步都歸功於更大模型與更大資料集的此刻,這項研究提供了另一種證據:架構層級的認知機制——工作記憶與內在語言——同樣能換來泛化能力,而且代價低得多。對資料取得困難、預算有限的團隊來說,這條路線值得認真看待。

主動推論:不靠堆資料的學習框架

研究出自 OIST 的認知神經機器人學研究室,第一作者是 Staff Scientist Jeffrey Queißer,共同作者為 Jun Tani。團隊採用「主動推論」(active inference)框架:系統不是由損失函數最小化驅動,而是持續預測自身的感官輸入、修正預測誤差,藉此更新對世界的內部模型。這套做法源自計算神經科學,天生就往「用較少資料學到結構」的方向傾斜。

Queißer 在 OIST 的報導中點出動機:快速切換任務、解決陌生問題,是人類每天都輕鬆做到的事,卻是當前 AI 的明顯短板;而人類靠的正是自我對話與工作記憶這類認知工具。他說:「這項研究突顯了自我互動在我們學習過程中的重要性。」

工作記憶加內在語言:架構怎麼運作

論文的核心是兩個互相配合的元件:

  • 多槽工作記憶:多個短期「容器」,讓系統在處理任務時暫存並反覆取用關鍵資訊,而不是看過即忘。
  • 自我導向的內在語言:研究人員稱之為「喃喃自語」(mumbling)目標——指示系統對自己「說話」固定次數,把中間推理過程外顯化,再餵回決策迴路。

實驗結果分兩層。在模式反轉(pattern-reversal)與模式重建(pattern-regeneration)等不同難度的任務上,多槽工作記憶本身就改善了泛化;加入自我喃喃目標後表現進一步提升,多工與長步驟任務的進步尤其明顯。

在稀疏資料下泛化與多工

Queißer 強調,這套系統「能用稀疏資料運作,而不是一般訓練這類模型做泛化時所需的大量資料集」。換句話說,它示範了一條輕量路線:不必把泛化能力完全抵押給資料規模。對照目前 agent 應用最痛的兩個問題——換個任務就失效、步驟一多就漂移——這份研究至少在受控環境中顯示,記憶結構與自我對話是可以實際動手的槓桿。

下一步:更吵更亂的真實世界

團隊的下一步是把環境變髒、變吵。Queißer 說,在真實世界裡「我們是在複雜、吵雜、動態的環境中做決策與解決問題」。長期目標有兩條:一是理解人類學習的神經基礎,二是把這種學習能力帶進家用與農用機器人——在那些場景裡,任務切換與面對陌生狀況的能力,比在基準測試上刷分重要得多。

對 AI 工程師的啟發

三個值得帶走的點。第一,工作記憶的「槽位」設計,與目前 agent 記憶體系裡的 slot、scratchpad 概念同構,論文提供了把它直接接進學習目標的具體做法。第二,「讓模型對自己說幾次話」本質上是一種結構化的中間推理;它與 chain-of-thought 的差別在於,這是被訓練目標約束的行為,而不是提示詞技巧。第三,當資料成本逐漸成為擴張瓶頸,認知架構方向的論文會越來越有工程參考價值——它不是取代規模化,而是補上規模化照不到的角落。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵