如果你最近用過 ChatGPT,可能注意到模型偶爾會冒出「哥布林」或「小妖精」這類字眼。這不是單純的幽默感,而是 OpenAI 在 2026 年 4 月 29 日公開調查的「哥布林之謎」:一個從 GPT-5.1 開始悄悄蔓延的語言習慣,最終指向獎勵機制如何意外塑造模型行為。
從 175% 的增長到「Nerdy」個性的線索
OpenAI 在官方部落格〈Where the goblins came from〉中說明,GPT-5.1 發布後,「goblin」在 ChatGPT 中的使用率上升了 175%,「gremlin」則上升 52%。起初這看起來只是無害的小怪癖,但到了 GPT-5.4,情況加劇,內部分析發現一個關鍵關聯:這些生物詞彙高度集中在選擇「Nerdy」個性的使用者回應中。
「Nerdy」個性只佔所有 ChatGPT 回應的 2.5%,卻貢獻了 66.7% 的「goblin」提及。OpenAI 檢查該個性的系統提示詞,發現它鼓勵「俏皮、書呆子氣、用語言削弱自以為是」的風格,而這正是生物比喻的溫床。
獎勵訊號的意外放大與回饋迴圈
OpenAI 使用 Codex 比較強化學習訓練期間的輸出,發現「Nerdy」個性的獎勵訊號明顯偏好含有「goblin」或「gremlin」的輸出——在 76.2% 的資料集中,這些詞彙能獲得較高獎勵。這解釋了為何該風格在「Nerdy」提示下被強化,但無法解釋為何在沒有該提示時也出現。
追蹤訓練過程後,OpenAI 發現當「Nerdy」條件下的提及率上升時,非「Nerdy」樣本也以相近比例上升,顯示行為透過遷移擴散。這形成一個回饋迴圈:獎勵俏皮風格 → 部分範例含特殊詞彙 → 詞彙在 rollouts 中更頻繁 → 這些 rollouts 被用於監督式微調 → 模型更習慣使用該詞彙。
OpenAI 也發現其他「tic words」,如浣熊、巨魔、食人魔和鴿子,而青蛙大多屬正常使用。這顯示問題並非單一詞彙,而是整個「生物類比」傾向被過度獎勵。
修正措施與對產品開發者的啟示
OpenAI 在 3 月推出 GPT-5.4 後退役了「Nerdy」個性,移除對生物詞彙的獎勵訊號,並過濾含這些詞的訓練資料。但 GPT-5.5 在根因發現前已開始訓練,因此在 Codex 測試時,員工立刻注意到哥布林傾向,OpenAI 加入了開發者提示指令來抑制。
這個案例對產品開發者有三點啟示:
- 獎勵設計需謹慎:即使看似無害的風格獎勵,也可能意外放大特定語言模式,並透過遷移擴散到其他情境。
- 監控「小怪癖」:當模型出現異常但非致命的行為時,值得追蹤其分佈與來源,而非僅當作趣事。
- 建立調查工具:OpenAI 因此開發了新工具來稽核模型行為,這對任何依賴 LLM 的團隊都是重要投資。
結語:理解怪癖背後的機制
OpenAI 強調,這個調查展示了「獎勵訊號如何以意想不到的方式塑造模型行為」,以及「模型如何將獎勵泛化到無關情境」。對產品開發者而言,這提醒我們:模型的每個行為都有其原因,而找到根因才能有效修正。下次當你的模型出現奇怪的語言習慣時,不妨想想——是不是某個獎勵訊號在背後推了一把?
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
