AGENTIC COMMONSAI 產業簡報

繁中EN

主題AI 編程與開發工具出版 2026-10-07

返回文章列表AI Engineering

推理過程不必只講英文:Cohere 用三種資料混合把思考帶回使用者的語言

推理模型這幾年解決了「答案對不對」,卻留下一個常被忽略的問題:中間那段思考過程,使用者看不看得懂?Cohere 在 2026 年 10 月 6 日發表的研究指出,多數推理模型被用西班牙語、阿拉伯語或斯瓦希里語提問時,內部仍然用英文思考,最後才把答案翻回使用者的語言。這代表兩件事:提示詞裡的文化脈絡可能在內部轉換時流失,而非英文使用者完全無法檢查每一步推理。

「用使用者的語言推理」難在哪

Cohere 把這個目標稱為 in-language(L2)reasoning。過往嘗試遇到三個瓶頸:強迫模型用其他語言推理往往犧牲準確率;評測幾乎只看數學題——而數學恰好是語言最不重要的任務;涵蓋的語言通常只有少數幾種熱門語言。

他們也測了繞過訓練的取巧方法:要求 Qwen3.5-4B 用使用者語言思考幾乎沒效果;用預填推理開頭的方式硬逼,效果變好但準確率下降,而且一般使用者也做不了這種操作。結論是,可靠的 L2 推理必須靠訓練資料解決。

三根支柱的資料配方

Cohere 的做法核心在資料混合,由三部分組成:

  • 英文推理資料(ER):約 170 萬筆由 gpt-oss-120b 產生的逐步解題範例,是任務解決能力的骨幹。但只用這一項,模型即使用戶語言被明確指定,也只有 12.8% 的情況用使用者語言推理。
  • 多語言推理資料(MR):把英文推理範例翻譯成 44 種語言,每種語言只有約 5,000 筆。量極少,卻把 L2 推理率從 12.8% 拉到 86.1%,準確率還同時提升。
  • 多語言非推理資料(NR):只有問答、沒有推理軌跡的目標語言資料。這類資料最容易取得,而它幫助模型把能力遷移到從未見過推理範例的語言。

對 builder 來說,這是最值得記住的一點:模型「會不會推理」和「用哪種語言推理」是可以拆開的,所以不必逐語言重做推理資料。翻譯推理軌跡很貴,但少量就夠了。

成果與代價

在 Tiny Aya 基礎模型上套用這個配方,得到的 Tiny Aya L2-Thinker(3.35B 參數)在 60 種語言中,超過 93% 的推理軌跡使用使用者語言。與同底座、只推理英文的雙胞胎模型相比,六個基準中有五個準確率最多掉兩到三個點,開放式寫作甚至略為上升。平均思考 token 低於 5,000,靠的是多語言優化的 tokenizer。

弱點也很明確:在競賽級數學基準 PolyMath 上,準確率下降得比較明顯。Cohere 自己推測原因是模型沒有經過強化學習階段——那正是困難數學最需要、也最能抹平翻譯痕跡的階段。

對中文使用者的實際意義

低資源語言的表現是這份研究另一個亮點。按網路文字量分層,Tiny Aya L2-Thinker 在最高資源兩層的 L2 推理率是 99%,最低兩層仍有 94.3% 和 94.5%;相較之下,Mistral 的 Magistral 從 72% 崩到 5%,M-Thinker 則在每個軸上都退化。研究還觀察到一個通病:推理軌跡越長往往重複率越高——模型在繞圈子(doomlooping)而不是想得更深。Cohere 公開了模型權重和多語言推理資料,如果你的產品服務非英文市場、又需要使用者能檢查推理過程,這套「少量翻譯推理資料+大量非推理語料」的配方,可能比重新標註推理資料划算得多。這也延續了 Cohere 一貫的企業端路線,也就是先前談過的 North 2 agent 平台策略——不只在答案上競爭,而是把整條推理與治理鏈做成產品。限制仍要記住:競賽級數學的能力缺口,代表高難度推理任務短期內還是得用別的模型補位。

參考來源

AGENTIC COMMONS由 PHLEGON LABS 經營
分享X電郵
支持我們

相關閱讀

  1. 當判斷變成可程式化的輸出:Jev 把「問模型」拆成三種決策原語

    Jev 用 Choice、Score、Noul 三種原語回傳帶校準機率的決策,開發者得先想清楚哪些判斷值得放進請求路徑。

    AI

  2. 把電子郵件拆成三十個小模型:Fyxer 如何讓 AI 助理值得信賴

    Fyxer 用 30–50 個專門模型拆分郵件工作,並以使用者編輯回饋做 DPO 訓練,讓 AI 草稿接受率達 53%。

    AI

  3. Claude Opus 5 實測:接近 Fable 5 的智慧,價格減半,但真正的亮點是「判斷力」

    Anthropic 在 2026 年 7 月推出 Claude Opus 5,宣稱以一半價格接近 Claude Fable 5 的智慧。本文整理官方數據與早期客戶回饋,分析這款模型在編碼、知識工作與科學研究上的實際表現,並探討其「判斷力」與「自我驗證」能力對產品開發者的意義。

    AI