Anthropic

Anthropic 認了:Claude Code 變笨的三個原因與補救承諾

Anthropic 發布工程的事後解析,承認三個變更讓 Claude Code 一個月來變笨又健忘:調低推理努力、快取 bug 清掉思考紀錄、限制長度的系統提示詞。全部已修復並重設訂閱者用量上限,本文拆解時間軸與承諾。

Anthropic 認了:Claude Code 變笨的三個原因與補救承諾 — 文章封面
本頁內容6 個段落
  1. 三個出錯的變更
  2. 為什麼拖了一個月才定位
  3. 使用者看到的另一面
  4. 補救與承諾
  5. 給 AI 產品團隊的教訓
  6. 參考來源

2026 年 4 月 23 日,Anthropic 在工程部落格發布直白的事後解析:一個月來大量使用者回報「Claude 變笨了」,不是錯覺,而是三個變更疊加的結果。官方強調「從不故意讓模型變差」,API 不受影響,問題已在 4 月 20 日前修復(v2.1.116),並重設訂閱者用量上限。

三個出錯的變更

第一個是預設推理努力被調低(3 月 4 日至 4 月 7 日)。為解決 Opus 4.6 高努力模式的長延遲與「凍結」,預設從 high 降到 medium,內部評測是「智力略降、延遲大幅縮短」,但使用者明顯感到變笨。Anthropic 承認是「錯誤的權衡」,4 月 7 日回滾;Opus 4.7 現在預設 xhigh,其他模型 high。

第二個是清掉思考紀錄的快取 bug(3 月 26 日至 4 月 10 日)。原設計是:閒置逾一小時的 session 恢復時清一次舊 thinking blocks;實作卻每輪都清,連當輪推理都被丟掉。Claude 於是健忘、重複、工具選擇怪異,反覆 cache miss,同一份上下文被重複計費。4 月 10 日修復(v2.1.101)。

第三個是限制長度的系統提示詞(4 月 16 日至 20 日)。為抑制 Opus 4.7 的囉嗦,提示詞加入「工具呼叫之間不超過 25 字、最終回覆不超過 100 字」,幾週內部測試未見退化,更大範圍消融測試卻顯示評測各掉 3%,4 月 20 日回滾。

為什麼拖了一個月才定位

三個變更影響不同流量切片,疊加起來就像全面變差。更尷尬的是偵測失效:快取 bug 被內部實驗與不相關的顯示變更掩蓋,通過人工、自動審查、測試和 dogfooding,根因確認花逾一週。事後回溯發現 Opus 4.7 用 Code Review 能抓出這個 bug,Opus 4.6 不能。

使用者看到的另一面

使用者端,帳單先炸了。4 月 1 日 DevClass 報導,Anthropic 在 Reddit 承認「使用者碰到用量上限的速度遠超預期」;有 Pro 訂閱者 30 天只有 12 天能用,Max 5 使用者一小時燒完約八小時的額度,還有人逆向工程找到「兩個獨立 bug,讓成本膨脹 10 到 20 倍」。

4 月 24 日,開發者 Nicky Reinert 發文退訂:休息十小時後問兩個小問題,Haiku 就把用量推到 100%;快取 bug 讓他為同一份初始載入付兩次錢;支援機器人給通用回答,「真人」回覆是範本。他仍自稱產品粉絲。這是 2026 年訂閱制 AI 的張力:使用者只能退訂投票(開年觀察)。

補救與承諾

除了修復與重設上限,Anthropic 承諾:更多員工改用公開版 Claude Code;強化 Code Review 工具、開放客戶並支援多儲存庫;提示詞異動強制跑 per-model 評測與逐行消融,模型專屬調整用 CLAUDE.md 隔離;可能犧牲智力的變更先經 soak period。

給 AI 產品團隊的教訓

三個教訓通用。延遲與成本最佳化都是品質風險:動到推理深度或快取行為等於動到核心體驗。系統提示詞就是程式碼:一行「限制長度」可讓評測掉 3%,沒有評測閘門的變更不該上線。最後,誠實的事後解析是留客資產:Reinert 退訂文裡仍肯定 Anthropic 的透明;使用者能接受犯錯,難以接受沉默。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵