Claude

Claude Fable 5 簡評:不是更強的聊天模型,而是長任務的自主工作者

從 Stripe 一天完成全庫 migration、超過一週的自主研究,到 memory 與 subagents 策略:用官方發布與 prompting 指南重新檢視 Claude Fable 5 的定位、成本與安全邊界,並說明我會怎樣安排這個模型。

Claude Fable 5 簡評:不是更強的聊天模型,而是長任務的自主工作者 — 文章封面
本頁內容6 個段落
  1. 定位:什麼工作值得 Fable 5
  2. 官方證據:長任務能走多遠
  3. 成本與安全邊界
  4. 部署建議:時間參數與 subagents
  5. 我會怎樣安排
  6. 參考來源

我對 Claude Fable 5 的第一個判斷維持不變:它不是「更強一點的 Opus」,也不是應該全天開著的預設聊天模型,而是 Anthropic 為長時間、自主、非同步工作準備的高階執行層。這次改版用官方發布說明與 prompting 指南重新檢視這個判斷:什麼工作值得交給它、成本與安全邊界在哪裡,以及實際部署要調整什麼。

定位:什麼工作值得 Fable 5

官方對 Fable 5 的定位很明確:專攻以往「過於複雜、冗長或模糊」的問題,工作單位是 hours 到 weeks 的 end-to-end 任務,而不是單輪問答。指南同時提醒,只用簡單任務去測試它,會系統性低估它的能力——這對評測方法論是個直接警告。Anthropic 稱它的自主工作時間長於以往任何 Claude 模型,可以跨數百萬 tokens 維持專注,並用自己工作過程中寫下的筆記改進後續輸出。

effort 是能力、延遲與成本的主要控制桿:多數任務預設 high,capability-sensitive 的工作用 xhigh,routine 工作降到 medium 或 low。值得注意的官方說法是:低 effort 的 Fable 5 常常勝過前代模型的 xhigh。這代表分工邏輯不該是「Fable 只做最難的事」,而是「同一個模型用不同 effort 覆蓋不同層級的工作」。

effort 我的使用時機
xhigh capability-sensitive 的長鏈任務,例如全庫 migration 的規劃與執行
high 預設值;需要自主規劃與反覆驗證的專案
medium 有清楚框架、路徑大致確定的 routine 工作
low 高頻、輕量、成本敏感的批次處理

官方證據:長任務能走多遠

Stripe 的案例最直接:5,000 萬行的 Ruby codebase,Fable 5 在一天內完成全庫 migration,而官方估計人工需要一個團隊兩個月以上。Cognition 的 FrontierCode 評測則顯示 Fable 5 在 medium effort 就拿到 frontier models 中的最高分,同一份發布也描述它比過去的 Claude 更省 tokens。

在 coding 之外,genomics 案例展示了長度上限:Mythos 5 超過一週大致自主工作,處理橫跨 138 個物種、數百萬顆細胞的 single-cell 資料,而且使用的模型比 Science 期刊發表的模型小 100 倍卻更強。遊戲環境的證據則指向記憶:在 Slay the Spire 中,persistent file-based memory 讓表現進步為 Opus 4.8 的三倍,抵達 final act 的次數也多三倍。

一位匿名早期客戶(官方引述,身分未公開)的數據點同樣值得參考:在 frontier physics research 上以約三分之一的 reasoning tokens 達到最強表現,36 小時的成果接近 GPT-5.5 跑四天。這是單一樣本,但它與「低 effort 勝過前代 xhigh」互相印證。

成本與安全邊界

定價是每百萬 tokens 10 美元輸入、50 美元輸出,不到 Claude Mythos Preview 的一半。真正該算的是完成一件事的總成本:一天對兩個月、36 小時對四天,這種時間壓縮才是價值所在,也是判斷「貴不貴」的正確分母。

安全面有三層。第一,classifiers 涵蓋 cybersecurity、biology/chemistry 與 distillation,平均少於 5% 的 sessions 觸發;觸發時自動改由 Claude Opus 4.8 處理並告知使用者,而超過 95% 的 sessions 完全沒有 fallback,效能實質等同 Mythos 5。第二,官方明言 Fable 5 不用於 offensive cybersecurity 與 biology/life sciences,API 端要正確處理 stop_reason: "refusal"。第三,Mythos 5 是同一個底層、部分防護解除的版本,初期經與美國政府合作的專案管道部署——這是理解 Fable/Mythos 雙軌設計的關鍵背景。

紅隊與治理側:bug bounty 累計逾 1,000 小時沒有出現 universal jailbreak,英國 AI 安全研究機構的初期測試有部分進展;自動化 alignment 評估中 misaligned behavior 偏低、與 Opus 4.8 相當。資料治理上,Mythos-class 全流量有 30 天保留期(第一方與第三方皆然)、不用於訓練、幾乎都在 30 天後刪除——對處理客戶程式碼或敏感資料的團隊,這是上線前必須確認的架構限制。

部署建議:時間參數與 subagents

最容易忽略的是工程調整。Fable 5 預設 turns 更長:高 effort 的單一請求可能跑數分鐘,autonomous runs 以小時計。遷移時要調整 timeouts 與 streaming 設定,scheduled jobs 也要重新估算執行窗口。subagents 方面,parallel subagents 比以往更容易 dispatch,orchestrator 與 subagents 以非同步溝通,長駐 subagents 可以靠 cache reads 省時省成本——官方明確建議保留長駐 subagent,而不是每次重建。

另外,classifiers 涵蓋領域之外的 bug-finding recall 明顯高於 Opus 4.8,包括跨 codebase 與 repo history 的搜尋。這讓它在部署前 audit 有明確價值,但我不會因此移除人工 review:recall 高不等於 precision 夠。

我會怎樣安排

發文當時的取得方式:Fable 5 已全面開放(API 名稱 claude-fable-5),Mythos 5 限政府合作計畫的 partners 與即將加入的 biology 研究者;訂閱免費用到 6 月 22 日,6 月 23 日起需 usage credits。這個時間窗在本文更新時已過,但雙軌定位不變。

我的分工維持原判斷:routine 工作交給便宜模型或低 effort,深度但邊界清楚的工作用 medium 或 high,真正「人類要先讀半天 repo 才能動手」的問題才開 xhigh 全自主。交辦前先寫清楚 outcome、不可違反的限制、測試方式與 stop rule;subagents 只用在能真正拆成獨立工作流的任務。結論不變:Fable 5 的價值是把過去需要人類不斷接手的長任務,推進到可以整段交付。它是一位成本很高、但能獨立工作的 senior operator。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵