多數 agent 的痛點不是模型不夠聰明,而是每個工具呼叫都要判斷一次「這步對不對」。用前沿模型再問一次可以判斷,但每次多花幾秒、多花幾分錢,而一個 session 可能累積上百次呼叫。
Firecrawl 部落格在 2026 年 9 月 21 日的文章介紹了 TypeSafe AI 的 Jev,正是針對這種「高頻、答案是一個決定而非一段文字」的場景設計。
介面先於模型:state 進,typed decision 出
Jev 的呼叫形狀固定:送出一段 state(純文字或 JSON),加上一組問題。每個問題只能是三種原語之一——Choice(從你給的選項中挑一個)、Score(依 rubric 給分)、Noul(是非題,回傳 0 到 1 的機率)。回傳值沒有文字可解析,department.choice 必定是你提供的其中一個 key,is_urgent.noul 是可以直接設閾值的浮點數。
TypeSafe 稱它為 System One model,對照的是需要逐步推理的 LLM。對開發者的實際差別不在心理學比喻,而在於你必須在發送請求前就把答案的可能範圍寫死,政策判斷留在自己的程式碼裡。
「不會幻覺」比字面上窄很多
TypeSafe 的圖表把 Jev 標為 0% hallucination,但文章指出這個數字的來源是 schema 保證,不是實測:模型不可能回傳你清單以外的選項,卻完全可以回傳清單裡錯的那一個。Hacker News 上最多回覆的留言(jacobgold)與 The Register 都指向同一件事——type-safe 描述的是輸出格式的性質,不是準確度的承諾。TypeSafe 自己的 jaggedness 頁面也列出失效模式。
同樣需要打折看的是效能數字。官網的 193.6 倍快、444.6 倍便宜,來自 TypeSafe 自建的四個 workflow eval,參考答案是 GPT-6 Astra 與 Fable 5.1 的平均;官方 launch post 自己註明這些 workflow 由自家員工製作、參考值偏向 OpenAI 與 Anthropic,且屬於「偏高的一端」。
目前較獨立的數字來自 Every 的 eval 負責人 Mike Taylor:37 份文件、每份 21 題、共 777 個判斷,不到 0.7 秒完成,成本約四分之一美分。Every 的 Dan Shipper 接著用同樣四項寫作品質檢查跑十二段文字,Jev 中位數每段 0.35 秒、成本約低 580 倍,抓到七個植入缺陷中的六個;Fable 5.1 全數抓到。這個對照比任何倍數宣稱都誠實:快很多、便宜很多,但準確度略遜。
48 小時內長出來的東西,透露了真實用法
社群沒有等官方釋出。文章記錄了幾個早期專案:pi-warden 在每次 bash、write、edit 前,把任務、agent 的計畫與待執行指令送進 Jev,問四個問題(是否不可逆、是否偏離任務、是否會改動狀態、影響範圍多大),約 250 毫秒得到答案,由程式決定是否攔下。17,000 次呼叫中攔了 42 次,其中約 88% 是對的。另有 tool-call 安全掃描與 model router、讓 Claude 直接呼叫 Jev 的 typesafe-mcp、Ruby 整合、DSPy 分支,以及只重現介面、讀取 Qwen3.5-4B logits 的 openjev。
Vercel 在 9 月 16 日把 Jev 放上 AI Gateway,可從 AI SDK 7 的 evaluate 方法呼叫,不需 waitlist。
該放進請求路徑的判斷,和該留給 LLM 的判斷
文章整理出的適用範圍很收斂:延遲低到能塞進 request path 或遊戲迴圈、成本低到能逐筆判斷每個工具呼叫與每段文字、confidence 可以直接在程式裡設閾值、不需要 JSON 修補與重試。反過來,需要生成文字或程式碼、需要多跳推理與間接推論、算術與日期計算,以及「單一錯誤代價高但量少」的任務,仍應交給 LLM。
這裡的產品決策其實是:先盤點你系統裡有多少個「分類形狀」的判斷,再問這些判斷值不值得進請求路徑。如果答案只有一天幾十次,省下的時間與成本撐不起多一層依賴;如果是每個工具呼叫都要判斷一次,那正是 Jev 這類模型被設計出來的形狀。
值得注意的是,TypeSafe 共同創辦人 Diogo Almeida 在 HN 上回應,寫程式的難點在 state engineering,也就是把正確的依賴放進 context,並預告會有 coding 主題的釋出。這意味著現階段的價值不在取代 coding agent 的推理,而在它旁邊做語意檢查與路由——和我們在工具呼叫迴圈的四個停損點裡談的停損設計是同一類工程問題:把判斷放在對的層,而不是讓最貴的模型做每一件事。
實務上的下一步很簡單:挑一條你已經在跑的高頻判斷流程,先用 Jev 的 confidence 當第二軸試跑,觀察「答對」與「該不該行動」是不是兩件事。文章沒有提供長期穩定性的資料,這部分得靠自己的流量驗證。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
