Benchmarks

Interfaze 混合架構登場:自報基準碾壓 flash 級對手

JigsawStack 團隊推出混合架構模型 Interfaze,把專用神經網路併進 omni-transformer,主打 OCR、語音轉文字等確定性任務:OCRBench V2 70.7% 對 Gemini-3-Flash 55.8%。本文檢視九項自報基準與切換風險。

Interfaze 混合架構登場:自報基準碾壓 flash 級對手 — 文章封面

2026 年 5 月 11 日,Interfaze 團隊(隸屬 JigsawStack)公開了同名新模型架構,在 Hacker News 拿下 164 點。主張很直白:通用 LLM 處理 OCR、語音轉文字、網頁抽取這類確定性任務,等於用通用推理去做小型專用網路就能做好的事。Interfaze 把兩者縫合:專用 DNN/CNN 元件做任務特化,omni-transformer 做解碼與通用理解,再配上任務介面卡與內建的網頁索引、抓取和程式碼沙箱,主打 flash/mini 層的定價與速度。

混合架構:專用網路加全能轉換器

任務特化元件與 transformer 解碼器放進同一個模型,上述基礎設施都是原生能力而非外掛。規格:1M token 上下文、32k 最大輸出,輸入支援文字、圖片、音訊與檔案;推理模式預設關閉——確定性任務不需要多付推理成本。計價每百萬輸入 1.5 美元、輸出 3.5 美元,與 Gemini-3-Flash 同價位帶;API 相容 OpenAI Chat Completions,模型以 interfaze-beta 名義運行,TypeScript/Python SDK 與 LangChain 整合俱全。

九項自報基準

官方端出九項基準,對手是 Gemini-3-Flash、Claude-Sonnet-4.6、GPT-5.4-Mini、Grok-4.3。數字確實好看:OCRBench V2 拿 70.7%,Gemini-3-Flash 為 55.8%;olmOCR 85.7% 壓過 Grok-4.3 的 81.9%,也高於 Chandra OCR 2(84.3%)、Reducto(76.2%)與 Mistral OCR(72.0%);RefCOCO 82.1%,Claude 為 75.5%,Grok-4.3 崩到 25.0%。

語音方面,VoxPopuli 詞錯誤率 2.4%,僅次於 Scribe v2 的 1.7%。Spider 2.0-Lite 52.9% 對 Claude 49.6%;GPQA Diamond 89.9% 與 Claude 打平;MMMLU(十四語言)90.9%、MMMU-Pro 71.1%,都小勝對手。最後的 SOB 79.5% 對 78.4%——而 SOB 是 Interfaze 自家前一週發布的基準。醜話講在前:九項全是自報數據(基準庫在 GitHub),對照組刻意選在 flash/mini 層而非前沿模型。

部分啟動與 Precontext

兩個設計值得注意。部分啟動:在 system prompt 標記 ocr 這類任務後,只載入相關權重,以更低成本輸出確定性結果。Precontext:輸出結構化答案的同時,附上每一行、每一個詞的偵測框與信心分數——對核對 OCR 或在抽取管線做品質篩選,這份中繼資料比純文字答案有用得多。

速度同樣突出:每秒運算可轉寫 209 秒音訊,1 小時 35 分的播客約 50 秒完成——比 Deepgram Nova-3 快約 1.5 倍、比 Scribe v2 快約 8 倍、比 Gemini-3-Flash 快 11 倍以上。

該不該把工作負載切過去

如果你的產品每月在 flash 級模型上跑大量 OCR、轉寫或抽取,這個價位與速度值得用自己的資料跑一輪評測——先信自己的 eval,再信排行榜。風險清單:權重不開放、還在 beta、基準全數自報,SOB 又是自家出的題;HN 討論裡的質疑不少——健康警訊,不是否定。

放進 2026 年的脈絡,這是專用對通用路線分歧的又一個數據點(開年觀察談過):當通用模型邊際成本壓不下來,把確定性任務切給特化架構會越來越常見。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵