多數專業人士的日常工作,就是同時追蹤信箱、會議、訊息和應用程式裡的對話與承諾。一旦脈絡斷掉,承諾就會漏接,專案和人際關係跟著受損。Fyxer 想解決的正是這個問題:打造一個能跨工具追蹤脈絡的 AI 行政助理,而且讓人願意信任它。
Fyxer 的系統結合了最新的 OpenAI 模型,以及超過 50 萬小時的行政助理工作流程資料,把工作拆給數十個專門模型,再透過真實使用者回饋持續改進。這套做法對產品開發者很有參考價值,因為它示範了如何把一個看似單純的任務,拆解成可訓練、可評估、可迭代的系統。
郵件不是一個任務,是一串預測
Fyxer 共同創辦人 Archie Hollingsworth 用 Moravec 悖論解釋這個挑戰:人類覺得容易的事,對電腦反而困難。同一封郵件,兩個人可能需要完全不同的回覆,取決於關係、過去發生過什麼,以及各自想達成什麼。
Fyxer 的解法不是叫一個大模型寫出好郵件,而是把流程拆成 30 到 50 個專門模型,每個模型只負責一小塊工作。當新郵件進來,一個「回覆決策模型」先分類:這封信需要回覆、需要排程,還是只需要讓使用者知道?如果需要回覆,其他模型接著分析郵件意圖、預測互動可能的結果,例如對話是否走向安排會議、解決請求,或延續一段長期關係。
記憶是整套系統的關鍵。Fyxer 必須決定哪些細節要跨對話保留,哪些在單次交流後就該消失。新郵件到達時,檢索模型會比對過去的互動,找出與這個人和這條對話最相關的記憶。OpenAI 模型負責從理解郵件內容、拉取並重新排序脈絡,到實際生成草稿的各個步驟。
從真人助理的判斷裡學
在推出 AI 產品之前,Fyxer 經營了好幾年真人行政助理服務,累積了超過 50 萬小時的標註工作流程資料。這些資料捕捉了優秀助理的細微判斷:什麼時候該快速回覆、什麼時候該等、哪段先前對話重要、同一個請求為什麼對不同人要有不同回應。
Fyxer 用監督式微調和 LoRA 在整個系統上建立任務專屬的模型變體,同時控制訓練成本。產品早期,團隊用 OpenAI 的微調平台處理需要高準確度的任務;後來則與 OpenAI 的 managed fine-tuning 團隊合作,把新的 checkpoint 推上生產。
任何模型部署前,Fyxer 都會在自家郵件任務的驗證集上評估,包括草稿、分類和優先排序。團隊同時權衡準確度、回應時間和成本,因為最佳選擇會因任務而異。
把使用者的編輯變成訓練訊號
模型上線後,Fyxer 靠真實使用者回饋繼續進步。當有人編輯草稿才送出,原始版本和最終版本的差異就顯示了使用者偏好哪種輸出。
Fyxer 用 Direct Preference Optimization (DPO) 把這些比較轉成訓練資料,不必手動標註每個例子,模型直接從成對輸出中學習:原始草稿和使用者編輯後的版本。每次草稿修改都會經過 A/B 測試,只有當新版本產生統計顯著的改善時才上線。以 Fyxer 的使用者量,有時一天內就能達到這個門檻。
目前 53% 的 AI 生成草稿被原樣接受,代表系統在真實對話中正確預測了意圖和語氣。2025 年,Fyxer 的年度經常性收入從 100 萬美元成長到 3,200 萬美元。但 Hollingsworth 認為更強的訊號是留存率:超過 90% 的使用者在第 90 天仍持續付費且每天使用。
對產品開發者的啟示
Fyxer 的做法呼應了我們先前討論過的流程編排取捨:先決定誰能做決定,再談工具。把郵件拆成小模型,本質上就是把決策權分散到可各自評估、各自微調的單元,而不是仰賴一個黑箱。
對正在打造高度脈絡化 AI 產品的團隊來說,Fyxer 提供了三條可參考的路徑:把複雜任務拆成小預測、用真實工作流程的資料訓練、把使用者編輯變成自動化的偏好學習迴圈。這不是什麼神奇架構,而是把產品開發的紀律套用在 AI 系統上。
Fyxer 的下一步是從草稿助理走向更主動的助理,管理更多溝通與協調工作。Hollingsworth 的願景是讓客戶不必打開電腦,就能信任 Fyxer 處理一切。這需要更豐富的關係、偏好和工作脈絡理解,也是信任能否延續的關鍵考驗。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
