AI Agents

把客服自動化從「接電話」改成「完成業務」:Ringg 用模型路由省下九成成本

Ringg 將 GPT-4.1 即時工作負載遷移至 GPT-5.6 Luna,模型成本降約 90%,同時維持品質與延遲。

把客服自動化從「接電話」改成「完成業務」:Ringg 用模型路由省下九成成本 — 文章封面

客服自動化最常見的陷阱,是把「接起電話」當成終點。Ringg 的共同創辦人 Siddharth Tripathi 在 OpenAI 的案例中指出,真正的門檻是讓 agent 完成一連串業務動作:查保單、撈帳戶、約診、更新 CRM,必要時再把完整脈絡轉給真人。

Ringg 的平台每月處理超過 700 萬通連線電話,客戶平均 CSAT 達 4.8。但更值得產品團隊注意的是他們怎麼把成本壓下來:將適合的即時工作負載從 GPT-4.1 遷移到 GPT-5.6 Luna,模型成本減少約 90%,同時維持要求的品質與延遲。

用模型路由取代單一模型

Ringg 沒有把所有流量都丟給同一個模型。他們依照任務需求分流:GPT-4.1 處理大部分即時語音與聊天;GPT-5.6 Luna 留在正式環境,在效能、延遲或性價比更適合時接手;GPT-5.6 Terra 負責通話後分析,包括摘要與情緒分類;GPT-5.6 Sol 則支援評估、提示改進與 model-as-judge 工作流。

這種路由思維跟把模型分層寫進架構的邏輯一致:不是選一個「最強」模型,而是讓每個請求落到成本與能力最匹配的位置。

長對話的上下文管理

當互動接近約 80,000 tokens 時,Ringg 的系統會產生結構化摘要,讓對話在保留重要資訊的前提下繼續,而不是反覆傳送整段歷史。這對語音客服特別關鍵——通話時間一拉長,token 成本與延遲都會跟著膨脹。

用生產評估持續改善

Ringg 在上線前會用歷史對話與模擬客戶流程測試模型。他們的評估平台能找出弱點並建議提示改進,形成持續改善迴圈。一個具體案例是通話後分析:GPT-5.6 Terra 在摘要與情緒分類上擊敗 Gemini 2.5 Flash,並在常見區域語言上達到最高 97% 準確率。

通過離線測試的模型,會先導入一小部分正式流量,再逐步擴大。正式環境中,router 會監控各區域的延遲與端點健康,在端點不可用或超過延遲門檻時轉移流量。

從成本中心到業務結果

Ringg 的客戶數據顯示自動化的實際影響:Policybazaar 有 67% 的電話無需真人介入,平均回應時間從 8–12 分鐘降到 60 秒以內;Practo 達到 85% 首次通話解決率,營運成本比先前的人力流程下降 70%;Groww 用自助服務解決 72% 的 IPO、期貨與選擇權相關查詢。

Tripathi 提到,OpenAI 的專屬 Slack 支援與核心工程團隊的接觸,降低了模型遷移時的工程不確定性。對正在評估類似架構的團隊來說,這是一個值得納入考量的營運因素。

Ringg 也在用 OpenAI 的 computer-use 能力開發瀏覽器 agent,涵蓋平台 onboarding、KYC、IT 故障排除與理賠處理。他們同時在建構跨通道的 context layer,讓客戶從語音切到 WhatsApp 再到瀏覽器時,不必重複說明。

對產品團隊的啟示很直接:客服自動化的下一步不是接更多電話,而是把「完成業務結果」當成衡量指標。模型路由、上下文管理與生產評估,是撐起這個指標的三根柱子。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵