AI Agents

把測試證據放進開發流程:Cognition 用 GPT‑6 Astra 讓 Devin 自己驗證成果

Cognition 將 GPT‑6 Astra 整合進 Devin,讓代理在回報程式碼變更時附上測試錄影與涵蓋範圍報告,減少工程師手動審查。

把測試證據放進開發流程:Cognition 用 GPT‑6 Astra 讓 Devin 自己驗證成果 — 文章封面

程式碼審查的瓶頸不在寫,而在驗證

Cognition 的 Devin 已經被銀行到新創等不同規模的團隊用來處理軟體開發工作。但當代理產出的程式碼愈來愈多,工程師要花時間確認「這東西真的能跑、而且跑得對」的成本也跟著上升。Cognition 共同創辦人 Walden Yan 在 OpenAI 發布的案例中指出,GPT‑6 Astra 的關鍵改進在於「測試並證明其工作確實如預期運作的能力」。

這不只是生成程式碼,而是把驗證的證據一併帶回來。對產品開發者來說,這代表審查流程可以從「逐行看邏輯」轉向「看測試結果與行為紀錄」。

Astra 如何把測試結果變成可檢視的產出

Cognition 將 Astra 用在 Devin 本身、CLI 與桌面產品上。一個具體例子是 Devin 用 Astra 測試 iPhone 遊戲《Otter Run》,回傳的內容包含模擬器中的遊戲執行錄影,以及一份報告,標明哪些檢查通過、哪些區域尚未測試。

錄影讓工程師直接看到應用程式的實際行為,報告則界定測試的涵蓋範圍。兩者搭配,工程師可以快速判斷變更是否安全,以及還有哪些地方需要補強。這比只拿到「測試通過」的訊息更有用,因為它保留了可追溯的證據。

另一個應用場景是客戶回報 bug。當客戶傳來螢幕截圖,Cognition 團隊可以將截圖交給 Devin 搭配 Astra 處理,修復後回傳一張顯示結果的截圖。Yan 表示這讓團隊「更快回應客戶」。

從手動審查到證據驅動的決策

Cognition 的目標是降低人工檢視程式碼的比例。Yan 說:「我們預期隨著時間,需要手動查看的程式碼會愈來愈少,最終能交付更多東西。」這背後的核心轉變是:代理不只負責改程式,還要負責證明改得對。

這與我們之前討論過的 AI 軟體工廠的關鍵不是代理,而是五道閘門 有相似之處——重點在於建立可驗證的關卡,而不是盲目相信代理的輸出。當測試證據成為代理回報的一部分,工程師就能把注意力放在例外狀況,而不是重複確認基本功能。

對開發團隊的啟示

如果你正在評估或導入 AI coding 代理,可以思考一個問題:代理回報的內容是否足以讓你做出「合併」或「拒絕」的決定?Cognition 的做法暗示了一種方向:要求代理附上行為錄影、測試涵蓋報告,或修復前後的對照截圖。

這不代表測試可以完全取代人工審查。Astra 的報告仍可能遺漏某些測試情境,錄影也可能只展示快樂路徑。但把證據帶進流程,至少讓審查從「猜測程式碼意圖」變成「評估實際行為」。對小型團隊來說,這可能是提升代理可靠度最直接的一步。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵