AI Agent 驗收:為什麼「完成」不等於任務完成

AI Agent 的回覆、產物、驗收結果與真實任務完成是不同層次。用四層完成定義,避免把流暢文字誤當成可靠交付。

本文整理 Anthropic/Claude 公開的工程與產品文件,並加入 Gwarket 對可驗證 AI 工作流的分析;不是 Anthropic 官方文件或產品承諾。

當 AI 回覆「已完成」,我們很容易把這句話當成結果。但它最多只是一段回覆,不是證明。

這個差別在聊天時不明顯;一旦 AI 可以讀檔、改資料、呼叫工具、建立文件,差別就會變得很重要。它可能寫了一段看起來合理的說明,卻沒有真的更新檔案;可能說報表完成了,實際上的數字卻不對;也可能宣稱已發送訊息,但外部系統根本沒有紀錄。

把「完成」拆成四層

  1. 回覆完成:AI 說它做了什麼。
  2. 產物完成:檔案、草稿或表格真的被建立。
  3. 結果完成:產物符合指定格式、資料與限制。
  4. 任務完成:外部世界出現原本想要的改變。

例如「整理客戶會議紀錄」:寫出摘要只是第一層;正確存到指定位置是第二層;包含待辦、決策與不確定事項是第三層;團隊真的能據此跟進,才接近第四層。

不要只驗文字,驗最後狀態

做 AI 工作流時,最有用的一個習慣是:先定義最後要看到什麼,再決定要不要相信 agent 的說法。

如果任務是改程式,驗的是測試、建置與實際行為;如果任務是整理研究,驗的是來源、引文與未知項;如果任務是提交表單,驗的是系統內是否真的出現紀錄。Anthropic 的 agent eval 指南也特別區分 transcript 與 outcome:前者是 agent 做過哪些步驟,後者才是環境最後留下什麼狀態。

一張完成定義卡

在交給 AI 前,先補上四欄:

欄位要回答的問題
產物最後會多出什麼檔案、資料或決策?
驗收用什麼可觀察條件判定正確?
例外哪些未知、失敗或衝突必須保留?
權限哪些外部動作必須等人確認?

這不是降低 AI 的自主性,而是把「做了很多」和「事情已經成立」分開。當完成條件可被看見,人才能把注意力從逐步監工,轉到真正重要的判斷。

用一個真實工作情境看差別

想像你請 AI 協助做一份競品研究。它回覆:「已完成分析,整理出五個競爭優勢。」如果你只看文字,這件事似乎結束了。

但你真正需要確認的是:五個優勢是否都能回到公開來源?引用的是現在仍有效的資訊,還是很久以前的新聞?它是否把「競品自己宣稱」寫成了客觀事實?有沒有把找不到資料的地方,用看似合理的推論補滿?最後,這份研究是否真的能支持你接下來要做的決策?

這些問題都不會因為 agent 說「完成」而自動成立。

因此,完成定義不應只放在流程結尾。最好在任務一開始就寫出來:輸入範圍是哪些來源;必須保留哪些未知;什麼形式才算交付;誰能決定是否進入下一步。這會反過來改善 agent 的工作品質,因為它不必猜測「好」到底是什麼。

讓驗收成本與風險匹配

不是每份工作都值得做嚴格驗收。請 AI 把一段會議錄音整理成個人筆記,可能只要快速抽查;要送給客戶的提案、要改正式資料、要對外發布的內容,則需要更高的證據標準。

可以把驗收分成三層:

風險適合的驗收
低:個人草稿、可隨時重做快速人工抽查
中:團隊可用文件、內部決策輸入來源與格式檢查,加上第二人或第二輪審查
高:公開、金錢、權限或正式資料系統狀態驗證、人工批准與可回復紀錄

這樣做不是把所有工作變成官僚流程,而是避免用同一種鬆散標準處理不同後果的任務。

失敗時要保留什麼

如果 agent 找不到資料、工具失敗或遇到衝突,最糟的做法是默默補一個看似完整的答案。好的工作流要把失敗也當作輸出:它要告訴你查過什麼、哪裡失敗、哪些結論因此不能成立,以及下一步需要誰決定。

一個能誠實保留未知的系統,往往比一個永遠自信回覆的系統更值得交付工作。

讓使用者看得見「還沒完成」

許多系統只設計成功畫面,卻沒有設計不確定或失敗時要怎麼呈現。結果是 agent 一遇到資料缺口,就傾向用語氣把缺口蓋掉。

好的交付物要把未完成視為一種合法狀態:例如「已取得 8/10 個必要來源」、「兩個關鍵主張無法驗證」、「草稿可供討論,但不得對外使用」。當未完成可以被清楚表達,使用者才不會把暫時產物誤當成可靠結論。

這也是人類與 agent 協作真正節省時間的方式:不是假裝每次都一次到位,而是讓下一個判斷點足夠清楚。

對話紀錄不是交付紀錄

聊天介面很容易讓人把整段對話當成工作本身。但對話只是過程的表面。真正可交接的工作應該有明確位置、版本、來源與狀態;下一位接手的人不必從幾十輪聊天中猜出最後採用了哪個結論。

因此,即使只是個人工作,也值得區分原始資料、候選稿、已確認版本與未解問題。這個小習慣會讓你在一週後重新打開任務時,仍能知道目前到底完成到哪裡。

讀者保存卡

不要問 AI 有沒有完成;問最後環境裡應該出現什麼,並驗證它是否真的出現。

來源