從 Claude 公開工程資料,建立可靠 Agent 工作流
整理 Claude/Anthropic 公開的 Agent 工程資料:Harness、多 Agent、Skills、驗收與人類關卡,並說明它們如何組成可驗證工作流。
本文整理 Anthropic/Claude 公開的工程與產品文件,並加入 Gwarket 對可驗證 AI 工作流的分析;不是 Anthropic 官方文件或產品承諾。
Claude 的 Agent 討論最近常被濃縮成幾個名詞:multi-agent、Skills、Harness、evals。真正重要的不是記住名詞,而是看它們各自處理哪一種失敗。
這篇整理 Anthropic/Claude 公開工程材料,再把它們放回一條可驗證的工作路徑。它不是 Claude 的官方操作手冊,也不代表每個工作都要做成 agent。
先從一個任務,而不是一張架構圖開始
可靠的 Agent 工作流不是先分配角色,而是先說清楚:要改變什麼、可用哪些資料與工具、誰有權做外部動作、什麼最後狀態才算完成。
如果任務只需要一次判斷與一個可讀答案,通常先把單一 agent 的上下文、工具和驗收條件做好。只有主工作被資料淹沒、工作真的能平行,或產出與驗證必須分開時,才有拆出 subagent 的理由。
Claude 公開材料可以怎麼讀
| 主題 | 它回答的問題 | 不該誤解成 |
|---|---|---|
| Multi-agent | 哪些工作值得隔離、平行或獨立審查? | 角色越多越成熟 |
| Skills | 哪些做法值得變成可重用程序? | 每次需求都要做一個 agent |
| Harness | 模型在什麼資料、工具、權限與停止條件下工作? | 一段更長的 prompt |
| Evals | 如何證明結果真的成立,而不只是一段漂亮回覆? | 模型自行說完成就夠了 |
| Human control | 哪些後果應由人保留判斷與否決權? | 每個工具呼叫都人工點擊 |
這些不是互斥功能,而是一種工作設計語言:先讓任務最小可行,再把反覆出現的失敗放進正確層次處理。
一條最小但可靠的路徑
你可以先用五個問題檢查一項 AI 工作:
- 任務: 最後要讓哪個檔案、決策或外部狀態出現?
- 上下文: 哪些來源可讀,哪些不可讀?
- 能力: 缺的是當次 Prompt、可重用 Skill、工具連線,還是獨立 subagent?
- 邊界: 哪些動作可自動執行,哪些必須等人確認?
- 驗收: 用什麼可觀察結果證明完成?
若五題中有一題答不出來,問題通常不在模型不夠聰明,而在工作契約還不存在。這時增加更多 agent,只會增加交接與追蹤成本。
Claude 是來源,不是唯一適用範圍
Anthropic 的公開材料提供了很好的具體語彙,但本文的判斷可用於其他模型與工具:把背景、方法、工具、權限與驗收分開;讓高後果行動保留人類確認;把失敗與未知當成合法輸出。
真正的差異不在於使用哪個品牌,而是你能不能指出一個工作為何失敗、由誰承擔責任,以及如何驗證它已經完成。
從這裡往下讀
這個系列把上述問題拆為六篇獨立文章:何時需要多 Agent、如何驗收完成、Harness 的用途、Prompt/Skill/Tool/Subagent 的差別、人該留在哪些關卡,以及如何定義 Definition of Done。先選你現在真正卡住的問題讀,不必一次把整套架構搬進工作。
讀者保存卡
Claude 公開材料最值得學的,不是多加一個 Agent;而是把任務、上下文、能力、權限與驗收設計成可看見、可退回的工作路徑。