第一次 Agent 實驗,怎麼安全走完四個階段?

用五份複製檔案完成 read、plan、act、review 四階段實驗,先看計畫、限制動作,再檢查實際差異。

第一次 Agent 實驗不要登入外部帳號,也不要碰正式資料。準備一份可還原副本,讓 AI 依 read、plan、act、review 四階段工作:先讀、先提出計畫、只做限定變更,最後用前後差異驗收。

Agent 的價值在於能連續推進多個步驟,風險也來自同一點。第一次就給它信箱、雲端硬碟與寫入權限,你很難分辨問題出在任務、工具還是批准設計。

這次只用一個自編文字檔。原始內容保留不動,再複製一份 practice-copy.md 給 AI 修改。

Read:只讀材料並回述理解

先要求:

請只讀 practice-copy.md,不要修改。
回述文件目的、目前結構、三個可改善處,以及你仍不確定的地方。

確認它讀對檔案、沒有把猜測當事實。如果材料都理解錯了,不進下一步。

Plan:動作前先看計畫

提出修改計畫,列出要改的段落與原因。
限制:不新增外部資料、不改原始檔、不建立其他檔案。
等我確認後再執行。

OpenAI 對長任務強調使用者可查看進度、改變方向與批准重要動作;對主動、多步模型也建議先定義自主程度與批准界線。OpenAI:ChatGPT Work and Codex OpenAI:Model guidance

先把邊界說清楚:官方文件支持先限定自主程度、讓使用者監督並批准重要動作;read、plan、act、review 四階段是我設計的第一次受控實驗,不是 OpenAI 官方固定流程。

計畫不是禮貌性報告。你要刪掉超出範圍的步驟,再明確批准限定版本。

Act:只執行已確認的最小變更

可以批准:

只執行計畫中的第 1、2 項,修改 practice-copy.md。
不要使用網路、不要改其他檔案。遇到缺資料就停止並回報。

執行時看工具、檔案與動作是否仍在界線內。Agent 若要求額外權限,不要因為「做到一半」就直接同意;先確認新權限是否真的必要。

Review:看差異,不只看最後說明

最後要求它列出實際變更,然後由你比較原始檔與副本:

Agent 說「完成」只是狀態報告,不是驗收證據。

練習紀錄

受控 Agent 實驗卡

原始材料與副本:
Read 回述是否正確:
Plan 原始內容:
我刪除或限制的步驟:
實際批准的 Act:
Agent 使用的工具與檔案:
Review 發現的差異:
是否能還原:
下一次仍不授權的動作:

完成標準是四階段各有可觀察證據,而且原始檔仍完整。下一篇會把這次實驗中的控制拆得更細:權限決定能做什麼,批准決定這次能不能做,停止條件決定何時中斷,還原則處理做錯之後怎麼回去。

參考資料