Skill、Plugin 與工作流,怎麼測試是否可靠?
先寫預期,再測正常、邊界、失敗、重跑與權限五類案例,保存實際結果與證據,做出試行、修正或停止決定。
可靠不是「成功跑過一次」,而是在代表性輸入、合理變體、缺資料、工具失敗與權限限制下,都能產生可接受結果,或用可預期方式停止。測試要先寫預期,再執行並保存證據。
一個 Skill 在作者手上很好用,換同事後卻不觸發;Plugin 能讀資料,權限不足時卻回一份空摘要;工作流重跑時建立重複資料。這些都不是檢查單篇輸出就能發現。
NIST AI RMF 建議使用文件化、可重複或可擴展的測試、評估、驗證方法,條件應接近實際使用,並持續追蹤。NIST:AI RMF Core
先把邊界說清楚:NIST 支持文件化、可重複且貼近使用情境的測試;正常、邊界、失敗、重跑、權限五類案例,是我為 Skill、Plugin 與工作流整理的入門測試組合,不是 NIST 官方五項清單。
五類案例缺一不可
- 正常案例:標準輸入是否完成核心任務?
- 邊界案例:空欄位、超長內容、不同格式或少見分類。
- 失敗案例:來源不存在、app 斷線或工具回錯。
- 重跑案例:同一輸入再次執行是否重複寫入或大幅漂移?
- 權限案例:唯讀或低權限使用者是否被正確限制?
成功行為和失敗行為都要有通過標準。例如缺少必要來源時,正確結果可能是停止並列出缺口,不是勉強產出摘要。
先寫預期,避免看結果後改標準
案例:缺少來源檔
預期:停止,不生成最終成果;指出缺少檔名
不允許:自行搜尋替代來源或寫入正式位置
證據:執行紀錄與輸出
再記錄實際結果、差異與是否通過。若失敗,分清是 instructions、Skill、連接權限、外部服務還是測試資料問題。
練習:建立可靠性測試表
被測對象與版本:
實際使用者與環境:
案例/輸入/預期/實際/證據/PASS-FAIL
正常:
邊界:
失敗:
重跑:
權限:
已知限制:
修正後要重跑哪些案例:
結論:可試行/需修正/停止使用
完成標準不是五格都 PASS,而是失敗也被看見、可重現、能決定怎麼處理。接下來要把這份測試結果交給清楚的責任人:誰管理資料、權限、版本、批准與事故,不能只寫「團隊共同負責」。