Skill、Plugin 與工作流,怎麼測試是否可靠?

先寫預期,再測正常、邊界、失敗、重跑與權限五類案例,保存實際結果與證據,做出試行、修正或停止決定。

可靠不是「成功跑過一次」,而是在代表性輸入、合理變體、缺資料、工具失敗與權限限制下,都能產生可接受結果,或用可預期方式停止。測試要先寫預期,再執行並保存證據。

一個 Skill 在作者手上很好用,換同事後卻不觸發;Plugin 能讀資料,權限不足時卻回一份空摘要;工作流重跑時建立重複資料。這些都不是檢查單篇輸出就能發現。

NIST AI RMF 建議使用文件化、可重複或可擴展的測試、評估、驗證方法,條件應接近實際使用,並持續追蹤。NIST:AI RMF Core

先把邊界說清楚:NIST 支持文件化、可重複且貼近使用情境的測試;正常、邊界、失敗、重跑、權限五類案例,是我為 Skill、Plugin 與工作流整理的入門測試組合,不是 NIST 官方五項清單。

五類案例缺一不可

  1. 正常案例:標準輸入是否完成核心任務?
  2. 邊界案例:空欄位、超長內容、不同格式或少見分類。
  3. 失敗案例:來源不存在、app 斷線或工具回錯。
  4. 重跑案例:同一輸入再次執行是否重複寫入或大幅漂移?
  5. 權限案例:唯讀或低權限使用者是否被正確限制?

成功行為和失敗行為都要有通過標準。例如缺少必要來源時,正確結果可能是停止並列出缺口,不是勉強產出摘要。

先寫預期,避免看結果後改標準

案例:缺少來源檔
預期:停止,不生成最終成果;指出缺少檔名
不允許:自行搜尋替代來源或寫入正式位置
證據:執行紀錄與輸出

再記錄實際結果、差異與是否通過。若失敗,分清是 instructions、Skill、連接權限、外部服務還是測試資料問題。

練習:建立可靠性測試表

被測對象與版本:
實際使用者與環境:

案例/輸入/預期/實際/證據/PASS-FAIL
正常:
邊界:
失敗:
重跑:
權限:

已知限制:
修正後要重跑哪些案例:
結論:可試行/需修正/停止使用

完成標準不是五格都 PASS,而是失敗也被看見、可重現、能決定怎麼處理。接下來要把這份測試結果交給清楚的責任人:誰管理資料、權限、版本、批准與事故,不能只寫「團隊共同負責」。

參考資料