事實、推論、建議與決策,該用哪種方法驗證?
先把 AI 輸出分成事實、推論、建議與決策,再分別查來源、檢查推理、比較選項與指定最後責任人。
AI 的一段回答常同時混合事實、推論、建議與決策。四種內容不能用同一種方法驗:事實查證據,推論查推理與反例,建議查條件與代價,決策則要指定有權承擔結果的人。
假設 AI 看完一份活動回饋後寫道:「六成參加者希望延長活動,因此下次應改成三小時,並取消原本的問答時間。」
這句話看起來是一個結論,其實混了四層:參加者回饋是事實;「時間不夠」是推論;延長活動是建議;取消問答則是待決定的行動。只確認「六成」正確,後面三層仍可能不成立。
我的建議是先替每句話分類,再決定用什麼證據。分類不是為了增加術語,而是避免拿一個真的數字替整段建議背書。
先把邊界說清楚:NIST 的資料支持依使用情境驗證、保留人類監督並明確分配責任;事實、推論、建議、決策這四類和下面的驗法,是我為新手整理的操作框架,不是 NIST 官方分類。
事實:問「哪裡可以直接確認?」
事實是可以回到資料、文件、紀錄或觀察直接核對的內容,例如日期、價格、回覆人數、原文引言與已發生事件。
驗法包括:
- 找原始來源,不只看 AI 附的摘要。
- 對照日期、版本、對象與單位。
- 數字用原始資料重算。
- 找不到證據時標記「未確認」,不要請 AI 自己替自己作證。
前面的例子中,你要先確認到底多少人回覆、問卷問題怎麼問,以及「希望延長」是不是原選項。如果 10 人中只有 5 人回覆,其中 3 人選擇延長,寫成「六成參加者」就誤把回覆者當成所有參加者。
NIST 的生成式 AI Profile 建議查閱並驗證生成式 AI 輸出的來源及引用。NIST:Generative Artificial Intelligence Profile 來源驗證只能處理這一層,不能直接證明後面的解讀與行動合理。
推論:問「從這些事實,真的只能得到這個解釋嗎?」
推論是根據已知資訊做出的解讀,例如「參加者想延長,代表內容太多」「點擊下降,可能是標題不吸引人」。它可能合理,但不是原始資料直接寫出的事實。
驗證推論時,至少做三件事:
- 把使用的事實列出來。
- 補出中間推理,不要讓結論直接跳過去。
- 找至少一個其他也能解釋同樣資料的可能性。
「希望延長活動」可能表示內容太多,也可能表示討論有價值、休息太短,或問卷選項設計讓人只能在延長和維持之間選。你可以接受「時間可能不足」作為待驗證假設,但不能把它寫成已確定原因。
一個實用句型是:
根據目前資料,我們可以確認__。
AI 推論__,中間假設是__。
另一個可能解釋是__。
還需要__才能分辨。
建議:問「在什麼條件下值得做,代價是什麼?」
建議不是判斷真假的問題,而是在特定目標與限制下選擇一個做法。例如「改成三小時」可能有幫助,但也增加場地成本、參加門檻與講者負擔。
驗證建議要補四個欄位:
- 它要改善哪一個目標?
- 它依賴哪些尚未確認的假設?
- 有哪些成本、副作用與被放棄的選項?
- 有沒有更小、可逆、可比較的試法?
比起直接延長一小時,可以先試「保留兩小時,把其中 20 分鐘改成小組討論」,並比較下次回饋。這不代表小實驗永遠最好,而是當證據有限時,先選能收集新資訊、又不會一次承擔全部代價的做法。
決策:問「誰有權決定,也由誰承擔結果?」
決策是把建議轉成實際承諾,例如確認日期、花費預算、取消問答、通知參加者。AI 可以整理選項、比較條件與指出缺口,但它不能因為文字流暢就自動取得決策權。
NIST 的 AI RMF Core 要求明確定義人與 AI 配置中的角色、責任與監督方式,也強調評估應反映實際使用情境與風險。NIST:AI RMF Core 對個人工作最簡單的翻譯是:越接近金錢、對外承諾、人事、法律、安全或不可逆動作,越要清楚寫出誰能批准。
決策前至少留下:
要決定的事情:
可選方案:
已確認事實:
仍有爭議的推論:
每個方案的主要代價:
有權決定的人:
決定後的檢查或還原方式:
「AI 建議這樣做」不能填在「有權決定的人」那一格。
同一句話可能要拆成四列
回到開頭的例子:
| 類型 | 原句內容 | 合適驗法 | 目前可採取的處理 |
|---|---|---|---|
| 事實 | 六成參加者希望延長 | 查回覆人數、題目與分母 | 先改成「回覆者中的六成」或重新計算 |
| 推論 | 因此活動時間不足 | 找其他解釋與補充問題 | 標記為待驗證假設 |
| 建議 | 下次改成三小時 | 比較目標、成本與小型替代方案 | 先設計低成本試法 |
| 決策 | 取消問答時間 | 指定有權安排議程的人 | 由負責人決定並記錄理由 |
這張表的價值不是讓內容顯得複雜,而是讓每一層只承擔證據允許的重量。
練習:把混合答案拆開驗
使用下面這段自編內容:
> 本月網站有 800 次瀏覽,上月有 1,000 次,因此讀者不喜歡新首頁。建議立刻改回舊版,並停止目前所有內容更新。
填寫:
四類驗證紀錄
事實:
證據與查核結果:
推論:
中間假設與其他可能解釋:
建議:
目標、成立條件、代價與較小試法:
決策:
有權決定的人與需要的批准:
最後處理:使用/修改/暫停/拒絕
原因:
這段話能確認的只有兩個月的瀏覽數,甚至還要先查統計期間、追蹤是否正常與流量來源。「讀者不喜歡」是推論;改回舊版是建議;停止更新是決策。把它們拆開後,你會發現答案不是只有接受或拒絕,而是可以保留事實、暫停推論、縮小建議,再交給有責任的人決定。
到這裡,你已經不只是檢查 AI 有沒有答對,也開始管理「誰可以根據這份輸出做什麼」。下一步要處理的正是這個邊界:在把公司或個人資料交給 AI 之前,先判斷資料、帳號、分享範圍與替代材料。