AI 引用、數字與來源,怎麼逐項查核?
別只確認連結打得開。用查核表確認來源存在、定位原文、核對數字與上下文,再決定 AI 說法能不能保留。
AI 附上連結,不代表那個連結真的支持它的句子;算出一個百分比,也不代表分母、期間與單位都正確。查核時要分四層:來源是否存在、原文是否支持、數字能否重算、時間與適用範圍是否一致。
一段 AI 摘要寫著:「根據某份 2024 年報告,使用 AI 的團隊生產力提升 40%。」下面還附了一個真的能打開的 PDF。很多人看到這裡就放心了。
但你點進去後,可能只看到某項測試快了 40%,受測者只有特定職務,甚至數字根本是 AI 自己合併兩個表格算出來的。連結存在,只過了第一關。
NIST 的生成式 AI 風險管理資料明確建議查閱並驗證生成式 AI 輸出的來源與引用,也提醒不要從狹窄、非系統性的測試外推模型能力。NIST:Generative Artificial Intelligence Profile 對一般使用者來說,最實用的做法是把一句話拆開查。
先把邊界說清楚:NIST 支持的是驗證來源、記錄限制並依使用情境評估;下面「存在、支持、可重算、範圍一致」的四層順序,是我為一般讀者整理的查核方法,不是 NIST 官方個人檢查表。
第一層:這份來源真的存在,而且找得到原始版本嗎?
先確認基本身分:
- 標題、作者或發布機構是否一致?
- 網址是否指向原發布者,而不是轉貼、搜尋摘要或來路不明的下載?
- 發布日期與版本是否找得到?
- AI 寫的頁碼、章節或表格是否真的存在?
如果 AI 只給「某研究指出」,沒有作者、標題或連結,先要求它提供可定位的資料,但不要把它補出的引用直接當答案。接著用研究標題、作者或文件編號到官方網站、論文資料庫或原發布機構查找。
找不到原始來源時,查核結果不是「大概有」,而是「尚未找到」。對外文章、簡報與重要決策不應把它寫成已確認事實。
第二層:原文真的支持 AI 寫的那句話嗎?
打開來源後,不要只搜尋同一個數字。先把 AI 的句子拆成幾個主張:
> 使用 AI 的團隊/生產力提升/40%/適用一般工作
接著問:
- 研究對象真的是「團隊」,還是個人受測者?
- 測量的是整體「生產力」,還是完成某一類任務的時間?
- 40% 是平均值、最高值、相對差異,還是某個子群?
- 研究是否允許外推到你現在寫的情境?
來源可能真的有「40%」,卻不支持 AI 組合後的完整句子。這種錯誤比假連結更難發現,因為每個零件看起來都像真的。
最穩定的記錄方式是把原文證據放在旁邊:
| AI 的主張 | 原文位置 | 原文實際說明 | 支持程度 |
|---|---|---|---|
| 使用 AI 的團隊生產力提升 40% | 表 2 | 特定受測者完成指定寫作任務的時間減少 40% | 部分支持,不能外推成所有團隊生產力 |
不要只填「正確/錯誤」。寫出哪一部分被支持、哪一部分超出證據,後續才知道怎麼改。
第三層:數字能不能用原始資料重算?
數字至少要確認四件事:分子、分母、單位、期間。
例如「錯誤率下降 50%」可能只是從 2 件降到 1 件;「本季增加 20%」可能把人數和件數混在一起;「平均處理時間 10 分鐘」也可能排除了最慢的案例。
如果來源有原始數字,自己用最簡單的算式重算:
變化率 =(新值-舊值)÷ 舊值
假設舊值是 10、新值是 8,變化率是 -20%,也就是下降 20%,不是提升 20 個百分點。百分比和百分點是不同概念:從 40% 變成 50%,增加 10 個百分點,相對增幅則是 25%。
若 AI 使用四捨五入、排除資料或自行合併欄位,請它列出算式與使用的數值,再由你獨立重算。讓 AI 再說一次「我確認無誤」不算獨立驗證。
第四層:時間、對象與適用範圍一致嗎?
即使句子與數字都能在原文找到,還要看它是否適用現在的問題:
- 來源是舊產品版本,現在功能已改變。
- 研究對象是軟體工程師,文章卻寫成所有知識工作者。
- 測試在受控環境完成,文章卻直接推論正式工作成效。
- 結果只適用某個國家、方案或資料集。
- 一個相關性被寫成「A 導致 B」。
NIST 的 AI RMF Core 強調,測量與驗證要依使用情境與風險選擇,並記錄限制與不確定性。NIST:AI RMF Core 這不是要每位讀者導入完整治理框架,而是提醒我們:證據離實際使用情境越遠,結論就要寫得越保守。
查不到時,不要逼自己保留漂亮句子
查核結果只有四種合理處理:
- 保留:原始來源完整支持,數字可重算,範圍一致。
- 改寫:來源只支持較小、較有條件的主張。
- 標記待確認:目前缺原始資料或無法重算,暫不對外使用。
- 刪除:來源不存在、明顯不支持,或這句話對文章並非必要。
好的查核不是替每一句 AI 文字找到辯護,而是願意把證據不足的句子拿掉。
練習:查一段故意寫得太滿的摘要
使用下面這段自編內容,不需要上傳真實工作資料:
某份測試找了 20 名參與者完成一項摘要任務。
使用工具組平均花 12 分鐘,未使用工具組平均花 15 分鐘。
AI 摘要寫成:「研究證明 AI 讓所有知識工作者的整體生產力提升 25%。」
填寫查核表:
引用與數字查核表
待查主張:
來源是否存在:
來源實際研究的對象與任務:
原始數字:
我的重算:
AI 句子超出證據的地方:
處理:保留/改寫/待確認/刪除
證據允許的改寫:
這個例子中,完成時間從 15 分鐘降到 12 分鐘,是減少 20%。若每次完成的工作量完全相同,把產出速度換算成「每分鐘完成量」,數值會增加 25%;但那需要先定義生產力並確認工作量、品質與其他條件相同。無論採哪一種算法,都只能描述這 20 人在指定摘要任務中的結果,不能證明所有知識工作者的整體生產力。
完成這張表後,你已經能處理可追到來源的主張。下一個問題更難:有些輸出不是可直接查證的事實,而是推論、建議,甚至要求你做決定。它們不能全部用「有沒有來源」同一把尺來驗。