不能使用真實資料時,怎麼去識別或建立合成材料?

刪除姓名不一定足夠。分辨直接識別資訊、組合線索與敏感內容,建立保留任務結構但不對應真人的練習材料。

不能使用真實資料時,不一定要停止練習。先確認你要測的是分類、摘要、格式還是流程,再用刪除、泛化、代碼化或從零合成的方式保留任務結構。只把姓名換成 A 先生,通常還不夠。

一份客服紀錄拿掉姓名後,可能仍包含公司名稱、職稱、罕見商品、精確日期與事件描述。熟悉情況的人把線索拼起來,還是能猜出當事人。

所以去識別不是搜尋姓名再取代。NIST 將去識別描述為降低個人或機構的揭露風險、同時保留資料用途的過程,也提醒只遮罩個資的工具未必足夠。NIST:SP 800-188

先把邊界說清楚:NIST 文件提供的是政府資料去識別的技術與治理指引;下面的刪除、泛化、代碼化、從零合成四種做法,是我針對低風險入門練習整理的選擇方式,不構成匿名化認證或法律意見。

先決定你究竟要測什麼

如果要測「AI 能否把客服訊息分成三類」,你需要的是不同語氣與問題類型,不需要真實姓名、訂單號碼或公司秘密。

先填一句:

這份材料只用來測試 AI 能否__。
為了這個目的,必須保留__。
不需要保留__。

用途越清楚,需要搬動的資訊就越少。最安全的資料,是一開始就不收集、不複製的資料。

四種做法處理不同風險

刪除:完全不需要的欄位直接拿掉

姓名、電話、電子郵件、身分證號、訂單號、精確地址等直接識別資料,如果和練習目的無關,就刪除,不要只用黑色方塊蓋住可還原的原文。

泛化:保留分析價值,降低精確度

把「2026 年 8 月 27 日 14:03」改成「2026 年 8 月」;把精確年齡改成年齡區間;把門牌地址改成縣市。前提是降低精度後仍能完成練習。

代碼化:需要區分紀錄,但不需要真實身分

把客戶改成 C001、C002,可以讓同一人的多筆紀錄保持一致。不過代碼化不等於匿名:如果另有對照表能找回身分,對照表仍是敏感資料,不能和材料放在一起。

合成:從零創造沒有對應真人的情境

若只要測流程,從零編寫材料通常更適合新手。例如建立六則虛構客服訊息,涵蓋退貨、發票與物流問題,所有人名、訂單與事件都不是從真實紀錄改寫。

合成資料也不是自動零風險。NIST 指出,合成資料的隱私與實用性存在 trade-off;若生成方法過度貼近原始紀錄,仍可能洩漏模式或個案。對入門練習最簡單的做法,是不要把真實敏感資料交給 AI 來「幫你匿名」,而是先從零設計情境。

小心能組合回推身分的線索

除了姓名等直接識別資料,還要找準識別線索:單獨看不出是誰,組合後卻可能唯一。

例如:

檢查時問:「熟悉這個組織的人,看完能不能縮小到少數幾個人?」如果可以,就繼續泛化、合併類別,或改用完全合成材料。

練習:建立六則合成客服訊息

不要使用真實案例。自行建立:

接著保存:

去識別/合成材料包

練習目的:
必須保留的結構:
已刪除的識別資料:
已泛化的欄位:
代碼與對照表是否分離:
合成內容如何避免影射真人:
重新辨識檢查:
仍不應使用的情境:
練習材料:

完成標準有兩個:這份材料確實能測你要的能力;另一位熟悉背景的人也不能合理回推出真人、客戶或秘密。

這仍不是法律上的匿名化認證。醫療、金融、人事、未成年人、法律案件或高敏感商業資料,不要只靠自己套用這張表後上傳。下一步是把安全材料與工作規則放進適合的位置,避免每次對話又重新散落。

參考資料