不能使用真實資料時,怎麼去識別或建立合成材料?
刪除姓名不一定足夠。分辨直接識別資訊、組合線索與敏感內容,建立保留任務結構但不對應真人的練習材料。
不能使用真實資料時,不一定要停止練習。先確認你要測的是分類、摘要、格式還是流程,再用刪除、泛化、代碼化或從零合成的方式保留任務結構。只把姓名換成 A 先生,通常還不夠。
一份客服紀錄拿掉姓名後,可能仍包含公司名稱、職稱、罕見商品、精確日期與事件描述。熟悉情況的人把線索拼起來,還是能猜出當事人。
所以去識別不是搜尋姓名再取代。NIST 將去識別描述為降低個人或機構的揭露風險、同時保留資料用途的過程,也提醒只遮罩個資的工具未必足夠。NIST:SP 800-188
先把邊界說清楚:NIST 文件提供的是政府資料去識別的技術與治理指引;下面的刪除、泛化、代碼化、從零合成四種做法,是我針對低風險入門練習整理的選擇方式,不構成匿名化認證或法律意見。
先決定你究竟要測什麼
如果要測「AI 能否把客服訊息分成三類」,你需要的是不同語氣與問題類型,不需要真實姓名、訂單號碼或公司秘密。
先填一句:
這份材料只用來測試 AI 能否__。
為了這個目的,必須保留__。
不需要保留__。
用途越清楚,需要搬動的資訊就越少。最安全的資料,是一開始就不收集、不複製的資料。
四種做法處理不同風險
刪除:完全不需要的欄位直接拿掉
姓名、電話、電子郵件、身分證號、訂單號、精確地址等直接識別資料,如果和練習目的無關,就刪除,不要只用黑色方塊蓋住可還原的原文。
泛化:保留分析價值,降低精確度
把「2026 年 8 月 27 日 14:03」改成「2026 年 8 月」;把精確年齡改成年齡區間;把門牌地址改成縣市。前提是降低精度後仍能完成練習。
代碼化:需要區分紀錄,但不需要真實身分
把客戶改成 C001、C002,可以讓同一人的多筆紀錄保持一致。不過代碼化不等於匿名:如果另有對照表能找回身分,對照表仍是敏感資料,不能和材料放在一起。
合成:從零創造沒有對應真人的情境
若只要測流程,從零編寫材料通常更適合新手。例如建立六則虛構客服訊息,涵蓋退貨、發票與物流問題,所有人名、訂單與事件都不是從真實紀錄改寫。
合成資料也不是自動零風險。NIST 指出,合成資料的隱私與實用性存在 trade-off;若生成方法過度貼近原始紀錄,仍可能洩漏模式或個案。對入門練習最簡單的做法,是不要把真實敏感資料交給 AI 來「幫你匿名」,而是先從零設計情境。
小心能組合回推身分的線索
除了姓名等直接識別資料,還要找準識別線索:單獨看不出是誰,組合後卻可能唯一。
例如:
- 唯一一位海外區域主管。
- 某天發生的罕見事故。
- 小團隊中的精確職稱、年資與年齡。
- 內部專案代號加客戶產業。
- 原文中的獨特句子,可用搜尋找到本人。
檢查時問:「熟悉這個組織的人,看完能不能縮小到少數幾個人?」如果可以,就繼續泛化、合併類別,或改用完全合成材料。
練習:建立六則合成客服訊息
不要使用真實案例。自行建立:
- 兩則需要一般回覆。
- 兩則只需記錄。
- 兩則應轉交主管。
- 使用虛構姓名、產品與訂單格式。
- 不影射真實客戶或近期事件。
接著保存:
去識別/合成材料包
練習目的:
必須保留的結構:
已刪除的識別資料:
已泛化的欄位:
代碼與對照表是否分離:
合成內容如何避免影射真人:
重新辨識檢查:
仍不應使用的情境:
練習材料:
完成標準有兩個:這份材料確實能測你要的能力;另一位熟悉背景的人也不能合理回推出真人、客戶或秘密。
這仍不是法律上的匿名化認證。醫療、金融、人事、未成年人、法律案件或高敏感商業資料,不要只靠自己套用這張表後上傳。下一步是把安全材料與工作規則放進適合的位置,避免每次對話又重新散落。