免費全文 模型微調 入門

微調前的資料脫敏:不要把個資訓進權重裡

資料進了權重就拿不出來。脫敏必須在訓練前完成,這是不可逆的一步。

模型微調教程封面

RAG 的資料可以隨時刪除,微調不行——訓練資料一旦進入權重,就沒有「刪除某一筆」這種操作,只能重訓。所以脫敏必須在訓練之前做完。

要處理的欄位

  • 姓名、電話、地址、身分證字號、信箱。
  • 訂單編號、會員編號等可回連到個人的識別碼。
  • 自由文字欄位裡的個資——這是最常漏的一塊。

用佔位符取代,不要直接刪

import re

PATTERNS = [
    (re.compile(r'09\d{2}-?\d{3}-?\d{3}'), '<PHONE>'),
    (re.compile(r'[\w.+-]+@[\w-]+\.[\w.]+'), '<EMAIL>'),
    (re.compile(r'[A-Z][12]\d{8}'),          '<TWID>'),
]

def redact(text):
    for pat, tag in PATTERNS:
        text = pat.sub(tag, text)
    return text

<PHONE> 這類佔位符保留句子結構,模型才學得到「這裡會出現一個電話」的模式;直接刪掉會讓句子變得不通順。

正則抓不到的部分

姓名與地址很難用正則處理,實務上會搭配命名實體辨識模型再掃一輪,並對抽樣結果做人工檢查。目標不是百分之百,而是把殘留率壓到可接受並留下紀錄。

留下處理紀錄

記錄脫敏規則版本、處理時間、抽查結果。個資稽核時,這份紀錄比「我們有做」有用得多。

脫敏後的資料集也要當成敏感資料保管。佔位符能擋住直接讀取,但多筆資料交叉比對仍可能重新識別出個人。
下一步

這個主題還有更深入的實戰教程

VIP 專區收錄 50 篇進階內容:架構設計、生產環境取捨、成本與合規。 每週五新增 3 篇。

看訂閱方案 → 先逛逛 VIP 專區

延伸閱讀

更多模型微調 →