💡 先搞懂問題
傳統軟體的行為寫在程式碼裡,有錯就去改那幾行。機器學習模型的行為卻是從資料學來的:資料裡缺了哪一群人,模型就不認識那群人;標註錯了,模型就學到錯的答案;資料來源有法律問題,整個模型都可能要下架。這些問題不會在訓練時跳出錯誤訊息,而是上線後才以客訴、歧視爭議或主管機關詢問的形式出現。
很多組織已經有資訊安全管理,對資料問的是「有沒有外洩、有沒有被竄改、需要時拿不拿得到」。這些都重要,但沒有回答另一個問題:這份資料適不適合拿來訓練 AI?它從哪裡來、有沒有權利用、是否具有代表性、被誰怎麼加工過?
ISO/IEC 42001 附錄 A 的 A.7「AI 資料」就是在補這一塊,共有五項控制,依序管資料管理流程、取得、品質、溯源(provenance)與準備;A.4.3「資料資源」則要求把 AI 系統用到的資料記錄在案。
生活比喻:中央廚房的食材管理
一家連鎖餐廳的中央廚房,每天要供應幾十家門市。進貨時要看供應商資格與產地證明,來路不明的肉再便宜也不收;驗收時檢查新鮮度、規格與溫度,不合格的退貨;洗、切、醃都照標準備料卡,新廚師照卡做,味道才會一致;每一批食材都有批號,客人吃壞肚子時,能追到是哪一車貨、哪天進的、送去哪些門市,精準下架那一批,不必整間店停業。
這套制度少了任何一環都會出事。沒有產地證明,出事時說不清責任;沒有驗收,壞掉的食材會混進每一道菜;沒有批號,只能把所有庫存全部丟掉。
比喻有兩個地方和實際不同。第一,食材壞了看得出來、聞得出來,資料的偏差卻看不見:一份完全沒被竄改、欄位也齊全的資料,仍可能只代表某一群人,所以品質檢查要主動去量代表性,而不只是看格式對不對。第二,食材煮完就吃掉了,資料卻會被「學進」模型裡,同一份資料還可能被好幾個模型重複使用;發現資料有問題時,不只要下架資料,還要找出所有用過它的模型,這正是溯源紀錄的價值。
🎮 互動實驗室一:資料健檢
一家約 150 人的虛構信貸公司,準備用歷年申請紀錄訓練「小額信貸初審模型」。下面是訓練資料的抽樣(10 筆,全為虛構)與資料卡摘要(10 項)。請點選一列或一項,再從下方選出它的主要問題;看起來正常的就選「沒有問題」。每次判斷都會說明對應的控制與可能後果。表格在手機上可以左右滑動。
| 列 | 申請編號 | 申請日 | 年齡 | 縣市 | 月收入(元) | 客服備註 | 資料來源 | 標註 |
|---|
🎮 互動實驗室二:資料履歷拼圖
同一個專案的模型 credit-screen 2.1 已經上線。第一部分,請把六張紀錄卡依照資料實際流動的順序放進 1~6 格:桌機可以直接拖曳;手機請先點一張卡,再點要放的格子;點已放進格子的卡片可以收回。第二部分,稽核員問「這個模型是用哪批資料訓練的?」,請判斷每份紀錄能不能單獨回答這個問題。
📘 原理補完
A.7 的五項控制與 A.4.3 怎麼分工
A.7 的五項控制可以照資料的生命週期讀。A.7.2 先訂出 AI 開發與強化(包括重新訓練與微調)所用資料的管理流程,處理隱私、資訊安全、代表性、保存與刪除這些共通議題;A.7.3 管資料怎麼取得與挑選;A.7.4 定資料品質要求並確認達標;A.7.5 記錄資料的來源與處理軌跡;A.7.6 規範清理、補值、標註等準備方法的選擇準則與實際作法。A.4.3 屬於資源那一組控制,要求把 AI 系統用到的資料資源記錄下來,常見形式是一份資料集一張資料卡(datasheet)。
| 控制 | 要回答的問題 | 稽核常抽的證據 | 和 ISO 27001 的差別 |
|---|---|---|---|
| A.4.3 | 這個 AI 系統用了哪些資料? | 資料卡、資源清單,含來源、用途、類別、已知偏差、保存規則 | 可從 5.9 資產清冊、5.12 資訊分類出發,再補 AI 特有欄位 |
| A.7.2 | 資料進入 AI 開發前要走什麼規矩? | 資料管理程序、資料使用申請與核准紀錄 | 27001 管資料的保護;這裡還管資料適不適合拿來訓練 |
| A.7.3 | 從哪來、憑什麼用、挑了哪些? | 來源清冊、授權條款或合約、個資的法律依據 | 27001 較少處理授權範圍與樣本代表性 |
| A.7.4 | 資料要好到什麼程度才能用? | 品質規格、自動檢查報告、分群統計與偏差分析 | 27001 的完整性問「有沒有被竄改」,這裡問「正不正確、有沒有代表性」 |
| A.7.5 | 被誰怎麼處理過、流到哪個模型? | 資料版本、雜湊值、資料血緣(data lineage)、模型登錄中的關聯 | 5.9 是靜態清單;溯源是動態軌跡 |
| A.7.6 | 用什麼方法加工、為什麼這樣加工? | 前處理程式與版本、標註規則、補值與離群值處理的理由 | 沒有直接對應的控制 |
標準要求與組織自行決定的部分
和其他附錄 A 控制一樣,組織要在適用性聲明中說明 A.7 各項是否納入及理由,納入後就要落實並拿得出證據。標準要求的是「有定義、有文件、有落實」:要有資料管理流程,要記錄取得細節,要有品質要求並確保資料符合,要有溯源流程,要有資料準備的準則與方法。至於品質門檻訂多少、缺值怎麼補、用什麼工具做版本控制、資料卡要有哪些欄位、溯源要細到哪一層,標準都沒有規定,由組織依用途、資料敏感度與風險決定。ISO/IEC 5259 系列(AI 資料品質)與 ISO/IEC TR 24027(AI 偏差)可以當參考,但不是驗證時的必要條件。
使用外部預訓練模型或大型語言模型時,組織通常無法掌握對方的訓練資料。這時能做的是向供應商索取資料來源與使用政策的說明,把這個不確定性寫進風險評鑑,並把控制的重點放在自己可掌握的資料上,例如微調資料、RAG 知識庫的文件、提示詞中帶入的客戶資料。
替一份訓練資料把關的步驟
- 取得前:確認來源、取得方式與使用權利,涉及個資時確認蒐集目的與利用範圍是否涵蓋 AI 開發,結果記在資料使用申請上。
- 建立資料卡:記錄來源、期間、筆數、欄位、個資類別、已知限制與保存期限。
- 品質檢查:依事先訂好的規格檢查缺值、重複、標註一致率、類別比例與各群體的分布,未達標就退回或記錄風險接受。
- 資料準備:用版本控制下的程式執行去重、去識別化、補值、標註等步驟,並寫下每個方法的選擇理由與可能引入的偏差。
- 切分與凍結:先去重再切分,避免同一筆同時出現在訓練與測試;切分後凍結資料集版本並計算雜湊值。
- 連結模型:在模型登錄中把模型版本、資料集版本與前處理版本綁在一起,讓任何一次決策都能往回追。
常見誤解
「沒用性別欄位,就不會有性別偏差。」郵遞區號、畢業學校、職業、購物紀錄都可能間接反映敏感屬性,這類欄位常被稱為代理變數(proxy)。刪掉敏感欄位不等於沒有偏差,還是要依受影響的群體拆開檢查結果;公平性的檢查方式可以參考附錄 C 的公平性目標與 TR 24027。
「資料沒被竄改,品質就沒問題。」資訊安全的完整性只保證資料沒被未經授權地修改。一份完整無損的資料,仍可能標註錯誤、樣本偏向某些地區,或已經過時。
「網路上公開的資料就能用。」公開只代表看得到,不代表可以用在商業產品或模型訓練;授權條款、著作權與個資規定都要個別確認並記錄。
「資料可用性就是系統不斷線。」附錄 C 列出的目標之一「訓練與測試資料的可用性與品質」,指的是能不能取得足夠、合適、具代表性的資料,而且測試資料要和訓練資料分開;它和資訊安全裡「系統需要時能用」的可用性不是同一件事。
稽核常見的不符合
稽核員最常問的一句話是「這個模型是用哪些資料訓練的?」,接著追來源、授權、品質檢查與處理步驟。常見的斷點包括:資料集只有檔名沒有版本,放在共用資料夾被多人覆寫;網路爬取或外購的資料說不清授權條件;品質要求只有一句「資料應正確完整」,沒有可檢查的門檻;標註外包卻沒抽驗;前處理散落在個人的筆記本程式裡無法重現;偏差檢查只做在模型輸出,從沒回頭看訓練資料的代表性;RAG 知識庫混入已作廢的舊文件。這些問題的根源通常是同一個:資料被當成工程師個人的工作材料,而不是需要管理的組織資源。
✅ 自我檢測
以下 6 題都是原創情境題,選完會立即顯示對錯與解析。目前得分:0 / 6