🗺️ ISO 42001 地圖
ISO/IEC 42001:2023・附錄 A・AI 用的資料

AI 用的資料:品質、來源與準備

模型的行為幾乎由資料決定;這頁說明資料在進入 AI 之前要經過哪些關卡,以及怎麼留下能追溯的紀錄。

資料健檢:找出七類資料問題 資料履歷拼圖:模型用了哪批資料 A.7.2–A.7.6 與 A.4.3

💡 先搞懂問題

傳統軟體的行為寫在程式碼裡,有錯就去改那幾行。機器學習模型的行為卻是從資料學來的:資料裡缺了哪一群人,模型就不認識那群人;標註錯了,模型就學到錯的答案;資料來源有法律問題,整個模型都可能要下架。這些問題不會在訓練時跳出錯誤訊息,而是上線後才以客訴、歧視爭議或主管機關詢問的形式出現。

很多組織已經有資訊安全管理,對資料問的是「有沒有外洩、有沒有被竄改、需要時拿不拿得到」。這些都重要,但沒有回答另一個問題:這份資料適不適合拿來訓練 AI?它從哪裡來、有沒有權利用、是否具有代表性、被誰怎麼加工過?

ISO/IEC 42001 附錄 A 的 A.7「AI 資料」就是在補這一塊,共有五項控制,依序管資料管理流程、取得、品質、溯源(provenance)與準備;A.4.3「資料資源」則要求把 AI 系統用到的資料記錄在案。

A.7.2 資料管理流程:隱私、資安、代表性、保存 取得A.7.3 品質檢查A.7.4 準備A.7.6 切分訓練/驗證/測試 模型 2.1訓練產出 資料卡A.4.3 資料資源 A.7.5 溯源紀錄:每一步誰做、怎麼做、哪個版本 取得單號 → 清理腳本版本 → 資料集雜湊 → 模型版本 模型出問題時,沿著橘色紀錄往回追
上方是全程的規矩,中間是資料加工的路線,下方是貫穿每一步的履歷。

生活比喻:中央廚房的食材管理

一家連鎖餐廳的中央廚房,每天要供應幾十家門市。進貨時要看供應商資格與產地證明,來路不明的肉再便宜也不收;驗收時檢查新鮮度、規格與溫度,不合格的退貨;洗、切、醃都照標準備料卡,新廚師照卡做,味道才會一致;每一批食材都有批號,客人吃壞肚子時,能追到是哪一車貨、哪天進的、送去哪些門市,精準下架那一批,不必整間店停業。

這套制度少了任何一環都會出事。沒有產地證明,出事時說不清責任;沒有驗收,壞掉的食材會混進每一道菜;沒有批號,只能把所有庫存全部丟掉。

回到 AIMS:剛才的「進貨看供應商資格與產地證明」對應 A.7.3 資料取得,要記錄來源、取得方式與使用權利;「驗收檢查新鮮度與規格」對應 A.7.4 資料品質,要先訂出品質要求再確認資料達標;「標準備料卡」對應 A.7.6 資料準備,清理、補值、標註都要有選擇準則與紀錄;「批號追到哪一車貨」就是 A.7.5 資料溯源;整套廚房規矩則是 A.7.2 的資料管理流程,倉庫裡的食材清單相當於 A.4.3 資料資源的紀錄。

比喻有兩個地方和實際不同。第一,食材壞了看得出來、聞得出來,資料的偏差卻看不見:一份完全沒被竄改、欄位也齊全的資料,仍可能只代表某一群人,所以品質檢查要主動去量代表性,而不只是看格式對不對。第二,食材煮完就吃掉了,資料卻會被「學進」模型裡,同一份資料還可能被好幾個模型重複使用;發現資料有問題時,不只要下架資料,還要找出所有用過它的模型,這正是溯源紀錄的價值。

🎮 互動實驗室一:資料健檢

一家約 150 人的虛構信貸公司,準備用歷年申請紀錄訓練「小額信貸初審模型」。下面是訓練資料的抽樣(10 筆,全為虛構)與資料卡摘要(10 項)。請點選一列或一項,再從下方選出它的主要問題;看起來正常的就選「沒有問題」。每次判斷都會說明對應的控制與可能後果。表格在手機上可以左右滑動。

找到問題 0 / 14
已檢查 0 / 20
判斷錯誤 0
訓練資料抽樣 loan-train(示意)點一列即可選取
列申請編號申請日年齡縣市月收入(元)客服備註資料來源標註
資料卡摘要點一項即可選取
尚未選取。先點上方表格的一列或資料卡的一項。
畫面說明:表格是訓練資料的抽樣,資料卡是整份資料集的描述。有些問題看單筆就看得出來,有些只有看整份資料的統計才看得到。下方七個標籤會在你找到該類問題時亮起。

🎮 互動實驗室二:資料履歷拼圖

同一個專案的模型 credit-screen 2.1 已經上線。第一部分,請把六張紀錄卡依照資料實際流動的順序放進 1~6 格:桌機可以直接拖曳;手機請先點一張卡,再點要放的格子;點已放進格子的卡片可以收回。第二部分,稽核員問「這個模型是用哪批資料訓練的?」,請判斷每份紀錄能不能單獨回答這個問題。

第一部分:排出資料履歷
畫面說明:上方灰框是還沒排的紀錄卡,下方 1~6 格是資料從進門到成為模型的順序。全部放好後按「檢查順序」。
第二部分:哪些紀錄能回答「credit-screen 2.1 是用哪批資料訓練的」?
判斷正確 0 / 0
共 8 份紀錄
畫面說明:每張卡是稽核當天團隊拿得出來的一份紀錄。選「能單獨回答」代表只看這一份就能指出確切的資料集版本。

📘 原理補完

A.7 的五項控制與 A.4.3 怎麼分工

A.7 的五項控制可以照資料的生命週期讀。A.7.2 先訂出 AI 開發與強化(包括重新訓練與微調)所用資料的管理流程,處理隱私、資訊安全、代表性、保存與刪除這些共通議題;A.7.3 管資料怎麼取得與挑選;A.7.4 定資料品質要求並確認達標;A.7.5 記錄資料的來源與處理軌跡;A.7.6 規範清理、補值、標註等準備方法的選擇準則與實際作法。A.4.3 屬於資源那一組控制,要求把 AI 系統用到的資料資源記錄下來,常見形式是一份資料集一張資料卡(datasheet)。

控制要回答的問題稽核常抽的證據和 ISO 27001 的差別
A.4.3這個 AI 系統用了哪些資料?資料卡、資源清單,含來源、用途、類別、已知偏差、保存規則可從 5.9 資產清冊、5.12 資訊分類出發,再補 AI 特有欄位
A.7.2資料進入 AI 開發前要走什麼規矩?資料管理程序、資料使用申請與核准紀錄27001 管資料的保護;這裡還管資料適不適合拿來訓練
A.7.3從哪來、憑什麼用、挑了哪些?來源清冊、授權條款或合約、個資的法律依據27001 較少處理授權範圍與樣本代表性
A.7.4資料要好到什麼程度才能用?品質規格、自動檢查報告、分群統計與偏差分析27001 的完整性問「有沒有被竄改」,這裡問「正不正確、有沒有代表性」
A.7.5被誰怎麼處理過、流到哪個模型?資料版本、雜湊值、資料血緣(data lineage)、模型登錄中的關聯5.9 是靜態清單;溯源是動態軌跡
A.7.6用什麼方法加工、為什麼這樣加工?前處理程式與版本、標註規則、補值與離群值處理的理由沒有直接對應的控制

標準要求與組織自行決定的部分

和其他附錄 A 控制一樣,組織要在適用性聲明中說明 A.7 各項是否納入及理由,納入後就要落實並拿得出證據。標準要求的是「有定義、有文件、有落實」:要有資料管理流程,要記錄取得細節,要有品質要求並確保資料符合,要有溯源流程,要有資料準備的準則與方法。至於品質門檻訂多少、缺值怎麼補、用什麼工具做版本控制、資料卡要有哪些欄位、溯源要細到哪一層,標準都沒有規定,由組織依用途、資料敏感度與風險決定。ISO/IEC 5259 系列(AI 資料品質)與 ISO/IEC TR 24027(AI 偏差)可以當參考,但不是驗證時的必要條件。

使用外部預訓練模型或大型語言模型時,組織通常無法掌握對方的訓練資料。這時能做的是向供應商索取資料來源與使用政策的說明,把這個不確定性寫進風險評鑑,並把控制的重點放在自己可掌握的資料上,例如微調資料、RAG 知識庫的文件、提示詞中帶入的客戶資料。

替一份訓練資料把關的步驟

  1. 取得前:確認來源、取得方式與使用權利,涉及個資時確認蒐集目的與利用範圍是否涵蓋 AI 開發,結果記在資料使用申請上。
  2. 建立資料卡:記錄來源、期間、筆數、欄位、個資類別、已知限制與保存期限。
  3. 品質檢查:依事先訂好的規格檢查缺值、重複、標註一致率、類別比例與各群體的分布,未達標就退回或記錄風險接受。
  4. 資料準備:用版本控制下的程式執行去重、去識別化、補值、標註等步驟,並寫下每個方法的選擇理由與可能引入的偏差。
  5. 切分與凍結:先去重再切分,避免同一筆同時出現在訓練與測試;切分後凍結資料集版本並計算雜湊值。
  6. 連結模型:在模型登錄中把模型版本、資料集版本與前處理版本綁在一起,讓任何一次決策都能往回追。

常見誤解

「沒用性別欄位,就不會有性別偏差。」郵遞區號、畢業學校、職業、購物紀錄都可能間接反映敏感屬性,這類欄位常被稱為代理變數(proxy)。刪掉敏感欄位不等於沒有偏差,還是要依受影響的群體拆開檢查結果;公平性的檢查方式可以參考附錄 C 的公平性目標與 TR 24027。

「資料沒被竄改,品質就沒問題。」資訊安全的完整性只保證資料沒被未經授權地修改。一份完整無損的資料,仍可能標註錯誤、樣本偏向某些地區,或已經過時。

「網路上公開的資料就能用。」公開只代表看得到,不代表可以用在商業產品或模型訓練;授權條款、著作權與個資規定都要個別確認並記錄。

「資料可用性就是系統不斷線。」附錄 C 列出的目標之一「訓練與測試資料的可用性與品質」,指的是能不能取得足夠、合適、具代表性的資料,而且測試資料要和訓練資料分開;它和資訊安全裡「系統需要時能用」的可用性不是同一件事。

稽核常見的不符合

稽核員最常問的一句話是「這個模型是用哪些資料訓練的?」,接著追來源、授權、品質檢查與處理步驟。常見的斷點包括:資料集只有檔名沒有版本,放在共用資料夾被多人覆寫;網路爬取或外購的資料說不清授權條件;品質要求只有一句「資料應正確完整」,沒有可檢查的門檻;標註外包卻沒抽驗;前處理散落在個人的筆記本程式裡無法重現;偏差檢查只做在模型輸出,從沒回頭看訓練資料的代表性;RAG 知識庫混入已作廢的舊文件。這些問題的根源通常是同一個:資料被當成工程師個人的工作材料,而不是需要管理的組織資源。

✅ 自我檢測

以下 6 題都是原創情境題,選完會立即顯示對錯與解析。目前得分:0 / 6