跳到主要內容
1.1 AI 治理概念
114-4 科目 25

在自然語言處理任務中,為了減少訓練語料中偏見對模型的影響,下列哪種資料處理策略屬於常見的「資料去偏(Data Debiasing)」做法?

請選擇一個答案

答案 C

核心概念

模型的偏見大多來自訓練資料本身的分布不均——某些群體的樣本特別多,模型自然就偏向他們。資料去偏(Data Debiasing)就是在「資料層」動手,透過重新平衡樣本比例、補齊代表性不足群體的資料、重新標註或過濾有偏內容,讓語料的分布更公平,從源頭降低偏見。
答題技巧

快速判斷技巧:題目問的是「資料」去偏,就找那個真的在動「資料」的選項。(A) 動輸出、(B) 動模型大小、(D) 動訓練技巧,只有 (C) 在調整語料本身。

易錯陷阱:(B) 反映了一個很普遍的迷思——「模型夠大就會自己變好」。要記住偏見來自資料,資料有偏,模型再大也只是把偏見學得更好。