跳到主要內容
1.2 資料基本概念與來源
114-4 科目 34

在零售業進行客戶行為分析時,資料倉儲中發現多個欄位儲存相同的購買金額資訊(例如:amount_usd、total_price、transaction_value),但其單位、命名慣例及格式不一致,進而導致特徵工程階段混淆模型輸入。針對此種跨欄位語義重疊與結構冗餘問題,下列哪一種資料處理策略最合適且具實務可行性?

請選擇一個答案

答案 C

核心概念

這是資料治理(Data Governance)與資料品質問題,不是模型問題。當同一個語義(購買金額)被拆散在多個命名不一、單位不一的欄位裡,正確做法是回到源頭建立統一標準:訂定命名規範、統一幣別與格式、把語義相同的欄位合併成單一可信欄位。這樣才能避免資訊重複造成特徵重要性被稀釋,也讓後續維護有依據。
答題技巧

快速判斷技巧:凡是題目描述「資料本身很亂」(命名不一、單位不一、重複),答案一律往「建立標準、清理、合併」靠,不會是「交給模型自己學」。

易錯陷阱:(B) 對熟悉 Gradient Boosting 威力的人特別有吸引力。要提醒自己:模型再強也無法知道 amount_usd 跟 total_price 是不是同一件事、幣別一不一樣,這是人要定義的語義,不是模型能猜的。