某零售業者建立顧客行為預測模型,資料集中包含「年消費金額」、「平均單筆交易金額」及「會員年資」等數值型特徵。資料分析顯示,部分金額特徵呈現高度偏態分布,少數樣本的數值顯著高於多數觀測值。為降低極端值對模型學習穩定性的影響,下列哪一種特徵工程方法最適合?
答案 (A)
核心概念
消費金額這類資料常呈現右偏(長尾)——大多數人金額集中在低區間,少數大戶的金額高出好幾個數量級。對數轉換的作用是把數值取對數,大數被壓縮得多、小數被壓縮得少,整體分布因此往常態靠攏,極端值的影響力大幅降低,同時又保留了數值之間的大小順序。這是處理右偏金額型資料最標準的手法。
本題詳解提到同卷第 4 題。
答題技巧
快速判斷技巧:把分布狀況與處理方法配對——右偏長尾 → 對數轉換;接近常態但有離群值 → Z-score 偵測(見本卷第 4 題);尺度差異大 → 標準化;類別型 → One-hot。題目說「高度偏態」,直接選對數轉換。
易錯陷阱:(B) 區間化也能緩解極端值,是本題最強的誘答。判準在於資訊保留程度——對數轉換保留了所有數值的相對關係,區間化則把區間內的差異全部抹平。題目說「最適合」,就選副作用最小的那個。