某醫療院所建置病患再住院風險預測模型,特徵包含「年齡」、「體重」、「血壓數值」及「診斷類別代碼」等,資料科學家考慮是否需對數值特徵進行標準化(Standardization)處理。下列何種模型對特徵尺度最不敏感、最適合在不進行標準化的情況下直接使用上述特徵進行訓練?
答案 (D)
核心概念
模型對特徵尺度敏不敏感,取決於它有沒有用到「距離」或「梯度」的計算。決策樹的每一次分裂只問一個問題——「這個特徵的值有沒有大於某個門檻」,這是在單一特徵內部做比較,完全不涉及跨特徵的加總或距離,所以不論年齡是 0~100 還是體重是 0~200,對它毫無影響。
答題技巧
快速判斷技巧:把模型分成兩堆——需要標準化的(線性模型、SVM、KNN、神經網路、K-means,凡是算距離或用梯度的)與不需要的(決策樹家族)。問哪個不敏感,答案就在樹模型。
易錯陷阱:容易以為「所有模型都該做標準化比較保險」。實務上樹模型做標準化不會出錯但也沒好處,而考題問的是「最不敏感」,答案唯一。