跳到主要內容
1.2 資料整理與分析流程
115-1 科目 4反向題・即最不適當者

某保險公司建立 AI 理賠金額預測模型。歷史理賠資料經檢定後呈近似常態分佈,但仍存在少數極端高額案件。資料科學團隊在不破壞整體分佈特性的前提下,規劃進行離群值處理。下列何者最不適當?

請選擇一個答案

答案 C ※本題要選的是敘述有誤/不符合的那一個

核心概念

離群值處理的正規做法有三條路——用統計準則(Z-score、四分位距 IQR)偵測後判斷、用截尾或縮尾(Trimming/Winsorizing)處理極端值、以及請領域專家判斷這筆極端值是錯誤還是真實案例。這些方法的共通點是:資料仍然是連續數值,數值的大小關係被保留下來。
答題技巧

快速判斷技巧:先確認資料型態。題目是「理賠金額」=連續數值,那麼任何把它當類別處理的方法(One-hot、Label Encoding)都是錯的,一眼可挑出。

易錯陷阱:本題與 114-4 科目 1 第 45 題是同一組考點(常態分佈+離群值處理),可以對照著記。共通原則:數值資料就用數值方法處理,別套類別編碼。