跳到主要內容
1.2 資料整理與分析流程
115-2 科目 13

某銀行建立機器學習模型預測客戶的貸款違約風險。資料集中有一個「職業類別」欄位,包含「工程師、教師、業務、自由業」等類別。工程師計劃將此欄位進行編碼處理後直接輸入線性模型。下列哪一種編碼方式最可能導致模型錯誤解讀類別之間的關係?

請選擇一個答案

答案 D

核心概念

Label Encoding 是把類別依序編成 0、1、2、3 這樣的整數。對決策樹這類只做「大於或小於某個切點」判斷的模型影響不大,但對線性模型是災難——線性模型會直接把這些數字當成有大小、有距離的連續值來運算,於是「業務(2)」變成「教師(1)」的兩倍、「自由業(3)減工程師(0)等於 3」,憑空製造出根本不存在的順序與間距關係。
答題技巧

快速判斷技巧:問「哪個編碼會讓模型誤解關係」時,答案幾乎都是 Label Encoding,而且題目一定會搭配「線性模型」或「距離型模型」。反過來問「該用哪個」時,答案通常是 One-Hot。

易錯陷阱:容易忘記模型類型會改變答案。同樣是 Label Encoding,用在決策樹上問題不大(樹只看切點),用在線性迴歸或 KNN 上就會出事。讀題時務必看清楚模型是什麼。