某電商平台建置機器學習模型,用於預測用戶在瀏覽特定商品後的購買機率。模型上線初期表現穩定,但維運團隊在定期審查中發現兩種不同情形: 情形甲:模型上線半年後恰逢消費趨勢轉變,過去高購買意願的用戶行為模式(如長時間停留商品頁)不再是強烈的購買訊號,即便輸入特徵分布與訓練期相近,模型預測準確率仍明顯下降。 情形乙:平台新增了行動裝置端的入口,新用戶的年齡分布、裝置類型與使用時段特徵與原訓練資料差異顯著,導致模型對這批用戶的預測偏差增大。 下列哪一項最能正確對應兩種情形所屬的模型劣化類型?
答案 (B)
核心概念
兩種漂移的分野在於「變的是輸入,還是輸入與輸出之間的關係」。資料漂移(Data Drift)是輸入特徵的分布改變了——來了一批跟訓練時長得不一樣的資料。概念漂移(Concept Drift)則是輸入與目標之間的對應關係本身改變了——同樣的輸入,現在該對應到不同的答案。
答題技巧
快速判斷技巧:抓題幹的關鍵句。出現「特徵分布與訓練期相近,但關係變了」=概念漂移;出現「特徵分布與訓練資料差異顯著」=資料漂移。本題兩句都寫得很白,是送分的判斷點。
易錯陷阱:(D) 用「兩者都導致準確率下降」的共同結果來混淆。要記住:分類的依據是「成因」不是「後果」——很多不同的問題都會讓準確率下降,不能因此歸成同一類。