某大型連鎖超市建置生鮮商品損耗預測模型,以減少報廢損失。資料庫中共有 120 萬筆銷售紀錄,但僅有約 8 萬筆資料標記為「正常銷售」或「損耗發生」,其餘資料均未標註。在標註資源有限的情況下,團隊希望提升模型預測表現。請問下列哪一種機器學習方式最適合此情境?
答案 (B)
核心概念
8 萬筆有標註、112 萬筆無標註,而且標註資源有限——這組條件正是半監督式學習的教科書情境。它的做法是用已標註資料先學出分類邊界,再借助大量未標註資料掌握整體的資料分布(例如透過偽標籤或一致性正則化),讓決策邊界落在資料密度較低的地方,藉此提升泛化能力。兩邊的資料都用上,不浪費。
答題技巧
快速判斷技巧:看到「一部分有標註、一部分沒有」+「標註成本高」,答案必定是半監督式學習。題目通常會直接給出兩邊的資料筆數,等於明示。
易錯陷阱:這個考點在 114-4 科目 1 第 13、40 題與 115-1 科目 1 第 31 題都出現過,是逢考必出的高頻題。務必記住:少量標註加大量未標註,永遠不是監督式,也不是非監督式。