跳到主要內容
1.3 機器學習基本原理
115-2 科目 24

某電商平台導入強化學習(Reinforcement Learning)技術優化商品推薦策略,AI 代理(AI Agent)會根據使用者的點擊與購買行為持續調整推薦內容。技術團隊在討論中發現,系統面臨一個核心挑戰:若 AI Agent 總是推薦過去表現良好的商品,可能會錯失發掘更高潛力商品的機會;但若頻繁嘗試未知商品,又可能影響短期的推薦成效與使用者體驗。請問上述情境敘述的是強化學習中哪一個核心問題?

請選擇一個答案

答案 A

核心概念

探索與利用的權衡是強化學習最經典的兩難。利用(Exploitation)是「選目前已知報酬最高的行動」,能確保短期表現,但可能永遠發現不了更好的選項;探索(Exploration)是「嘗試沒試過的行動」,有機會找到更優解,但代價是短期報酬下降。題幹描述的「總推薦熱門商品 vs 嘗試未知商品」,正是這個權衡的教科書範例。常見的處理方式有 ε-greedy、UCB、Thompson Sampling 等策略。
答題技巧

快速判斷技巧:看到「要不要嘗試新的 vs 守住已知好的」這種兩難描述,直接選探索與利用。這是強化學習的專屬名詞,其他三個選項都屬於監督式學習或深度學習的議題。

易錯陷阱:四個選項都是「某某權衡/某某問題」,句型一致容易混淆。破解方法是先確認題目的技術脈絡是強化學習,那麼答案就只能在強化學習自己的術語裡找。