跳到主要內容
1.3 機器學習基本原理
115-1 科目 19

某物流公司導入強化式學習(Reinforcement Learning)優化車隊調度。模型在系統運行過程中,會依據不同配送狀態動態調整行動選擇方式,使決策結果逐步朝較佳績效收斂。上述模型在學習過程中的調整行為,最符合下列哪一項強化式學習核心機制?

請選擇一個答案

答案 A

核心概念

強化式學習中的「策略(Policy)」定義了代理人在某個狀態下該選哪個行動,通常表達成機率分布 π(a|s)。學習的本質就是持續調整這個策略函數,讓能帶來高報酬的行動被選中的機率變高、低報酬的行動機率變低,最後收斂到接近最佳的行為模式。題幹描述的「依狀態動態調整行動選擇方式、逐步朝較佳績效收斂」,正是策略優化的白話版。
答題技巧

快速判斷技巧:強化學習的專屬詞彙只有幾個——狀態、行動、獎勵、策略、價值函數。看到選項出現「策略」「行動機率」就對了;出現「標籤」「分群」「訓練資料分布」的,都是別的學習範式混進來的。

易錯陷阱:(D) 的「誤差修正」聽起來像所有機器學習都會做的事,容易被選。分辨關鍵在「正確決策標籤」——強化學習不知道什麼是正確答案,它只知道這次做完得幾分。