一間金融科技公司設計一款智慧投資系統,該系統會根據市場變化自動決定「買進」、「持有」或「賣出」的行動,並根據每次交易後的盈虧結果,逐步優化下一次的投資策略。整個過程中,系統不依賴事先標記的資料,而是根據歷次行動獲得的獎勵進行調整。請問此系統最可能採用哪一種學習方法?
答案 (A)
核心概念
強化式學習的組成要素很好認——代理人(Agent)在環境(Environment)中觀察狀態(State),選擇一個行動(Action),環境回饋獎勵(Reward),代理人再依據獎勵調整策略(Policy),目標是讓長期累積報酬最大化。題幹幾乎把這些要素逐一寫出來了。
答題技巧
快速判斷技巧:看到「獎勵/懲罰」「行動」「逐步優化策略」這三組字任一出現,直接選強化式學習,不用讀完整題。
易錯陷阱:(C) 容易被誤選,因為題幹說「不依賴標記資料」,很多人就直覺跳到非監督式。但沒有標籤不等於非監督——強化學習也沒有標籤,它靠的是獎勵訊號。「有沒有回饋分數」才是切開這兩者的關鍵。