某企業導入大型語言模型(LLM)進行客服自動化,並已透過 Fine-Tuning 學習企業標準問答範例,但在實務運作中仍出現回應策略未符合服務優先順序及語氣與品牌風格不一致的情況,因此技術團隊建議再導入 Reinforcement Fine-tuning(RFT)機制進行優化,其主要目的為何?
答案 (B)
核心概念
一般的監督式微調是讓模型模仿「標準答案」,學的是「該怎麼寫」;但它難以表達「A 回答比 B 回答更好」這種相對偏好,也難以教會模型服務優先順序這類需要權衡的行為。強化式微調(Reinforcement Fine-tuning)改用獎勵訊號來訓練——對符合期望的回應給高分、不符合的給低分,模型據此調整生成策略,因此更適合對齊語氣風格與行為偏好。
答題技巧
快速判斷技巧:看到 Reinforcement(強化)就找「reward/獎勵訊號」的選項,這是強化學習家族的招牌詞,出現即選。
易錯陷阱:容易把「微調」都當成「教模型新知識」。要區分兩種微調的目標:監督式微調教模型「怎麼做」(模仿範例),強化式微調教模型「做得好不好」(對齊偏好)——本題的問題是後者。