一家法律科技公司導入 RAG 系統協助律師查詢判例,但有時會引用關聯性不足的文件,影響生成內容的可信度。若在流程中引入強化學習(Reinforcement Learning),其主要作用為何?
答案 (A)
核心概念
強化學習的運作核心是「獎勵訊號驅動策略優化」。把它引入 RAG 流程,關鍵在於建立回饋迴路——讓實際使用系統的律師標記哪些檢索結果有用、哪些不相關,把這些回饋轉換成獎勵訊號,系統據以學習「什麼樣的文件對這類問題才算相關」,逐步優化判斷檢索品質的能力。重點在於強化學習提供的是「從人類回饋中學習」的機制。
答題技巧
快速判斷技巧:問強化學習的作用時,找含有「獎勵訊號」「回饋」的選項——這是強化學習的招牌機制,沒提到它的選項通常只描述了結果而非原理。
易錯陷阱:(A) 與 (B) 的取捨是本題重點,兩者的目標其實一致(讓檢索更準)。差別在 (A) 說明了「靠律師回饋當獎勵訊號」這個強化學習專屬的機制,(B) 只講結果不講手段。題目問「強化學習的作用」,就該選講出機制的那個。