跳到主要內容
1.4 鑑別式 AI 與生成式 AI 的基本原理
115-1 科目 24反向題・即非 RLHF 活動者

某企業導入大型語言模型作為客服助理。模型已具備穩定語言能力,但在回覆偏好一致性與組織規範遵循方面仍需優化,團隊因此規劃導入人類反饋強化學習(RLHF)流程,下列何者最不屬於 RLHF 階段的典型技術活動?

請選擇一個答案

答案 D ※本題要選的是敘述有誤/不符合的那一個

核心概念

RLHF(Reinforcement Learning from Human Feedback)分三個標準步驟——第一步,讓人針對模型的多個候選輸出排序,蒐集偏好資料;第二步,用這批偏好資料訓練一個獎勵模型(Reward Model),讓它學會替輸出打分;第三步,用強化學習(如 PPO)依獎勵模型的評分去調整語言模型的生成策略。整個流程發生在模型已經具備語言能力「之後」,屬於對齊(Alignment)階段。
答題技巧

快速判斷技巧:圈「最不屬於」。接著檢查每個選項有沒有「人類回饋」的成分——RLHF 的 HF 就是 Human Feedback,沒有人類參與的那一個就是答案。

易錯陷阱:(D) 描述的預訓練是 LLM 訓練流程中真實存在的重要階段,容易讓人覺得「這也是訓練啊」。要把 LLM 的三段流程排清楚:預訓練(學語言)→ 指令微調(學聽話)→ RLHF(學對齊人類偏好)。題目問哪一段,就只認那一段。