跳到主要內容
1.4 鑑別式 AI 與生成式 AI 的基本原理
115-2 科目 29

某 AI 研究團隊採用 GRPO(Group Relative Policy Optimization)作為一種基於強化學習的模型優化方法,用於提升大型語言模型的表現。請問 GRPO 最適合用來強化模型在哪一類任務上的表現?

請選擇一個答案

答案 C

核心概念

GRPO 是一種強化學習的策略優化方法,特色是讓模型對同一個問題產生一組(Group)候選答案,比較它們之間的相對優劣來計算優勢值,藉此更新策略——不需要額外訓練一個價值模型,訓練成本較低。它特別適合「答案可以被明確驗證對錯」的任務,因為這樣就能用規則式的獎勵(答對給分、答錯不給分)來訓練,數學推理與邏輯解題正是最典型的場景,也是近年推理型模型訓練的主流做法。
答題技巧

快速判斷技巧:強化學習類的模型優化方法(GRPO、PPO 用於推理訓練)幾乎都指向「複雜推理任務」——數學、程式、邏輯。看到選項中有「逐步推導」就選它。

易錯陷阱:這是需要知道時事技術的題目。若不確定 GRPO 是什麼,可以用一個原則推理:強化學習的價值在於優化「多步驟決策的策略」,四個選項中只有 (C) 涉及多步驟推導,其餘都是一次性的分類或轉換。