某新創公司希望針對特定醫療診斷任務微調語言模型,但受限於資料取得困難,目前僅收集到少量已標註的診斷病例。在標註資料極為有限的條件下,強化微調(Reinforcement Fine-Tuning, RFT)相較於監督式微調(Supervised Fine-Tuning, SFT)最主要的優勢為何?
答案 (B)
核心概念
監督式微調需要大量「輸入-標準答案」配對,模型照著範例模仿,資料量不足就學不好。強化微調則改用獎勵訊號——只要能判斷「這個輸出好不好」(例如診斷結論是否符合臨床規則、格式是否正確),就能給出獎勵引導模型優化,不必為每一筆資料準備完整的標準答案。因此在標註資料稀缺、但評分準則明確的場景中,RFT 的資料效率明顯較高。
答題技巧
快速判斷技巧:看到 Reinforcement(強化)就找「獎勵/回饋訊號」的選項。再檢查敘述有沒有邏輯矛盾或過度誇大,通常四選一馬上收斂。
易錯陷阱:(A) 是自相矛盾的選項(需要大量資料 vs 資料有限仍穩定),讀太快會漏掉。這類題目務必把選項的前後半句放在一起檢查邏輯是否自洽。