跳到主要內容
2.3 生成式 AI 導入評估
115-2 科目 39

某研究團隊希望評估大型語言模型在不同學科領域的整體理解能力,包含法律、醫學、數學與歷史等,並要求模型在未見過的題型中仍能正確推理與作答。下列何者最符合此類評測設計的核心概念?

請選擇一個答案

答案 B

核心概念

題幹描述的評測有三個特徵——橫跨多個學科領域(法律、醫學、數學、歷史)、涵蓋不同任務型態、且要求在未見過的題型上仍能推理作答。這正是「多領域、多任務語言理解能力評估」的定義,代表性的基準測試就是 MMLU(Massive Multitask Language Understanding),它涵蓋數十個學科,用來衡量模型知識的廣度與泛化推理能力。
答題技巧

快速判斷技巧:題幹列出多個學科領域,答案就找有「多領域、多任務」的選項。這類評測的代表就是 MMLU,可以與 GSM8K(數學)、C-Eval(中文)對照記憶。

易錯陷阱:本考點在 115-1 科目 2 第 45 題也考過(當時是直接問資料集名稱)。這題改成問「評測設計的核心概念」,其實是同一個知識點的另一種問法。