跳到主要內容
2.3 生成式 AI 導入評估
114-4 科目 45

下列哪一個資料集專門設計用於測試大型語言模型在多領域、多任務語言理解中,涵蓋人文、科學與社會科學等領域,而非專門用於數學推理或中文專業知識?

請選擇一個答案

答案 A

核心概念

主流基準測試各有守備範圍,記名字就記得住考點。MMLU(Massive Multitask Language Understanding)涵蓋 57 個學科,橫跨人文、社會科學、STEM 與專業領域,是衡量模型通用知識廣度的代表性基準。GSM8K 是小學程度的數學應用題,測多步驟算術推理。MATH 是競賽級數學題,難度更高。C-Eval 則是中文語境的綜合評測,聚焦中文與中國相關的專業知識。
答題技巧

快速判斷技巧:從名字拆解就好——MMLU 有 Multitask(多任務)、MATH 與 GSM8K 一看就是數學、C-Eval 的 C 代表 Chinese。題目說要多領域、非數學、非中文,答案自動浮現。

易錯陷阱:這題其實是把答案寫在題幹裡的送分題(「多領域、多任務」直接對應 Multitask Language Understanding)。要留意的是別漏讀後半句的兩個排除條件,那是用來刪掉另外三個選項的。