某使用者在操作 ChatGPT 時,要求系統「產生一張簡報架構圖」。模型隨即輸出一段具有固定語法規則的結構化文字(例如可用來描述流程或架構的標記語言),並可進一步渲染為圖表,而非僅生成文字描述。請問此能力最主要源自模型在預訓練階段大量接觸下列哪一類型的資料?
答案 (D)
核心概念
模型輸出的「具固定語法規則、可被渲染成圖表的結構化文字」,指的是 Mermaid、PlantUML、Graphviz 這類圖表描述語言——它們本質上是程式碼式的標記語言,有嚴格的語法規則。模型能正確產生這種輸出,是因為預訓練語料中包含了大量的程式碼與標記語言文本(HTML、XML、Markdown、YAML、各種 DSL),從中學到了語法結構的規則性。
答題技巧
快速判斷技巧:問「某種輸出能力來自什麼訓練資料」時,看輸出的形式像什麼——輸出有嚴格語法的東西就來自程式碼與標記語言,輸出流暢文章就來自一般文本。
易錯陷阱:(A) 因為題目提到「架構圖」而聯想到繪畫資料,是典型的字面誤導。關鍵在題幹已經說明模型輸出的是「結構化文字」再渲染成圖,不是直接畫圖——產出形式決定了資料來源。