跳到主要內容
2.2 生成式 AI 應用領域與常見工具
114-4 科目 25

某新創公司開發一套圖像描述生成系統,能根據輸入的照片自動產生說明文字。為了讓產生的描述文字能與圖片資訊精準對應,下列哪一種設計思路最關鍵?

請選擇一個答案

答案 B

核心概念

圖像描述(Image Captioning)是典型的多模態任務。要讓文字「對得上」圖片,關鍵在於生成的每一步都必須以影像特徵為條件——先用視覺編碼器把圖片轉成特徵表示,再讓語言模型在生成文字時持續參照這些視覺特徵(例如透過跨模態注意力機制)。少了這個橋接,模型就只是在憑語言慣性造句,講得再漂亮也可能跟圖片無關。
答題技巧

快速判斷技巧:多模態任務的題目,答案幾乎都是那個「同時用到兩種模態」的選項。掃過去只看哪一個把影像與文字綁在一起,其餘只談文字的全部刪掉。

易錯陷阱:(A)(C)(D) 三個都在談「怎麼把文字生成得更好」,讀起來都很專業。但題目問的是「與圖片精準對應」——如果一個做法完全沒有看圖,就不可能對應得上。