跳到主要內容
2.2 生成式 AI 應用領域與常見工具
115-2 科目 12

某電商平台導入 CLIP(Contrastive Language-Image Pre-training)模型,讓使用者能直接輸入文字描述來搜尋商品圖片。請問 CLIP 模型是透過哪一種方式來衡量文字描述與圖片之間的相符程度?

請選擇一個答案

答案 A

核心概念

CLIP 的做法是訓練兩個編碼器——文字編碼器與影像編碼器,把文字與圖片分別投影到同一個向量空間中。訓練時讓相符的圖文配對在空間中靠近、不相符的推遠。使用時要判斷一段文字與一張圖片相不相符,就計算兩者向量之間的餘弦相似度——夾角越小、相似度越高,代表語意越接近。
答題技巧

快速判斷技巧:向量之間比相似度,標準工具就是餘弦相似度(也可能是歐氏距離、內積)。看到「向量空間」「相似程度」就選它。

易錯陷阱:(C) 交叉熵容易被誤選,因為 CLIP 訓練時確實用到對比式的損失函數。要分清楚兩個階段:訓練時用損失函數優化模型,推論時用相似度衡量匹配——題目問的是後者。