某 AI 團隊正在開發一套文字生成影片的系統,模型可根據輸入的描述,自動生成連續且具時間一致性的影像內容。該系統的生成過程是由隨機初始狀態開始,透過多步驟逐漸轉換為有意義的影像序列。請問下列哪一項最能敘述此類影片生成模型的核心機制?
答案 (B)
核心概念
題幹的描述——「由隨機初始狀態開始、透過多步驟逐漸轉換為有意義的影像序列」——正是擴散模型(Diffusion Model)的運作方式。訓練時逐步對資料加入噪聲直到變成純噪點,模型學習如何反向一步步去噪;生成時就從隨機噪聲出發,經過數十步的漸進去噪,最終產生清晰且時間上連貫的影片。目前主流的文字生成影片模型都採用這個機制。
答題技巧
快速判斷技巧:看到「從噪聲開始」「多步驟逐漸去噪」就是擴散模型;看到「生成器與判別器對抗、一次生成」才是 GAN。題幹的動詞描述就是分辨依據。
易錯陷阱:(D) 的 GAN 也是「從隨機向量開始」,前半段看起來吻合。差別在後半段——GAN 是一次到位,擴散模型是多步漸進。題幹寫了「多步驟」,這就是關鍵字。