跳到主要內容
1.4 鑑別式 AI 與生成式 AI 的基本原理
114-4 科目 28

對非常長的輸入序列進行推理(Inference),Transformer 模型推理的主要計算瓶頸通常是什麼?

請選擇一個答案

答案 D

核心概念

Transformer 的自注意力機制要讓序列中每個 Token 都跟其他所有 Token 算一次相關性,所以會產生一個 n×n 的注意力矩陣(n 為序列長度)。這代表計算量與記憶體佔用都是 O(n²):序列長度翻倍,成本變四倍。這就是長文本推理最主要的瓶頸,也是後續各種稀疏注意力、FlashAttention、滑動視窗注意力想解決的問題。
答題技巧

快速判斷技巧:只要題目扯到「長序列 + Transformer + 瓶頸」,答案永遠指向自注意力的 O(n²)。把「平方級增長」這五個字當關鍵字掃選項即可。

易錯陷阱:(C) 有點迷惑性,因為 Softmax 確實存在於注意力計算裡。但要分清楚成本來源是「n×n 的矩陣本身」,不是外面那層 Softmax 函數。