對非常長的輸入序列進行推理(Inference),Transformer 模型推理的主要計算瓶頸通常是什麼?
答案 (D)
核心概念
Transformer 的自注意力機制要讓序列中每個 Token 都跟其他所有 Token 算一次相關性,所以會產生一個 n×n 的注意力矩陣(n 為序列長度)。這代表計算量與記憶體佔用都是 O(n²):序列長度翻倍,成本變四倍。這就是長文本推理最主要的瓶頸,也是後續各種稀疏注意力、FlashAttention、滑動視窗注意力想解決的問題。
答題技巧
快速判斷技巧:只要題目扯到「長序列 + Transformer + 瓶頸」,答案永遠指向自注意力的 O(n²)。把「平方級增長」這五個字當關鍵字掃選項即可。
易錯陷阱:(C) 有點迷惑性,因為 Softmax 確實存在於注意力計算裡。但要分清楚成本來源是「n×n 的矩陣本身」,不是外面那層 Softmax 函數。