在大型語言模型(LLM)的效能優化中,Flash Attention 常被用來改善 Transformer 注意力機制的運算效率。關於 Flash Attention 的主要效益,下列敘述何者最正確?
答案 (B)
核心概念
標準的注意力計算會先算出完整的 n×n 注意力矩陣並寫入 GPU 的高頻寬記憶體(HBM),再讀回來做 Softmax,這個「寫出去再讀回來」的記憶體搬運才是真正的瓶頸。Flash Attention 的做法是把計算切成小塊(Tiling),在 GPU 的高速片上記憶體(SRAM)中分塊完成計算並用線上方式累加 Softmax 結果,避免產生與存取完整的中間矩陣。重點是:它是精確計算(結果與標準注意力完全相同),省的是記憶體讀寫,不是省略運算。
答題技巧
快速判斷技巧:記住一句話——「Flash Attention 是精確不是近似,省的是記憶體搬運不是計算量」。凡是選項提到「忽略、省略、近似」的,一律排除。
易錯陷阱:(A) 與 (D) 分別把稀疏注意力與 KV Cache 的特性掛到 Flash Attention 頭上,都是真實存在的技術但主詞錯置。這類題目要先確認技術名稱與機制的一對一關係,不要憑「聽起來都在講優化」就選。