在大型語言模型(LLM)的推論服務中,常透過請求批次處理(Batching)來提升系統效能。關於批次處理(Batching)機制的影響,下列敘述何者最正確?
答案 (A)
核心概念
GPU 這類加速器擅長平行運算,一次只處理一筆請求會讓大量運算單元閒置。批次處理把多筆請求湊在一起同時運算,硬體使用率大幅提升,整體吞吐量跟著上升。但代價是先到的請求必須等待批次湊齊(或等待整批算完)才能回覆,因此單筆請求的延遲可能變長——這是吞吐量與延遲之間的典型取捨。
答題技巧
快速判斷技巧:效能題的答案通常是「有得有失」的那一個。含有「但是」「可能造成」這種帶取捨的敘述往往是對的;宣稱單一手段能讓所有指標都變好的通常是錯的。
易錯陷阱:(B) 把吞吐量與延遲混為一談,是最常見的誤解。記住兩者的定義差別:吞吐量是「單位時間處理幾筆」,延遲是「一筆要等多久」,提升前者常常會犧牲後者。