某 AI 團隊正在訓練一個深度神經網路,用於辨識工廠產線上的瑕疵零件。工程師發現訓練過程中損失函數震盪幅度大,且不同批次資料造成模型學習方向不穩定。為改善此問題,團隊在各隱藏層加入 Batch Normalization 機制。請問此調整在訓練階段最主要的作用為何?
答案 (D)
核心概念
批次正規化(Batch Normalization)的作法是在每個隱藏層的輸出上,依當前批次計算平均數與變異數並做標準化,再以可學習的縮放與平移參數還原表達能力。它要解決的是內部協變量偏移(Internal Covariate Shift)——每一層的輸入分布會隨著前面各層權重更新而不斷改變,導致後面各層要一直重新適應,訓練因此震盪不穩。把每層輸入的分布穩住之後,梯度更新變得平順,訓練速度加快,也能使用較大的學習率。
答題技巧
快速判斷技巧:看到「訓練震盪、學習不穩」+「Batch Normalization」,答案就是穩定內部分布、讓梯度更新平順的那一個。關鍵字是「分布」與「穩定」。
易錯陷阱:(A) 最容易誤選,因為批次正規化與資料標準化名字都有「標準化」。差別在作用位置——資料標準化只做一次在輸入端,批次正規化在網路內部每一層都做,而且是隨批次動態計算。