在訓練神經網路時,為了提升模型收斂速度與穩定性,避免梯度消失或梯度爆炸,下列哪一種做法最常被使用?
答案 (B)
核心概念
梯度消失的元凶之一是傳統啟動函數。Sigmoid 與 Tanh 的導數最大值分別只有 0.25 與 1,且在飽和區趨近於 0,層數一多,反向傳播時這些小於 1 的導數連乘下去,梯度就消失了。ReLU 在正區間的導數恆為 1,連乘也不會衰減,因此能讓梯度順利傳遞到深層;其變體(Leaky ReLU、ELU、GELU)進一步改善負區間神經元死亡的問題。
本題詳解提到同卷第 43 題。
答題技巧
快速判斷技巧:把症狀與解法配對記起來——梯度消失/爆炸 → ReLU 系列啟動函數、批次正規化(Batch Normalization)、殘差連接(Residual Connection)、梯度裁剪(Gradient Clipping)。過度擬合 → 丟棄法(Dropout)、資料增強、正則化。看到症狀就從對應清單裡找。
易錯陷阱:(D) 標準化很有干擾性,因為它確實能加速收斂。差別在於:標準化解決的是「輸入特徵尺度不一」,而梯度消失是「深層網路中導數連乘衰減」,成因不同。題目把「梯度消失或梯度爆炸」寫出來,就是在指定病因。