某團隊訓練深層神經網路模型時,發現訓練誤差長時間幾乎未下降,模型參數更新幅度極小,呈現學習停滯現象。若研判問題與梯度傳遞效率有關,下列何者最適合的改善策略?
答案 (C)
核心概念
題幹描述的症狀——訓練誤差不下降、參數更新幅度極小——正是梯度消失(Vanishing Gradient)的典型表現。成因是 Sigmoid、Tanh 這類啟動函數的導數在飽和區趨近於 0,深層網路反向傳播時這些小數連乘,梯度傳到淺層幾乎歸零,參數自然動不了。改用 ReLU 或其變體(導數在正區間恆為 1)就能讓梯度順利傳遞。
答題技巧
快速判斷技巧:先看訓練誤差的表現——訓練誤差降不下來是欠擬合/最佳化問題(想啟動函數、學習率、批次正規化、殘差連接);訓練誤差很低但測試誤差高才是過度擬合(想 Dropout、正則化、資料增強)。兩條路徑不要走錯。
易錯陷阱:(D) 提到過度擬合,會讓人反射性覺得「簡化模型總是好的」。但本題訓練資料上都學不起來,根本還沒到擔心過度擬合的階段。判斷神經網路問題時,第一步永遠是先看訓練誤差有沒有降。