跳到主要內容
1.3 機器學習基本原理
115-2 科目 14

某能源公司以過去三年每小時用電資料建立需求預測模型,並以 5-fold 交叉驗證評估,但上線後誤差偏高。技術主管認為問題出在資料分割方式。下列何者最能說明使用標準 k-fold 交叉驗證的根本問題?

請選擇一個答案

答案 B

核心概念

標準的 k-fold 交叉驗證會把資料隨機打散再分成 k 折,這對獨立同分布的資料沒問題,但對時間序列是致命的——隨機分割會讓訓練集裡出現比測試集更晚發生的資料,等於讓模型「看到未來」再回頭預測過去,這就是時間上的資料洩漏。驗證分數因此虛高,上線後面對真正的未知未來,誤差自然暴增。正解是改用時間序列交叉驗證(Time Series Split)或前向驗證,永遠用過去預測未來。
答題技巧

快速判斷技巧:資料只要帶時間性,看到「隨機分割」「隨機打散」立刻標記為錯誤做法。答案就是那個指出時間洩漏的選項。

易錯陷阱:本題與 114-4 科目 2 第 37 題(詐騙偵測的時間序列抽樣)是同一個觀念的不同包裝。核心原則要記牢:時間序列的順序是資訊不是雜訊,破壞順序就是製造資料洩漏。