跳到主要內容
1.3 機器學習基本原理
114-4 科目 37

某金融科技公司在利用歷史交易資料建立風險控管模型時,嘗試推估整體詐騙交易比例。近期發現,樣本間存在明顯的時間序列相關性,導致模型在實際偵測新交易時誤判率升高。若希望同時改善詐騙比例推估的準確性並提升模型的穩健性,下列哪一種做法最為合適?

請選擇一個答案

答案 B

核心概念

時間序列資料的樣本不是獨立的——今天的交易行為跟昨天高度相關。如果用一般的隨機抽樣或隨機切分訓練/測試集,等於讓模型偷看到未來的資訊(資料洩漏),評估結果會過度樂觀,上線後誤判率就爆增。正確做法是採用尊重時間結構的抽樣與切分,例如依時間區間分層抽樣、時間序列交叉驗證(Time Series Split)、或前向驗證(Walk-forward Validation)。
答題技巧

快速判斷技巧:只要資料帶時間性,看到「隨機打散」「隨機切分」一律先刪。答案通常會出現「依時間分層」「時間序列交叉驗證」「保留時間順序」這類字眼。

易錯陷阱:(C) 的「打散以降低相關性」在一般表格資料中確實是好習慣,很容易被套用過來。要建立一個直覺:時間序列的相關性是資訊,不是雜訊,打散它等於毀掉這份資料的意義。