iPAS 科目一最容易搞混的三組觀念,考題就愛考這裡

準備科目一的時候,我發現有些觀念不是不懂,是「看起來都對」。
四個選項擺在一起,每一個都有印象,但就是說不出來哪裡不一樣。這種題最容易錯,因為你不是不會,你是分不出來。
我把三份考卷的科目一 150 題整理過一輪之後,發現最常出現、也最容易掉進去的就是下面三組。
一、四種學習類型:只看標籤
監督式、非監督式、半監督式、強化式,這四個名詞背起來不難,但題目一給情境就開始猶豫。
其實辨識的關鍵只有一個,就是訓練資料裡有沒有標籤、標籤有多少。
拿學開車比喻:
・監督式:教練坐旁邊,每個動作都告訴你對不對 ・非監督式:丟一堆行車紀錄器影片給你,自己看出規律 ・半監督式:教練只帶前幾次,剩下你自己練 ・強化式:沒人教,撞到才知道痛,順利過彎就爽
對回定義就是:監督式有完整標籤,非監督式完全沒有,半監督式是少量標籤加上大量未標籤,強化式靠跟環境互動拿到獎勵或懲罰。
最常見的陷阱是把「少量標籤加大量未標籤」看成監督式。只要題目提到「標註成本很高,但原始資料很多」,答案幾乎都是半監督式。
二、資料不平衡:分清楚在處理哪一端
這組的難點不在觀念,在於同一個情境下有好幾種做法,你要選出題目要的那一種。
先理解為什麼會出問題。模型訓練的目標是把整體損失壓到最低,當某一類佔了絕大多數,「全部都猜多數那一類」就能拿到很漂亮的準確率。
所以準確率高不代表模型有用。真正被拖垮的是少數類別的召回率,模型幾乎不會把東西判給稀有類別。
處理方式大致分兩種思路:
1️⃣ 想辦法補平資料 最常考的是 SMOTE,全名是合成少數類別過採樣技術。它的做法是在少數類別樣本跟它的鄰居之間,在連線上內插造出一筆新樣本。重點是「造出新的」而不是「複製舊的」,所以比單純重複採樣更不容易過度擬合。
2️⃣ 乾脆不補,只學正常 當異常樣本少到極端,與其硬湊,不如換個方向。只拿正常資料訓練,讓模型學會完美重建「正常」的樣子。上線後正常資料重建誤差小,異常資料因為模型沒看過,誤差就大,用門檻值就抓得出來。
判斷的關鍵在題幹。題目說「標籤太少但還是有」,走補資料那條;題目說「幾乎拿不到異常樣本」或直接寫「缺乏標籤」,走只學正常那條。
順帶一提,這種題目問評估指標時,答案通常不會是準確率。
三、可解釋 AI:先分路線,再分方法
這是科目一最高頻的考點,三份考卷加起來考了 12 題,平均每份 4 題。
第一步永遠是先分成兩條路線:
・內建可解釋:選一個本身就透明的模型。線性迴歸看係數、決策樹看分支路徑,模型長什麼樣就解釋成什麼樣 ・事後解釋:模型已經訓練完了,而且通常是黑箱,再從外面用額外的方法推敲它的行為
用房子比喻的話,內建可解釋是玻璃屋,本來就看得見裡面;事後解釋是在屋外裝監視器,房子還是不透明,但你能推敲裡面發生什麼事。
LIME 跟 SHAP 都屬於事後解釋這一條。
LIME 的全名已經把答案寫出來了:Local(局部)、Interpretable(可解釋)、Model-agnostic(與模型無關)、Explanations(解釋)。
它處理的是「這一筆為什麼是這個結果」。就像你被醫生判定為高風險,你不會要求他重寫整套醫學教科書,你只想知道自己這一次為什麼被判高風險。
它的做法分三步:在那一筆樣本附近產生一批擾動樣本、丟進黑箱拿到預測結果、再用一個簡單模型去逼近黑箱在這個小範圍內的行為。
反事實解釋則是回答「如果我當初怎樣,結果會不會不同」。以信貸為例,它會告訴被拒絕的客戶「如果年收入再多 10 萬就會通過」。
考題很愛考它的三個條件: ・可操作性:客戶真的做得到,不能叫人把年齡改掉 ・邏輯與因果一致性:改一個特徵,相依的其他特徵也要合理連動 ・法規合規:不能碰性別、種族這類受保護特徵
怎麼練這三組
觀念看懂之後,一定要用題目驗收。這三組的共同特徵是「單看解釋都會覺得自己懂了」,但換成四個選項擺在一起就開始猶豫。
考古題詳解庫可以按章節找到這幾個主題的題目,每一題都寫了為什麼對、為什麼錯。想一次練整組的話,用練習測驗挑章節出題會比較快。
如果你想要一份把觀念、圖卡跟對應考古題整理在一起的東西,我自己整理的科目一學習筆記也在這個網站上。
祝你考試順利!