跳到主要內容

科目一1.2 資料處理與分析概念

資料整理與分析流程

這個主題跨梯次共出現 21 題,依梯次列在下面。

  1. 114-4 科目一2下列哪一種特徵工程技巧,最適合將「星期幾」和「24 小時制時間」這兩個欄位結合,以預測通勤時間?
  2. 114-4 科目一3關於 ETL(Extract-Transform-Load),下列敘述何者為正確?
  3. 114-4 科目一12下列哪一種圖表最適合用來呈現並分析「兩個數值型變數」之間的關係,例如觀察身高與體重的相關性?
  4. 114-4 科目一14某企業分析團隊正在處理一組近兩年的營運與銷售數據,共有四個部門提出了各自的分析需求,請判斷哪一個最接近「預測性分析(Predictive Analysis)」的特性?
  5. 114-4 科目一32在統計推論中,若樣本來自母體但呈現明顯偏態分布,且樣本數有限,下列哪一項策略最能減少推估母體參數的偏誤?
  6. 114-4 科目一36某電商資料團隊要協助行銷部門規劃再行銷策略。目前取得資料包含使用者點擊、購買紀錄、流量來源與轉換率。若資料團隊希望先進行探索性資料分析(EDA),下列哪一項最符合 EDA 的做法?
  7. 114-4 科目一41一家旅遊平台希望建立模型,預測顧客下次是否會再次透過該平台訂房。資料包含:顧客 ID、年齡、旅遊次數、平均花費金額、主要交通方式(火車/飛機/自駕/公車)、會員等級(普通/進階/白金)、是否為海外旅遊等。下列哪一種特徵工程方法最適合處理「主要交通方式」欄位?
  8. 114-4 科目一43某公司欲建立員工離職風險預測模型,資料集中包含「年度績效分數」、「平均每月加班時數」、「年齡」等數值型特徵。由於各特徵的數值範圍差異極大(例如績效分數 1–5、加班時數 0–80、年齡 20–65),若直接輸入至使用梯度下降的邏輯迴歸(Logistic Regression)模型,可能導致模型收斂緩慢或權重偏斜。為提升模型訓練效率與準確度,下列哪一種特徵工程方法最適合應用於這些數值特徵?
  9. 114-4 科目一45某醫院研究團隊蒐集了大量病患的「收縮壓」數據,經檢驗後顯示此數值大致呈現常態分布。在進行後續模型分析前,研究人員希望妥善處理可能存在的極端血壓數值。下列哪一種做法最為合適?
  10. 114-4 科目一46某電商公司想預測用戶是否會購買特定商品,資料中包含多種用戶屬性與行為特徵。分析師希望選出對購買結果最有預測價值的特徵,以提升模型效能。下列哪一種描述最符合監督式特徵選擇(Supervised Feature Selection)的概念?
  11. 114-4 科目一48若希望檢視某一連續型數據的分布情形(如集中程度、偏態或是否呈現多峰),下列哪一種應用情境最適合使用直方圖(Histogram)來進行分析?
  12. 115-1 科目一1下列何者不屬於資料整合(Data Integration)的主要目的?
  13. 115-1 科目一4某保險公司建立 AI 理賠金額預測模型。歷史理賠資料經檢定後呈近似常態分佈,但仍存在少數極端高額案件。資料科學團隊在不破壞整體分佈特性的前提下,規劃進行離群值處理。下列何者最不適當?
  14. 115-1 科目一7某電信公司建立機器學習模型預測用戶流失風險。資料中包含多個類別型特徵(Categorical Features),例如「資費方案類型」與「客戶地區」。為使模型能有效使用這些特徵,下列何者最直接用於將類別型特徵轉換為模型可處理的數值格式?
  15. 115-1 科目一16關於敘述性統計指標,下列敘述何者最為正確?
  16. 115-1 科目一17某企業資料分析人員需針對不同型態的數據選擇合適的視覺化工具。下列哪一種情境最適合使用直方圖(Histogram)?
  17. 115-1 科目一18某電商平台工程師需在已排序的價格清單中,快速定位指定價格是否存在,給定排序後陣列:arr = [3, 8, 14, 19, 21, 27, 33, 45, 52]。若搜尋目標值為 27,且採用標準二分搜尋(Binary Search)流程(每次比較後排除中位數),請問最多需要比較幾次即可找到目標?
  18. 115-1 科目一44某零售業者建立顧客行為預測模型,資料集中包含「年消費金額」、「平均單筆交易金額」及「會員年資」等數值型特徵。資料分析顯示,部分金額特徵呈現高度偏態分布,少數樣本的數值顯著高於多數觀測值。為降低極端值對模型學習穩定性的影響,下列哪一種特徵工程方法最適合?
  19. 115-2 科目一13某銀行建立機器學習模型預測客戶的貸款違約風險。資料集中有一個「職業類別」欄位,包含「工程師、教師、業務、自由業」等類別。工程師計劃將此欄位進行編碼處理後直接輸入線性模型。下列哪一種編碼方式最可能導致模型錯誤解讀類別之間的關係?
  20. 115-2 科目一15某醫療院所建置病患再住院風險預測模型,特徵包含「年齡」、「體重」、「血壓數值」及「診斷類別代碼」等,資料科學家考慮是否需對數值特徵進行標準化(Standardization)處理。下列何種模型對特徵尺度最不敏感、最適合在不進行標準化的情況下直接使用上述特徵進行訓練?
  21. 115-2 科目一18某工業感測器回傳溫度時序資料,約 5% 出現遺漏值,確認為短暫失聯所致,非設備異常。資料工程師需在不引入虛假異常的前提下進行補值。考量資料具時間連續性,下列何種填補方式最為合適?