特徵工程方法 (Feature Engineering)
特徵工程的目標是將原始數據轉換為更具代表性、更具信息量的特徵,使模型能更有效地學習。依據資料形式與問題類型
特徵選擇(Feature Selection)
挑選對目標預測最有貢獻的特徵,降低噪音並提升模型效率。
Filter 方法
依據統計量衡量特徵與目標的相關性,例如皮爾森相關係數、卡方檢驗。
Wrapper 方法
以模型預測表現為準則挑選特徵,例如遞歸特徵消除(RFE)。
Embedded 方法
特徵重要性在模型訓練過程中直接產生,例如 Lasso 的稀疏化、決策樹的重要性。
特徵提取
透過轉換方式重新構造特徵,使資料在新的空間中更具代表性。
主成分分析 PCA
找到變異量最大的方向,並建立彼此正交的主成分,將資料投影至較低維度,主成分為原始特徵的線性組合
組成:
- PC1:變異量最大方向
- PC2:在與 PC1 正交下,變異量次大方向
數學形式:
獨立成分分析 ICA
將訊號拆解為統計獨立的成分,常用於混合訊號分離。
Autoencoder
透過神經網路壓縮資料,在隱層取得非線性特徵表示。
維度降低(Dimensionality Reduction)
降低資料維度以減少計算與避免維度災難,同時保留主要結構。
線性維度降低
-
PCA
-
LDA
-
Factor Analysis(因子分析)
非線性維度降低
-
t-SNE
用於視覺化,保留局部鄰域結構。 -
UMAP
保留更多全域結構且速度更快。 -
Isomap
建立資料流形上的 geodesic 距離。
深度學習降維
-
Autoencoder
-
Variational Autoencoder(VAE)
能獲得連續且結構化的隱變量空間。
特徵構建(Feature Construction)
由既有特徵生成新特徵,補足模型難以自行推導的關係。
特徵交互
將兩個或多個特徵進行運算,例如相乘、相除,用於捕捉交互關係。
多項式特徵
將特徵升維,例如由 產生 ,使模型能表現非線性效果。
時間序列特徵
根據歷史值產生特徵,例如移動平均、時間延遲、變化率等,用於擷取趨勢與時間依賴性。
