数据和特征决定了机器学习的上限,模型算法只是逼近这个上限。
缺失值处理
删除、填充(均值/中位数/众数)、或作为独立类别。
类别编码
One-Hot 适合无序类别,Label/Target Encoding 适合树模型。
数值变换
对数变换、标准化、分箱,处理偏态分布与异常值。
特征交叉、时间窗口统计等衍生特征,往往能带来显著提升。
数据和特征决定了机器学习的上限,模型算法只是逼近这个上限。
删除、填充(均值/中位数/众数)、或作为独立类别。
One-Hot 适合无序类别,Label/Target Encoding 适合树模型。
对数变换、标准化、分箱,处理偏态分布与异常值。
特征交叉、时间窗口统计等衍生特征,往往能带来显著提升。