
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
函数/操作输入形状输出形状作用(n, m)(m,)每列计算 Q1(n, m)广播比较,每列独立(n, m)(n,)按行检查是否有 True(n, m)(n,)按行检查是否全为 True.clip()(n,)(n,)单列截断。
Step 2: 对每一列,用其他列作为特征,该列作为目标,训练模型。# 原理:将每个缺失值列作为目标变量,用其他列作为特征进行预测。# 原理:找到与缺失值样本最相似的K个邻居,用它们的平均值填充。# Step 1: 用简单方法(如中位数)初步填充所有缺失值。# Step 1: 计算所有样本间的距离(考虑所有特征)# Step 3: 用这K个邻居在该特征上的平均值填充。计算与其他所有样本的距离(基于
决策树、随机森林、XGBoost等树模型(对数值大小不敏感)线性模型(如逻辑回归、SVM)类别数量极多(>100个)神经网络(需要标准化处理)对于encoder 的使用。类别间无天然顺序关系。
【代码】机器学习特征预处理之删除常量列。
稀疏矩阵是指矩阵中大部分元素为0的矩阵。在OneHot编码中,每个样本只有一个类别值为1,其余都是0,天然适合用稀疏格式存储。python# 假设有100个城市,100万条数据# 密集矩阵:100万 × 100 = 1亿个元素# 稀疏矩阵:只存储非零元素的位置和值。
一般数据先标准化 再移除低方差列。
对指定的数值列应用Power Transformation(幂变换),使数据更接近正态分布,常用于满足统计模型假设或提升模型性能。数据包含零/负值 → 必须用Yeo-Johnson。仅正值 → Box-Cox通常效果更好(更稳定)记录变换参数(如λ值),便于逆变换和解释。对象,用于新数据的变换。
说明:如果数据特征数量<100且特征间相关性低,当前代码可用。但对于生产环境或高维数据,建议采用。
【代码】机器学习特征预处理之删除共线性特征。







