logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

《sklearn机器学习——管道和复合估算器》异构数据的列转换器

ColumnTransformer 实用指南 本指南介绍了 scikit-learn 中 ColumnTransformer 的核心功能,用于高效处理异构数据集。ColumnTransformer 允许对不同类型的数据列(数值型、类别型、文本型等)应用特定转换器,并自动拼接结果。 核心优势: 统一管理各类数据的预处理流程 避免训练/测试集数据泄露 可无缝嵌入机器学习管道 支持按列名、索引或数据类型

文章图片
#机器学习#sklearn#人工智能
《sklearn机器学习——管道和复合估算器》链式估算器

# sklearn Pipeline 简明摘要 **核心功能**:Pipeline 是 scikit-learn 提供的链式估计器工具,支持将数据预处理和模型训练步骤串联成统一流程。 **主要优势**: - 简化代码结构,避免中间变量 - 防止交叉验证时的数据泄露 - 支持统一参数调优 - 便于模型保存与部署 **两种创建方式**: 1. `Pipeline(steps)`:需显式命名每个步骤 2

文章图片
#机器学习#sklearn#人工智能
《sklearn机器学习——管道和复合估计器》联合特征(FeatureUnion)

scikit-learn中的FeatureUnion工具可以并行组合多个特征提取器,将不同特征提取方法的结果横向拼接成一个更大的特征矩阵。它支持多种特征处理方式(如TF-IDF、词袋模型、PCA等)的并行执行,并通过统一接口进行调用。典型应用场景包括:同时使用多种特征提取方法、处理异构数据以及构建复杂特征工程流水线。使用示例展示了文本特征组合(TF-IDF+词袋模型)、数值特征组合(PCA+标准化

文章图片
#机器学习#sklearn#人工智能
《sklearn机器学习——管道和复合估算器》可视化复合估计器

本文介绍了如何使用 scikit-learn 的 HTML 可视化功能来直观展示机器学习流程。主要内容包括: 通过 set_config(display='diagram') 启用 HTML 图表显示功能 支持 Pipeline、ColumnTransformer 等复杂结构的可视化展示 图表特性: 可展开/折叠的嵌套结构 参数悬停提示 绿色对勾标记已拟合状态 颜色编码区分不同类型组件 支持动态更

文章图片
#机器学习#sklearn#人工智能
《sklearn机器学习——管道和复合估计器》回归中转换目标

本文详细解析了 sklearn 中回归任务目标变量转换的方法与实现。主要内容包括:目标转换的必要性(满足模型假设、稳定方差、处理非线性等);常用的转换方法如对数变换、Box-Cox变换等;核心工具 TransformedTargetRegressor 的使用与参数详解。文章通过具体示例展示了如何应用这些技术,并强调了转换器选择与逆变换的注意事项,为回归建模中的目标变量预处理提供了全面指导。

文章图片
#机器学习#sklearn#回归
《sklearn机器学习——特征提取》

scikit-learn 提供了多种文本特征提取工具,主要包括 CountVectorizer、TfidfVectorizer 和 HashingVectorizer。CountVectorizer 通过词频统计生成文档-词矩阵;TfidfVectorizer 引入 TF-IDF 权重机制,降低常见词影响;HashingVectorizer 采用哈希技巧处理大规模数据,内存高效但不可逆。这些方法支

文章图片
#机器学习#sklearn#人工智能
《sklearn机器学习——数据预处理》标准化或均值去除和方差缩放

方差缩放是确保所有特征具有相同“能量级别”的关键步骤。在 sklearn 中,通过 StandardScaler(with_mean=False) 可实现纯方差缩放。虽然实践中更常用完整标准化(with_mean=True),但在某些特定场景(如保留原始偏移量、处理稀疏数据)下,仅缩放方差仍具有实用价值。

文章图片
#机器学习#sklearn#均值算法
《sklearn机器学习——数据预处理》非线性转换

非线性转换是处理非正态分布、偏态数据的强大工具。使用 PowerTransformer 进行参数化幂变换(推荐用于回归、线性模型)使用 QuantileTransformer 进行分位数映射(适用于分布未知或复杂情况)合理使用非线性转换可显著提升模型性能,尤其在数据分布不理想时。始终记得在训练集上拟合变换器,并应用于测试集,避免数据泄露。

文章图片
#机器学习#sklearn#人工智能
《sklearn机器学习——数据预处理》类别特征编码

本文介绍了 sklearn 中常用的类别特征编码方法: LabelEncoder:将类别映射为整数,适用于目标变量 OrdinalEncoder:支持多列有序特征编码 OneHotEncoder:通过二进制向量表示无序类别 pandas.get_dummies:替代方案 文中提供了各方法的代码示例、参数说明和适用场景建议,并推荐使用ColumnTransformer组合不同编码器。最后强调需注意训

文章图片
#机器学习#sklearn#人工智能
《sklearn机器学习——数据预处理》离散化

本文介绍了sklearn中的离散化方法,重点解析了KBinsDiscretizer类的使用。离散化可将连续特征转换为离散区间,用于简化模型、增强鲁棒性。文章详细说明了参数配置(分箱数量、编码方式、分箱策略)和输出结果类型,并提供了示例代码演示等宽分箱和独热编码转换过程。同时指出了离散化的应用场景(如朴素贝叶斯模型)和注意事项(数据分布影响、边界处理等),强调了该方法在特征工程中的实用价值。

文章图片
#机器学习#sklearn#人工智能
    共 40 条
  • 1
  • 2
  • 3
  • 4
  • 请选择