logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Python数据分析和数据处理库Pandas(透视表)

透视表是一种数据汇总工具,可通过行列分组对数据进行聚合分析。Python的pivot_table()函数提供values、index、columns等参数控制数据分组和聚合方式。本文以睡眠质量数据集为例,演示如何通过睡眠时间、压力等级等维度分析睡眠质量,并展示如何添加职业、性别等维度构建多维透视表。案例中使用了cut()函数对连续变量进行离散化处理,并采用mean作为默认聚合函数,帮助用户理解透视

文章图片
#数据分析#pandas#数据挖掘 +1
Python数据分析和数据处理库Pandas(缺失值处理函数)

本文介绍了pandas中处理缺失值的方法。主要内容包括:1) pandas使用NaN和NA表示缺失值,通过isnull()/notnull()判断缺失值;2) 加载数据时可通过keep_default_na、na_values参数控制缺失值识别;3) 使用missingno库可视化缺失值分布;4) 通过dropna()剔除缺失值,支持按行/列及阈值设置;5) 使用fillna()填充缺失值,包括固

文章图片
#python#数据分析#pandas +1
Python数据分析和数据处理库Pandas(日期数据处理初识)

本文介绍了Pandas中日期处理的三个核心功能:1)使用to_datetime()进行日期格式转换,详解了参数配置和字符串转日期的方法;2)通过dt访问器获取日期属性,包括年月日、星期、季度以及判断月底/年底;3)利用to_period()实现日期到统计周期(年/季/月/周)的转换。文中通过具体代码示例演示了如何从交易日期字段中提取各类时间特征,为时间序列分析提供数据处理基础。

文章图片
#python#数据分析#pandas +1
Python数据分析和数据处理库Pandas(apply函数)

本文介绍了pandas中apply()函数的用法及其与向量化操作的区别。主要内容包括:1)Series和DataFrame的apply()方法应用,可以逐元素或按行列处理数据;2)如何通过np.vectorize()或装饰器实现函数向量化,解决标量函数处理向量数据时的报错问题。apply()适合处理复杂变换逻辑,而向量化操作能高效处理数组运算。文章通过具体代码示例展示了两种方法的应用场景和实现方式

文章图片
#python#数据分析#pandas +1
Python数据分析和数据处理库Pandas(数据聚合、转换、过滤函数)

本文介绍了Pandas中DataFrameGroupBy对象的使用方法,主要包括:1)通过groupby()创建分组对象,使用groups属性和get_group()查看分组;2)分组聚合操作,包括常用聚合函数、多统计值计算、自定义函数等;3)分组转换操作,如使用transform()进行数据标准化和缺失值填充;4)分组过滤方法。文章还讲解了cut()函数用于数据分箱处理,以及多字段分组、复合索引

文章图片
#python#数据分析#pandas +1
Python数据分析和数据处理库Pandas(数据组合函数)

本文介绍了Pandas中concat和merge两种数据连接方法。concat主要用于沿轴堆叠数据,支持Series和DataFrame的连接,可以按行或列连接,并能重置索引或实现类似join的连接效果。merge则用于基于键值的合并操作,支持一对一、多对一和多对多连接,可通过参数设置连接类型(inner/outer/left/right)、指定合并键、处理重复列名等。文章通过大量代码示例演示了不

文章图片
#数据分析#pandas#数据挖掘 +1
Python数据分析和数据处理库Pandas(时间序列)

本文介绍了Python中处理日期和时间的主要工具,重点讲解了datetime模块和pandas库的相关功能。主要内容包括:1) Python基础日期时间操作;2) pandas中的时间类型(datetime64、Period、Timedelta)及其索引;3) 时间序列生成方法date_range()及其频率设置;4) 时间数据的重新采样(resample)操作。文章通过具体代码示例展示了如何创建

文章图片
#pandas#人工智能#python +1
Python数据分析和数据处理库Pandas(DataFrame数据分析入门)

本文介绍了使用Pandas进行数据分析的基本操作流程。主要内容包括:1)加载天气数据集并查看基本信息;2)数据查看方法如head()、tail()和列数据提取;3)分组聚合计算,包括按月统计温度平均值和天气频数;4)使用plot()进行基本数据可视化;5)常用统计值获取方法;6)数据排序和去重操作;7)以员工数据集为例的简单分析案例,包括查找薪资极值、部门员工统计等。文章通过代码示例展示了Pand

文章图片
#python#数据分析#pandas +1
Python绘图库Matplotlib

Matplotlib是Python中最常用的数据可视化库,支持多种图表类型和高度自定义。文章介绍了Matplotlib的两种绘图接口:MATLAB风格的状态接口和更灵活的面向对象接口。通过天气数据集展示了单变量(降水量直方图)和多变量可视化方法,包括双变量(降水量与最高气温散点图)以及多变量(按年份颜色区分的散点图)。文章还说明了在不同开发环境(脚本和Notebook)中显示图形的差异,并提供了完

文章图片
#python#matplotlib#开发语言 +1
Python数据分析和数据处理库Pandas(DataFrame基础篇)

摘要:DataFrame是Pandas中的核心二维表格数据结构,类似SQL表,由有序的列组成,支持多种数据类型。可通过字典创建,具有行/列索引。常用属性包括index、columns、values等;方法涵盖数据统计(head/tail)、筛选(loc/iloc)、运算、排序等操作。支持布尔索引、与标量/DataFrame运算,以及行/列索引修改。数据可导入导出多种格式(CSV/Excel/JSO

文章图片
#python#数据分析#pandas +1
    共 26 条
  • 1
  • 2
  • 3
  • 请选择