
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
数据集│▼EDA(探索数据)│├── 数据规模├── 缺失值├── 类别比例├── 特征分布├── 异常值└── 相关性│▼数据清洗(Cleaning)│▼特征工程(Feature Engineering)│▼模型训练(Model Training)│▼模型评估(Evaluation)│▼模型解释(SHAP / LIME)│▼部署(Deployment)你现在正处在第一步EDA。这一步看似没有训练
如果你不小心打错了代码,把整个表格打印出来,你的浏览器网页会瞬间被撑开 1500 多行,你需要疯狂滚动鼠标好几屏才能滑过去,不仅卡顿,还严重影响阅读。你在做物化实验或者模拟晶体结构时,如果每次实验的温度、压力、升温速率都在悄悄变化,你最后测出来的电导率肯定每次都不一样,你就无法判断到底是哪一个配方真的起作用了。你再点一次,它又随机抓了另一批特征,准确率变成了 89.5%。你和作者一样:GitHub
feature_stats = features.describe().T ------------------为什么要转置?SECOM数据集是半导体生产的真实数据,1567个芯片样本,590个传感器读数,目标是预测每个芯片是合格品还是不合格品。最近开始从零学机器学习,选了一个半导体良品率预测的GitHub项目练手。第一个问题,很多pytho语言看不懂,不知道什么时自定义的内容,什么是python
其中第一行代码较难理解,不理解summary的意思,summary在src文件中data中data_lodar.py文件中,summary相当于直接一串代码调用了需要显示的内容,在summary一系列代码中可以直接读取传感器等传出的数据,在summary代码中load_data负责读数据,get_data_summary负责“统计数据”,将缺失值统计出来。#summary['n_pass']/su







