
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本篇文章从零起步,不讲晦涩公式推导,用大白话讲懂混淆矩阵所有知识点,零基础也能一次性吃透,学完直接用于项目实战、论文实验、模型调优。混淆矩阵是分类任务中最核心的模型评估表格,专门用来直观统计模型预测结果对错分布,主要应用在二分类、多分类场景,日常使用最多的是二分类混淆矩阵。简单理解:把真实标签和模型预测标签两两对应摆放,统计每一种组合的样本数量,形成的二维表格就是混淆矩阵。它的最大作用就是不再只看

对于刚接触机器学习聚类算法的小伙伴来说,K-Means(K 均值聚类) 是最经典的无监督学习算法之一。但很多新手都会遇到一个核心问题:怎么确定聚类的最优 K 值(簇的数量)?本文用啤酒数据集作为实战案例,选择 K-Means 最优聚类数,代码全程可直接运行,有需要可自取。K-means 聚类广泛应用于市场细分、图像分割、文档聚类等领域。例如,在市场营销中,可以将客户划分为不同的群体,以便进行更针对

信用卡欺诈是典型的类别极不平衡的分类问题:正常交易(负样本)远多于欺诈交易(正样本)。如果直接用原始数据训练模型,模型会倾向于把所有样本都预测为“正常”,导致召回率极低。本文使用下采样(Undersampling)平衡正负样本,并用逻辑回归建模,最后通过调整分类阈值提升欺诈交易的召回率。本文通过一个完整的代码实例,展示了信用卡欺诈检测的完整流程:数据标准化与清洗—>下采样处理类别不平衡—>交叉验证

信用卡欺诈检测是典型的类别极不平衡问题:正常交易(负样本)远多于欺诈交易(正样本)。如果直接用原始数据训练,模型会偏向多数类,导致召回率(Recall)很低。本文采用 SMOTE 过采样 技术生成少数类(欺诈)的新样本,使正负样本数量平衡,再使用逻辑回归建模,并通过交叉验证选择最佳正则化参数,最终评估模型性能。如果对该项目有兴趣但是没有了解的读者,可以先观看博主关于逻辑回归下采样的文章。【机器学习

在机器学习中,分类问题是最常见的任务之一。比如根据病人的各项指标判断病情等级、根据用户行为预测会员等级等。本文使用一个已经预处理好的多分类数据集(标签为 0、1、2、3),分别用 7 种经典的分类算法进行建模,并对比它们在测试集上的表现。本文以众数填充为例子。每个文件的第一列是标签(y),后面的列是特征(x)

作用:导入 PyTorch 核心库,所有深度学习操作的基础。类比:就像写作文要先拿笔,torch就是深度学习的 “笔”。作用:导入 PyTorch 的神经网络模块(Neural Network)。核心功能:提供搭建 CNN、全连接层、卷积层等所有网络层的工具。关键:我们搭建的所有 AI 模型,都依赖这个模块。作用:数据加载器,批量管理数据集。通俗理解:把大量图片打包成 “小包裹”,一次性喂给电脑,

import cv2。

将答题卡区域拉正为矩形,转为灰度图,然后使用 OTSU 自动阈值二值化,并反转(BINARY_INV),使选项涂黑区域变为白色(方便统计白色像素),背景为黑色。检测所有外层轮廓,绘制出来,同时按面积从大到小排序,遍历轮廓,用多边形近似,找到第一个近似为四边形(4 个顶点)的轮廓,即为答题卡外框。遍历每 5 个轮廓(即一道题),对这 5 个轮廓按从左到右排序,对每个选项创建掩码,与二值图做按位与,统

import cv2cv2.VideoCapture:创建一个视频捕获对象,参数可以是视频文件路径或摄像头设备号(0 表示默认摄像头)。这里指定了 ‘test.avi’,表示读取本地视频文件。定义了一个 十字形结构内核,尺寸为 3×3。这个内核将用于形态学操作(开运算)。十字形结构适合处理细长的噪声或连接断裂的前景区域。

import cv2。








