
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
基础层:吃透环境配置、变量类型、基本语法,这是 “不踩坑” 的前提;工具层:熟练用函数、类、模块,让代码从 “能跑” 变成 “好维护”;效率层:理解并发原理、异常处理,应对大数据量和复杂场景;实战层:结合具体问题(比如用pandas做数据分析),把基础和应用串起来。Python 大数据的核心不是记住多少语法,而是理解 “数据怎么进、怎么处理、怎么出” 的逻辑。踩过的坑、优化过的代码,最终都会变成处
爬得多了才明白,爬虫的核心不是 “怎么爬”,而是 “该爬什么”。有些网站的robots.txt明确禁止抓取,硬闯不仅不道德,还可能违法;用户隐私、付费内容更是碰不得。
在集成学习中,个体学习器的准确率和彼此之间的差异性都至关重要。
一种将高维矩阵表示为三个低维矩阵乘积的矩阵分解方法A(N×p)=U(N×N)Σ(N×p)V(p×p)T\boldsymbol{A}_{(N\times p)}=\boldsymbol{U}_{(N \times N)}\boldsymbol{\Sigma}_{(N\times p)}\boldsymbol{V}_{(p \times p)}^TA(N×p)=U(N×N)Σ(N×p)V(p×p
相关关系:变量之间存在的一种非确定的依存关系因果关系:一个变量的变化导致另一个变量的变化,是一种单向关系。
聚类:基于特定的距离或相似度度量,将数据集划分为k个子集合Ck,又称为簇簇有和两个描述指标质心m:簇内样本的平均值mini1xi∈Ci∑xi半径r:半径为簇内所有样本到质心距离的均方差的平方根rini∑xi∈Cixi−mi2。
一种将高维矩阵表示为三个低维矩阵乘积的矩阵分解方法A(N×p)=U(N×N)Σ(N×p)V(p×p)T\boldsymbol{A}_{(N\times p)}=\boldsymbol{U}_{(N \times N)}\boldsymbol{\Sigma}_{(N\times p)}\boldsymbol{V}_{(p \times p)}^TA(N×p)=U(N×N)Σ(N×p)V(p×p
项i:事务数据库TDB中的基本元素或对象项集I:项的集合事务T:事务数据库中每条数据都是一条事务关联规则:形如A⇒Bsupportconfidence的蕴涵式,表示A发生时,B也跟着发生的规律。其中A、B是包含于I,不相交的两个非空项集支持度:表示关联规则的频繁程度supA⇒BPA∪B支持度也被称为,而出现频度,即被称为或置信度:表示关联规则的可靠程度confA⇒BPB∣AsupAsupA∪B







