logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

R数据挖掘 第三篇:聚类的评估(簇数确定和轮廓系数)和可视化

在实际的聚类应用中,通常使用k-均值和k-中心化算法来进行聚类分析,这两种算法都需要输入簇数,为了保证聚类的质量,应该首先确定最佳的簇数,并使用轮廓系数来评估聚类的结果。一,k-均值法确定最佳的簇数通常情况下,使用肘方法(elbow)以确定聚类的最佳的簇数,肘方法之所以是有效的,是基于以下观察:增加簇数有助于降低每个簇的簇内方差之和,给定k>0,计算簇内方差和var(k),...

#人工智能#r语言#数据结构与算法
The transaction log for database 'tempdb' is full due to 'ACTIVE_TRANSACTION'

今天早上,Dev跟我说,执行query statement时出现一个error,detail info是:“The transaction log for database 'tempdb' is full due to 'ACTIVE_TRANSACTION'”错误信息提示:由于活动事务太长,使得 tempdb 的 transaction log file 空间用尽。一般情...

#数据库
数据分析 第四篇:相关分析

相关分析是数据分析的一个基本方法,可以用于发现不同变量之间的关联性,关联是指数据之间变化的相似性,这可以通过相关系数来描述。发现相关性可以帮助你预测未来,而发现因果关系意味着你可以改变世界。一,协方差和相关系数如果随机变量X和Y是相互独立的,那么协方差Cov(X,Y) =E{ [X-E(X)] [Y-E(Y)] } = 0,这意味着当协方差Cov(X,Y)不等于 0...

#人工智能
spaCy 第二篇:语言模型

spaCy处理文本的过程是模块化的,当调用nlp处理文本时,spaCy首先将文本标记化以生成Doc对象,然后,依次在几个不同的组件中处理Doc,这也称为处理管道。语言模型默认的处理管道依次是:tagger、parser、ner等,每个管道组件返回已处理的Doc,然后将其传递给下一个组件。一,加载语言模型spaCy使用的语言模型是预先训练的统计模型,能够预测语言特征,对于英语,...

#人工智能#python
spaCy 第二篇:语言模型

spaCy处理文本的过程是模块化的,当调用nlp处理文本时,spaCy首先将文本标记化以生成Doc对象,然后,依次在几个不同的组件中处理Doc,这也称为处理管道。语言模型默认的处理管道依次是:tagger、parser、ner等,每个管道组件返回已处理的Doc,然后将其传递给下一个组件。一,加载语言模型spaCy使用的语言模型是预先训练的统计模型,能够预测语言特征,对于英语,...

#人工智能#python
把Excel的数据导入到数据库

将Excel作为数据源,将数据导入数据库,是SSIS的一个简单的应用,下图是示例Excel,数据列是code和name第一部分,Excel中的数据类型是数值类型1,使用SSDT创建一个package,创建Excel data source component,SSDT会在Connection Managers中创建一个Excel的connection由于示例Excel的首...

#数据库
数据分析 第一篇:数据质量分析(值分析)

数据质量通常是指数据值的质量,包括准确性、完整性和一致性。数据的准确性是指数据不包含错误或异常值、完整性是指数据不包含缺失值、一致性是数据在各个数据源中都是相同的。广义的数据质量还包括数据整体的有效性,例如,数据整体是否是可信的、数据的取样是否合理等。本文的数据质量分析,是指对原始数据值的质量进行分析,以检查数据的质量。没有可信的数据,数据分析将是空中楼阁,因此,数据分析的前提就是要保证...

#数据库#人工智能#r语言
到底了