
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
摘要 流机器学习(SML)针对现实世界中数据分布随时间演化的问题,通过动态检测和适应数据漂移(Data Drift)或概念漂移(Concept Drift)来更新模型。数据漂移指输入分布$P(X)$变化但不影响$P(y|X)$,而概念漂移则涉及$P(y|X)$的改变。SML通过顺序处理数据流,在检测到漂移时训练新模型并替换旧模型,确保模型持续有效。与异常检测不同,概念漂移关注模型对新数据的适用性,

需要对n个元素进行聚类,使用k作为分类数量, 需要使用距离函数distance fucntion来确定元素之间的距离 pairwise distance.K-means算法使用迭代的方法进行逐步优化分类, 最终在分类稳定或者stopping cretiera处停止.Kmeans方法1. 在变量空间\mathbb{R}^n中设置k个初始聚类中心,2.计算每个元素到各个聚类中心的距离,3. 将每个元素
在模型训练过程中,可能模型已经发生了过拟合,但过拟合的模型参数恰好能够拟合的模型的测试集。此时测试集和训练集的损失可能表现的比较平稳且接近,其难以通过测试集的损失和验证集的损失来观察到模型已经发生了过拟合,在真实场景下,模型可能表现不佳。因此我们需要使用一部分数据来进行测试和验证,除了测试集之外,我们可以引入验证集。

对于1个分类问题,不论其是二分类问题还是多分类问题,或者是多标签分类问题(1个样本可以有多个类别),都可以对其判定结果进行统计,以类别为单位统计其各个指标,来衡量模型对该类别的预测情况。基于对某个分类的4种分类判别情况,引出了精确率、召回率、准确率和F1 Score的评价指标。

决策树是属于用树的形式,在树的每一个内部节点上使用1个划分标准,对在该节点上待划分的样本进行划分,划分成2个类别,2堆样本可以作为叶子节点,认为其中样本都属于某个分类,也可以继续使用另1个划分标准继续划分。

熵最初是一个热力学概念,用来衡量一个系统的混乱程度。和距离,面积等一样,都是一种度量。1948年美国数学家香农提出信息熵的概念,之后又有科学家提出了相对熵(也就是KL散度)和交叉熵的概念。

多元线性回归使用多维特征向量来推算回归值,推算方法使用以下公式y=w_0+w_1*x_1+w_2*x_2+...+w_n*x_n 其中x_i是N维特征向量第 i维的数据,w_i是特征向量第i维特征的权值, y是该特征向量的预测值。求解多元线性回归模型,即通过N维特征向量及其对应的标签真实值,求解多元线性公式参数,w_0..w_n的过程。

在模型训练过程中,可能模型已经发生了过拟合,但过拟合的模型参数恰好能够拟合的模型的测试集。此时测试集和训练集的损失可能表现的比较平稳且接近,其难以通过测试集的损失和验证集的损失来观察到模型已经发生了过拟合,在真实场景下,模型可能表现不佳。因此我们需要使用一部分数据来进行测试和验证,除了测试集之外,我们可以引入验证集。

在充分训练的情况下,机器学习模型是否能够较好地拟合训练数据,以反映真实规律,这可以被称为模型的能力,衡量这一问题的指标称为偏差。衡量训练数据中真实规律数据以外的随机扰动的指标称为噪声。衡量机器学习对训练数据的鲁棒程度这一问题的指标称为方差。

在模型训练过程中,可能模型已经发生了过拟合,但过拟合的模型参数恰好能够拟合的模型的测试集。此时测试集和训练集的损失可能表现的比较平稳且接近,其难以通过测试集的损失和验证集的损失来观察到模型已经发生了过拟合,在真实场景下,模型可能表现不佳。因此我们需要使用一部分数据来进行测试和验证,除了测试集之外,我们可以引入验证集。








