
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
机器学习(Machine Learning) 是关于计算机基于数据构建概率统计模型并运用模型对数据进行预测与分析的一门学科。以计算机和网络为平台以数据为研究对象以预测和分析数据为目的以方法为中心是多领域的交叉学科得到一个有限的训练数据集合确定学习模型的集合--------------------------模型确定模型选择的准则--------------------------策略实现求解最优模

术语解释Skip-gram用中心词预测上下文词的模型CBOW用上下文词预测中心词的模型在整个词表上归一化的 softmax,计算昂贵只对K1K+1K1个词做二分类的高效近似SGD每步随机采样一个窗口更新参数共现矩阵统计词对在窗口内同时出现次数的矩阵SVD对共现矩阵降维获得词向量GloVe结合全局统计和局部上下文的词向量模型fXijf(X_{ij})fXijGloVe 的权重函数,控制不同频率共现
维度规则方法统计方法神经网络大语言模型 (LLM)核心原理手工规则 + 形式逻辑概率统计 + 数据驱动分布式表示 + 深度学习大规模预训练 + 人类对齐知识表示符号组合稀疏统计特征稠密向量 / 上下文表示上下文嵌入 / 思维链 / 工具使用泛化能力极弱(有限领域)有限(N-gram 窗口)强(预训练迁移)极强(零样本/少样本/涌现)数据需求专家规则标注语料海量文本互联网级语料 + 人类偏好关键局限
本文介绍了k近邻法(k-NN)的基本概念及其核心要素。k-NN是一种基于实例的分类与回归方法,通过计算新实例与训练集中最近k个实例的距离,采用多数表决(分类)或均值计算(回归)进行预测。文章详细阐述了k-NN的三要素:距离度量(如欧式距离、曼哈顿距离)、k值选择对模型复杂度的影响,以及分类决策规则(多数表决)。此外,还介绍了kd树的构建方法,用于高效存储和检索训练数据,以减少计算开销。最后,通过误
感知机模型摘要 感知机是一种二类分类线性模型,通过分离超平面将特征空间中的实例划分为正负两类。其模型定义为f(x)=sign(wx+b),其中w为权值向量,b为偏置项。感知机要求数据集线性可分,即存在超平面能完全正确划分数据。学习策略采用误分类驱动,损失函数定义为误分类点到超平面的距离之和。算法通过梯度下降优化,包括批量、随机和小批量梯度下降三种形式。原始形式采用随机梯度下降,每次选取一个误分类点
机器学习(Machine Learning) 是关于计算机基于数据构建概率统计模型并运用模型对数据进行预测与分析的一门学科。以计算机和网络为平台以数据为研究对象以预测和分析数据为目的以方法为中心是多领域的交叉学科得到一个有限的训练数据集合确定学习模型的集合--------------------------模型确定模型选择的准则--------------------------策略实现求解最优模








