
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
你说你用到了Spark那你介绍一下Spark的组件和整体架构(结合Dirver 和 Executor各自的作用)介绍一下Spark的RDD(分布式弹性数据集、基本的数据抽象、封装了计算逻辑、RDD代码层面包含的东西即RDD的属性、有了RDD的依赖就可以生成DAG图)

分词就是将连续的字序列按照一定的规范重新组合成词序列的过程。我们知道,在英文的行文中,单词之间是以空格作为自然分界符的,而中文只是字、句和段能通过明显的分界符来简单划界,唯独词没有一个形式上的分界符,分词过程就是找到这样分界符的过程.命名实体通常我们将人名,地名,机构名等专有名词统称命名实体.如周杰伦,黑山县,孔子学院,24辊方钢矫直机.顾名思义,命名实体识别(NamedEntityRecogni
XGBoost(Extreme Gradient Boosting)全名叫极端梯度提升树,XGBoost是集成学习方法的王牌,在Kaggle数据挖掘比赛中,大部分获胜者用了XGBoost。XGBoost在绝大多数的回归和分类问题上表现的十分顶尖,本节将较详细的介绍XGBoost的算法原理。我们在前面已经知道,构建最优模型的一般方法是最小化训练数据的损失函数。我们用字母 L表示损失,如下式:式(1.
LangChain 是一个构建大模型应用的框架。多轮对话知识库问答(RAG)Agent 自动调用工具多模型编排Prompt 模板管理记忆管理👉 代码会迅速变得混乱。LangChain 的作用就是:🧠 把 LLM 应用拆成模块化组件,让你像搭积木一样构建 AI 系统。
LangGraph是 LangChain 推出的一个用于构建可控、多步骤、可循环的 AI Agent 框架。LangGraph = 用“状态机 + 图结构”来控制大模型执行流程。
一、集成学习算法简介1. 什么是集成学习2 复习:机器学习的两个核心任务3. 集成学习中boosting和Bagging4. 小结二、Bagging和随机森林1. Bagging集成原理2. 随机森林构造过程3. 包外估计 (Out-of-Bag Estimate)3.1 包外估计的定义3.2 包外估计的用途4. 随机森林api介绍5. 随机森林预测案例6. bagging集成优点7. 小结...
大规模数据集是成功应用深度神经网络的前提。例如,我们可以对图像进行不同方式的裁剪,使感兴趣的物体出现在不同位置,从而减轻模型对物体出现位置的依赖性。我们也可以调整亮度、色彩等因素来降低模型对色彩的敏感度。可以说,在当年AlexNet的成功中,图像增强技术功不可没。图像增强(image augmentation)指通过剪切、旋转/反射/翻转变换、缩放变换、平移变换、尺度变换、对比度变换、噪声扰动、颜
使用手写数字的MNIST数据集如上图所示,该数据集包含60,000个用于训练的样本和10,000个用于测试的样本,图像是固定大小(28x28像素),其值为0到255。整个案例的实现流程是:首先要导入所需的工具包:1. 数据加载首先加载手写数字图像结果为:数据展示:效果如下所示:神经网络中的每个训练样本是一个向量,因此需要对输入进行重塑,使每个28x28的图像成为一个的784维向量。另外,将输入数据
EM算法也称期望最大化(Expectation-Maximum,简称EM)算法。它是一个基础算法,是很多机器学习领域算法的基础,比如隐式马尔科夫算法(HMM)等等。EM算法是一种迭代优化策略,由于它的计算方法中每一次迭代都分两步,所以算法被称为EM算法(Expectation-Maximization Algorithm)。EM算法受到缺失思想影响,最初是为了解决数据缺失情况下的参数估计问题,其算
在R-CNN和Fast RCNN的基础上,在2016年提出了Faster RCNN网络模型,在结构上,Faster RCNN已经将候选区域的生成,特征提取,目标分类及目标框的回归都整合在了一个网络中,综合性能有较大提高,在检测速度方面尤为明显。接下来我们给大家详细介绍fasterRCNN网络模型。网络基本结构如下图所示:Faster RCNN可以看成是区域生成网络(RPN)与Fast RCNN的组







