logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Python数据分析 | (26) 合并数据集

pandas对象中的数据可以通过一些方式进行合并:pandas.merge可根据一个或多个键将不同DataFrame中的行连接起来。SQL或其他关系型数据库的用户对此应该会比较熟悉,因为它实现的就 是数据库的join操作。pandas.concat可以沿着一条轴将多个对象堆叠到一起。实例方法combine_first可以将重复数据拼接在一起,用一个对象中的值填充另一个对象中的缺失值。...

Python数据分析 | (23) 数据转换

本章到目前为止介绍的都是数据的重排。另一类重要操作则是过滤、清理以及其他的转换工作。目录1. 移除重复数据2. 利用函数或映射进行数据转换3. 替换值4. 重命名轴索引5. 离散化和面元划分6. 检测和过滤异常值7. 排列和随机采样8. 计算指标/哑变量1. 移除重复数据DataFrame中出现重复行有多种原因。下面就是一个例子:data = pd...

机器学习 | 台大林轩田机器学习技法课程笔记5 --- Kernel Logistic Regression

上节课我们主要介绍了Soft-Margin SVM,即如果允许有分类错误的点存在,那么在原来的Hard-Margin SVM中添加新的惩罚因子C,修正原来的公式,得到新的值。最终得到的有个上界,上界就是C。Soft-Margin SVM权衡了large-margin和error point之前的关系,目的是在尽可能犯更少错误的前提下,得到最大分类边界。本节课将把Soft-Margin SVM和我们

#机器学习
自监督学习 | (1) Self-supervised Learning入门

原文地址本文通过整理自监督学习的一系列工作,把主流方法分成三大类,方便大家更全面的了解自监督学习的定义、方法、用途。学习的范式我们首先来回顾下机器学习中两种基本的学习范式,如图所示,一种是监督学习,一种是无监督学习(林轩田课程中把机器学习范式分为监督学习、半监督学习、无监督学习以及强化学习)。监督学习利用大量的标注数据来训练模型,模型的预测和数据的真实标签产生损失后进行反向传播(计算梯度...

Linux杂谈 | (10) 命令行光标移动常用快捷键

本文涉及在linux命令行下进行快速移动光标、命令编辑、编辑后执行历史命令、Bang(!)命令、控制命令等。让basher更有效率。说明:ctrl + k:先按住ctrl不动,再按k;Alt + k:先按住Alt不动,再按k;Esc + k:先单击Esc,再按k。1. 常用命令ctrl+左右键:在单词之间跳转ctrl+a:跳到本行的行首ctrl+e:跳到行尾ctrl+u:删...

对话系统 | (3) 阿里云小蜜对话机器人背后的核心算法

原文地址分享嘉宾:唐呈光 阿里巴巴 算法专家编辑整理:刘汝洲内容来源:阿里小蜜 & DataFun AI Talk出品社区:DataFun阿里小蜜智能对话开发平台是智能服务事业部推出的面向各行各业的对话构建平台,此次分享将结合平台,对小样本下的语言理解、用户模拟器和基于模型的对话管理的算法研究和落地进行介绍。文章目录对话系统简介自然语言理解平台视角下的对话管理对话管理成功的三要素:基于 T

林轩田机器学习 | 机器学习技法课程笔记10 --- Random Forest

上节课我们主要介绍了Decision Tree模型。Decision Tree算法的核心是通过递归的方式,将数据集不断进行切割,得到子分支,最终形成树的结构。C&RT算法是决策树比较简单和常用的一种算法,其切割的标准是根据纯度来进行,每次切割都是为了让 分支内部纯度最大。最终,决策树不同的分支得到不同的 (即树的叶子,C&RT 算法中, 是常数)。本节课将介绍随机森林(Random

自然语言处理 | (28) Transformer详解2

原文地址目录1. 前言2. Transformer总体架构3. 各个技术细节4. 总结5. 参考资料1. 前言注意力机制的原理是计算query和每个key之间的相似性以获得注意力分配权重。在大部分NLP任务中,key一般也是value(basic Attention)。注意力机制一般是用于提升seq2seq或者encoder-decoder架构的表现。但这篇20...

自然语言处理 | (7)中文文本基本任务与处理

目录1.分词 2.停用词与N-gram3.词性标注、依赖分析、NER、关键词抽取4.jieba工具库使用 1.分词关于分词方法和工具库更多内容可以参考知乎讨论有哪些比较好的中文分词方案中文分词与之前的英文分词(一般以空格分隔)相比更加复杂,词和词紧密连接,需要考虑语境和词义等信息。 2.停用词与N-gram停用词中文当中常用到的停用词词表可以参...

#中文分词
机器学习 | 吴恩达机器学习第九周学习笔记

课程视频课程PPT    下载密码:95wq上周主要讲解经典的无监督聚类算法k-means,包括k-means的优化目标,原理以及一些参数设置细节;和降维算法PCA的原理,目标,问题规划以及应用等问题;本周将继续学习机器学习的应用--异常检测和推荐系统,包括高斯分布,开发和评估异常检测系统、多元高斯分布,异常检测算法的应用以及推荐算法(协同过滤)的原理和应用。 目录一、异常检测...

    共 87 条
  • 1
  • 2
  • 3
  • 9
  • 请选择