logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【求解】pyspark中文编码问题怎么解决?

最近使用python-spark遇到一个无法解决的中文编码问题。查了网上的资料和解决方法,都无法使之解决。不知道哪位大佬可以帮忙指点一二?问题摘要,python使用UTF8编码,spark使用的是ascii编码,处理中文文件时遇到乱码问题。情形1、读取本地文件创建DataFrame时的中文编码问题#in pythonimport codecslocal_file = "a_local_file.c

【吐槽】《Practical Recommender Systems实用推荐系统》

在踩坑推荐系统的同学们,如果读过了项量的《推荐系统实践》,那么下面这本书《Practical Recommender Systems实用推荐系统》你就不要去读了。看过这么多本书,这是唯一一本让我忍不住吐槽“TMD啰嗦”的一本。寻找有用的知识点就像大海里涝针一样。知识浓度顶多一百页,竟然洋洋洒洒的写了400多页。我习惯并非常喜欢像数学一样简洁明了并富有技巧式的教科书,希望每一页都能收获惊喜。但这本书

Mac安装Spark,并使用pyspark和Jupyter写代码

在个人Mac电脑上安装并使用Spark:第一步,网站上下载最新Spark包。官网地址:https://spark.apache.org/downloads.html第二步,查看是否运行良好,是否需要安装其他工具,比如JDK。【SSH连接本地Local Shell】#cd 到安装的Spark文件夹下cd spark-3.0.0-preview2-bin-hadoop2.7#执行...

#spark
周志华《机器学习》个人笔记

这本书比较像导论性质,整体给你介绍下机器学习领域有哪些研究分支,以及这些研究分支中成熟的经典算法。这本书虽然也有算法描述,但这些算法都是实现底层机器学习算法的,如果没有编程基础或者现在主流的分布式编程的思想,想要直接自己动手据此写代码还是比较困难的。如果你想找的是直接上手coding的实践应用类的书籍,这本书可以放一放,等你先上手了再来。不是这本书难,其实它讲的东西都很简单,只是纯粹的它不是实践类

#机器学习
自训练和增量训练word2vec模型

我们希望通过自己训练业务相关的语料word2vec模型来获得词嵌入、词相关性查询等。根据自己的业务场景准备训练数据,比如用户在商城上的同购行为序列或同浏览行为序列。

文章图片
#word2vec#人工智能#机器学习
扩散模型 (Diffusion Model) 简介

Diffusion Models 的灵感来自non-equilibrium thermodynamics (非平衡热力学)。理论首先定义扩散步骤的马尔可夫链,以缓慢地将随机噪声添加到数据中,然后学习逆向扩散过程以从噪声中构造所需的数据样本。与 VAE 或流模型不同,扩散模型是通过固定过程学习,并且隐空间具有比较高的维度。总的来看,Diffusion Models 领域正处于一个百花齐放的状态,这个

文章图片
python中的类class: 继承、覆盖、重写、重载、扩展、多态、封装

python中的类class: 继承、覆盖、重写、重载、扩展、多态、封装

文章图片
#python
机器学习常用的几种损失函数

机器学习常用的几种损失函数,包括均方差损失 Mean Squared Loss、平均绝对误差损失 Mean Absolute Error Loss、Huber Loss、分位数损失 Quantile Loss、交叉熵损失函数 Cross Entropy Loss、Hinge 损失 Hinge Loss一、适用于回归的损失函数1、均方差损失 Mean Squared Error Loss均方差 Me

#机器学习
【转】知识图谱上推荐推理的模仿学习框架

///又是一篇完全看不懂的文章,泪目了。唯叹一声,道路阻且长~~~原文标题:“SIGIR 2020 | 知识图谱上推荐推理的模仿学习框架”原文地址:https://www.msra.cn/zh-cn/news/features/sigir-adac原文作者:赵康智、王希廷、谢幸编者按:尽管知识图谱推理的发展前景广阔,但在收敛性和可解释性上仍存在一定的问题。微软亚洲研究院的研究员利用一个基于元启发式

#知识图谱
    共 44 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择