logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

TypeError: __init__() got an unexpected keyword argument ‘max_len‘

【代码】TypeError: __init__() got an unexpected keyword argument ‘max_len‘

#python#bert
自然语言处理-文本表示-one-hot-编码

如何通过向量化的方式表示单词 ①、采用独热编码的方式,对词汇进行编码如何表示句子 ②、Boolean vector:先对句子进行分词,然后按照词典中的向量对句子中的词汇是否出现,进行编码。该方法的缺点:只记录了句子中的词汇是否出现,并没有记录词汇出现的次数,也没有考虑到一个单词的重要性。 ③、Count vector:先对句子进行分词,然后按照字典中的向量对句子中的词汇出现次数进行编码。 ④、TF

#自然语言处理#python
机器学习-线性回归求解-从目标函数到最小二乘法

图1为线性回归目标函数求解图2,3,为线性回归求解,最小二乘法推导

#机器学习
自然语言处理-文本处理-单词纠错-选择最好的候选词汇

本篇文章基于上一篇 自然语言处理-文本处理-单词改写实现。前一篇主要写了一点有关根据单词编辑距离来计算相似单词集合的问题。下面开始通过概率模型来从相似单词集合中寻找到最有可能的单词。例如:当用户输入单词officr的时候,我们候选词集合中右office和official,但是通过计算,可能会发现office的可能性更大一些。例:假设用户输入错误的字符串为source_word : s,我们需要找到

#自然语言处理
自然语言处理-词向量表示

上一篇文章:自然语言处理-文本表示-one-hot-编码 中讲了 文本独热编码的表示方法。对该篇文章中的计算结果进行文本相似度的计算。计算方法参考这篇文章:自然语言处理-文本相似度计算计算词汇之间得欧式距离得:根号2计算余弦相似度得:0可见通过one hot编码得到的词汇向量是无法通过欧氏距离和余弦相似度来评估文本的相似度的。原因是由于one hot编码得到的举证为稀疏矩阵,0较多。解决方案:采用

#自然语言处理
到底了