logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

spark之时间序列预测(商品销量预测)

本案例使用前1913天的数据作为训练数据,来预测1914天到1941天的销量。以上数据下载后放入resources/advanced下,并在properties.properties中配置一下文件名和路径,以供程序读取和处理数据。2.模型的训练及预测利用python lightgbm进行操作,见time_series.ipynb,data.7z下是spark处理好的数据。1.数据处理以及特征工程利

文章图片
#spark#大数据#分布式
关于bert+lstm+crf实体识别训练数据的构建

一.在实体识别中,bert+lstm+crf也是近来常用的方法。这里的bert可以充当固定的embedding层,也可以用来和其它模型一起训练fine-tune。大家知道输入到bert中的数据需要一定的格式,如在单个句子的前后需要加入"[CLS]"和“[SEP]”,需要mask等。构造训练集后,下载中文的预训练模型并加载相应的模型和词表vocab以参数配置,最后并利用albert抽取句子的embe

文章图片
#lstm#bert#深度学习
deepseek中文知识图谱生成

利用大模型deepseek对中文文本、图片以及pdf中的非结构化文本内容进行分析,并提取主-谓-宾(SPO)三元组的知识形式,以及将这些关系可视化为知识图谱,完整项目见。这里利用deepseek进行相关分析。

#知识图谱#人工智能#自然语言处理 +1
利用java加载macbert进行中文拼写纠错

这里利用java加载macbert模型,并进行中文拼写纠错。

文章图片
#java#人工智能
deepseek中文知识图谱生成

利用大模型deepseek对中文文本、图片以及pdf中的非结构化文本内容进行分析,并提取主-谓-宾(SPO)三元组的知识形式,以及将这些关系可视化为知识图谱,完整项目见。这里利用deepseek进行相关分析。

#知识图谱#人工智能#自然语言处理 +1
llm_security(大模型内容安全)

利用分类法和敏感词检测法对生成式大模型的输入和输出内容进行安全检测,尽早识别风险内容。使用【ServiceApplication.java】使用者可自行训练bert类相关模型,用本项目加载即可。本项目采用java, springboot实现。

#自然语言处理#人工智能
cleaning of llm corpus 大模型语料清洗

随着大规模预训练模型及相关技术不断取得突破,在相应研究中使用高效数据处理工具提升数据质量变得越来越重要。llm_corpus_quality集成了包含清洗、敏感词过滤、广告词过滤、语料质量自动评估等功能在内的多个数据处理工具与算法,为中文AI大模型提供安全可信的主流数据。ngram模型的训练见corpus_quality_process/quality_evaluation/ngram,使用方式见

#人工智能#语言模型
智慧医疗项目

本项目中的医疗数据来自。数据中一共有7类总数为4.4万的医药实体,10类总数约27万实体关系的知识图谱,具体实体以及关系的数据结构介绍见以上或者这里。搜索图谱问答相关推荐查询自动补全相关查询推荐智能诊断语音..1、本项目利用java尝试构建以疾病为中心的智慧医疗项目,并以微服务的形式提供接口服务。2、疾病相关的属性如:疾病简介、病因、预防以及治疗周期等长文本存储在elasticsearch中;其它

文章图片
#人工智能#java
利用JNI加载paddle-ocr进行ocr识别

本项目利用JNI加载paddle-ocr的C++编译后的dll库,并利用springboot进行web部署访问,效果等同于java-springboot-paddleocr。paddle-ocr c++编译的dll库以及模型(det_db:文本检测;1./ocr:返回json结果(包括识别的文字,坐标以及置信度)2./ocr/image:返回识别后绘制的图片结果。

文章图片
#paddle#java
意图识别及槽填充联合模型的改进 cnn-self-attention

1.句子token和其对应的position进行embedding。2.embedding进入几个不同size卷积核,这时是3个。将这些卷积后的特征进行拼接。4.以上2,3的输出进行拼接。5.经过一层池化后进行意图识别。原模型是用于机器翻译,这里我将稍加修改用来做问答中的slot filling和intent detection联合建模。1.使用多个size的卷积核进行多特征提取。2.加入了多头a

文章图片
#cnn#人工智能#神经网络
    共 50 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择