logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

pyspark执行group by操作

pyspark执行group by操作。

#spark
pyspark中list转换dataframe

通过pandas来做转换。

#spark
安装openai环境 步骤及问题解决

安装openai环境,使用大模型。解决报错:ERROR: No matching distribution found for pandas>=1.2.3、 解决报错AttributeError:module 'openai' has no attribute'Chatcompletion'

文章图片
#人工智能#nlp#算法
pyspark中DataFrame之间的join操作

在pyspark中加载sql之后,会经常遇到各DataFrame之间的join操作,以下给出集中join的调用方式。

#spark#大数据
pyspark 版本适配问题

Exception: Python in worker has different version 2.7 than that in driver 3.8,PySpark cannot run with different minor versions.Please check environment variables PYSPARK_PYTHON and PYPySpark cannot ru

hive中json格式字段解析及map使用

如果hive表中有扩展字段,那么扩展字段格式最常见的就是json格式,所以如何解析json字符串相对繁琐(虽然没啥技术????)用到的hive功能函数有:get_json_object、explode、split、regexp_replace、regexp_extract-- json字段样式:[{'a':1, 'b':2}, {'a':3, 'b':4}], 字段名称为json_strselec

#hive#json#hadoop
报错提示:wandb.errors.error.UsageError: api_key not configured (no-tty)

wandb是什么wandb是Weights & Biases的缩写,这款工具能够帮助跟踪你的机器学习项目。 它能够自动记录模型训练过程中的超参数和输出指标,然后可视化和比较结果,并快速与同事共享结果。怎么解决使用github账号登录https://wandb.ai/authorize,然后创建完之后,会有一个码,在终端使用wandb init,然后输入刚才的码(注意当你输入码的时候,不可见

#算法
【pytorch报错】If you tried to load a PyTorch model from a TF 2.0 checkpoint, please set from_tf=True

说来解决办法有点水,参考之前有效的机器,发现torch的版本是1.11,后来将原始版本升级到1.11。加载torch的huggingface的bin模型,未使用复杂处理逻辑,但是出现异常,详细报错内容。发现机器上并没有安装TF。...

#pytorch#tensorflow#深度学习
评价指标BLUE了解

BLEU指标根据生成的句子与人工参考句子之间的词、短语和n-gram匹配来计算模型的性能。因此,实际中通常使用bleu-1,bleu-2,bleu-3和bleu-4等四个BLEU指标来计算短语匹配的精度。然而,它存在着一些缺点,比如可能会倾向于短而不是长的句子,不能很好地衡量语法和语义问题,因此,通常需要结合其他评估指标一起使用来评估模型性能。BLEU指标具有较好的可解释性,直接基于n-gram重

#人工智能#机器翻译
那些和名字无关的python模块安装

Python import未安装的模块时,会报错ImportError: No module named XXX。大部分情况直接pip install XXX 即可,但是万事无绝对,有些模块名字和安装包并非一致。现整理遇到的一些特殊情况,供大家参考,也欢迎补充~模块名安装命令builtinspip install futureMySQLdbpip install mysql-pythonclogh

#python
到底了