
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
模型微调过程会使用CPU,且占用内存大概22G左右;参照官方文档:https://github.com/QwenLM/Qwen/blob/main/README_CN.md。创建环境,建议单独创建一个新环境,避免与现有环境冲突,创建后要先安装pytorch,再安装项目依赖模块。提前安装好git跟git lfs,否则可能拉取不到模型文件,git lfs主要用于大文件拉取。项目文件以及环境安装好后,继

【代码】spark连接mongodb。
当本地训练的python环境与 Spark 集群其他节点环境不一致时,核心解决方案是:将本地 Python 虚拟环境打包为压缩包,通过 Spark 的–archives参数分发到所有 Executor 节点,强制所有节点使用统一的环境(Python 解释器 + 依赖包)环境打包:将本地虚拟环境(含 Python 解释器、所有依赖包如scikit-learn、pyarrow、自定义类脚本)压缩为归档
将所有节点挂载同一个网络存储,代码中指向挂载点(例如 /mnt/data/train.csv)有一份csv数据在当前节点的本地路径上,本地模式跑可以通过:file://+本地路径正常读取。这是生产环境最标准的方式,将数据上传到HDFS上,让所有节点通过同一地址访问得到该数据;2、无权限上传hdfs时,使用 --files + SparkFiles.get()1、使用HDFS路径,将数据上传到hdf
【代码】Spark Executor 与 Driver 在三种模式下的区别。
3、创建专门的环境变量文件,配置文件。1、创建新用户,授予sudo权限。2、创建文件目录,上传解压文件。5、将文件目录授权给指定用户。6、检查主要组件是否安装完成。
在 PySpark 中,UDF(User-Defined Function,用户自定义函数) 是扩展 Spark 功能的核心工具,用于处理内置函数(如pyspark.sql.functions中的函数)无法覆盖的自定义逻辑(如复杂字符串处理、自定义数值计算、多列联动计算等)。仅当内置函数无法满足需求时才用 UDF。Pandas UDF(Vectorized UDF):基于Apache Arrow批
【代码】spark连接mongodb。
Spark部署模式主要有4种:Local模式(单机模式)、Standalone模式(使用Spark自带的简单集群管理器)、Spark On Yarn模式(使用YARN作为集群管理器)和Spark On Mesos模式(使用Mesos作为集群管理器)。下面介绍Local模式(单机模式)、跟Spark On Yarn模式(使用YARN作为集群管理器)的简单部署。spark on local模式以及sp

当遇到一些复杂特殊的计算场景时,只通过pyspark的内置函数无法达到我们想要实现的效果,此时,可通过自定义函数然后注册为UDF函数,就能够很好的解决复杂计算场景问题,且计算效率非常快速。计算5000多万数据,仅需一分钟不到,效率非常高。








