logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

LLM大模型本地部署与预训练微调

模型微调过程会使用CPU,且占用内存大概22G左右;参照官方文档:https://github.com/QwenLM/Qwen/blob/main/README_CN.md。创建环境,建议单独创建一个新环境,避免与现有环境冲突,创建后要先安装pytorch,再安装项目依赖模块。提前安装好git跟git lfs,否则可能拉取不到模型文件,git lfs主要用于大文件拉取。项目文件以及环境安装好后,继

文章图片
spark连接mongodb

【代码】spark连接mongodb。

#spark#mongodb#大数据
conda打包环境上传spark集群

当本地训练的python环境与 Spark 集群其他节点环境不一致时,核心解决方案是:将本地 Python 虚拟环境打包为压缩包,通过 Spark 的–archives参数分发到所有 Executor 节点,强制所有节点使用统一的环境(Python 解释器 + 依赖包)环境打包:将本地虚拟环境(含 Python 解释器、所有依赖包如scikit-learn、pyarrow、自定义类脚本)压缩为归档

#conda#spark#大数据
spark集群文件分发问题

将所有节点挂载同一个网络存储,代码中指向挂载点(例如 /mnt/data/train.csv)有一份csv数据在当前节点的本地路径上,本地模式跑可以通过:file://+本地路径正常读取。这是生产环境最标准的方式,将数据上传到HDFS上,让所有节点通过同一地址访问得到该数据;2、无权限上传hdfs时,使用 --files + SparkFiles.get()1、使用HDFS路径,将数据上传到hdf

#spark#大数据#分布式
Spark Executor 与 Driver 在三种模式下的区别

【代码】Spark Executor 与 Driver 在三种模式下的区别。

#spark#大数据#分布式
spark本地模式基础配置流程

3、创建专门的环境变量文件,配置文件。1、创建新用户,授予sudo权限。2、创建文件目录,上传解压文件。5、将文件目录授权给指定用户。6、检查主要组件是否安装完成。

#spark#大数据#分布式
pyspark自定义udf函数

在 PySpark 中,UDF(User-Defined Function,用户自定义函数) 是扩展 Spark 功能的核心工具,用于处理内置函数(如pyspark.sql.functions中的函数)无法覆盖的自定义逻辑(如复杂字符串处理、自定义数值计算、多列联动计算等)。仅当内置函数无法满足需求时才用 UDF。Pandas UDF(Vectorized UDF):基于Apache Arrow批

#python#spark
spark连接mongodb

【代码】spark连接mongodb。

#spark#mongodb#大数据
Linux(centos7)部署spark

Spark部署模式主要有4种:Local模式(单机模式)、Standalone模式(使用Spark自带的简单集群管理器)、Spark On Yarn模式(使用YARN作为集群管理器)和Spark On Mesos模式(使用Mesos作为集群管理器)。下面介绍Local模式(单机模式)、跟Spark On Yarn模式(使用YARN作为集群管理器)的简单部署。spark on local模式以及sp

文章图片
#linux#spark#运维 +2
pyspark自定义UDF函数

当遇到一些复杂特殊的计算场景时,只通过pyspark的内置函数无法达到我们想要实现的效果,此时,可通过自定义函数然后注册为UDF函数,就能够很好的解决复杂计算场景问题,且计算效率非常快速。计算5000多万数据,仅需一分钟不到,效率非常高。

文章图片
#python#spark#分布式 +1
    共 25 条
  • 1
  • 2
  • 3
  • 请选择