logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

pytorchlighting报错:raise RuntimeError(“Distributed package doesn‘t have NCCL “RuntimeError: Distribu

1、该问题的主要原因是windows环境不支持NCCL,所以最好不要使用ddp##源代码:trainer = Trainer(gpus=[0],distributed_backend="ddp")##修改后的代码:trainer = Trainer(gpus=[0])anz

老张API:一站式AI能力接入平台,让大模型调用更简单

最近发现了个大模型调用平台不错,试试吧!

#python
sglang快速启动Qwen大模型

摘要:该命令使用Docker运行一个名为"sft"的容器,配置了8GB共享内存和指定GPU设备。容器映射8000端口,挂载模型目录,并基于sglang镜像启动Python服务器。服务器参数包括模型路径、主机地址、服务名称、端口号等,启用了FlashAttention推理后端、请求日志和性能监控功能,同时设置了静态内存占比为85%。该配置适用于高性能模型推理服务部署。

#算法#人工智能
大模型蒸馏算法代码

本文介绍了一个基于HuggingFace Transformers的语言模型蒸馏实现方案。该方案通过教师模型指导学生模型训练,结合交叉熵损失和KL散度损失进行知识蒸馏。核心改进包括:1) 采用静态填充(padding="max_length")处理Alpaca格式数据集;2) 使用functools.partial优化预处理函数参数传递;3) 完善了prompt-respons

#算法#python#深度学习
sglang快速启动Qwen大模型

摘要:该命令使用Docker运行一个名为"sft"的容器,配置了8GB共享内存和指定GPU设备。容器映射8000端口,挂载模型目录,并基于sglang镜像启动Python服务器。服务器参数包括模型路径、主机地址、服务名称、端口号等,启用了FlashAttention推理后端、请求日志和性能监控功能,同时设置了静态内存占比为85%。该配置适用于高性能模型推理服务部署。

#算法#人工智能
大模型蒸馏算法代码

本文介绍了一个基于HuggingFace Transformers的语言模型蒸馏实现方案。该方案通过教师模型指导学生模型训练,结合交叉熵损失和KL散度损失进行知识蒸馏。核心改进包括:1) 采用静态填充(padding="max_length")处理Alpaca格式数据集;2) 使用functools.partial优化预处理函数参数传递;3) 完善了prompt-respons

#算法#python#深度学习
老张API:一站式AI能力接入平台,让大模型调用更简单

最近发现了个大模型调用平台不错,试试吧!

#python
    共 30 条
  • 1
  • 2
  • 3
  • 请选择