
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
LoRA(低阶自适应)大模型微调入门
6.3 peft 接口示例:https://huggingface.co/docs/peft/package_reference/lora。https://www.philschmid.de/fine-tune-flan-t5-peft代码实例。6.2 接口示例整合:https://huggingface.co/docs/transformers/peft。6.1 代码示例: https://gi

FAIL : Failed to load library libonnxruntime_providers_cuda.so with error: libcublasLt.so.11: cannot
安装: conda install cudatoolkit。
GQA分组注意力机制
【代码】GQA分组注意力机制。

llama-factory微调chatglm3
案例/多卡。

llama-factory-llama3微调中文数据集
基准模型测试opencompass 离线测评数据准备微调训练合并测试人工审核对比。

ollama模型CPU轻量化部署
ollama 定义环境部署demo加载本地模型方法基本指令关闭开启ollamaollama 如何同时 运行多个模型, 多进程ollama 如何分配gpu修改模型的存储路径。

PPO算法-强化学习
定义PPO 自定义模型参数解释训练时数据采集与训练。
强化学习训练-数据处理
1.模型在学习过程中出现nan。
TensorRT-llm入门
3.int8-kv-cache量化:KV Cache 量化是指将逐 Token(Decoding)生成过程中的上下文 K 和 V 中间结果进行 INT8 量化(计算时再反量化),以降低生成过程中的显存占用。最先进的量化方法,如SmoothQuant和AWQ,在量化造成的性能损失适中时,可以有效提升性能。1. 模型量化参考:https://github.com/NVIDIA/TensorRT-LLM

强化学习训练-数据处理
1.模型在学习过程中出现nan。







