
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
大模型训练-训练数据量与训练周期(epoch)的关系
本文总结了不同数据量下的训练周期推荐。对于1k-5k的小数据集,建议1-3个epoch(全参)或3-10个(LoRA),需采用早停机制防过拟合。5k-20k中等规模数据可适当增加epoch至2-5(全参)或5-10(LoRA)。超过20k的大数据集,1-3个epoch(全参)或2-5个(LoRA)即可,避免过拟合且迭代收益有限。核心原则是根据数据规模调整训练轮次,大数据集快速迭代,小数据集谨慎训练
大模型调用常用参数解析
frequency_penalty的值。
Python|flash_attn 安装方法
对于flash_attn对应的cxx11abiFALSE还是cxx11abiTRUE,使用如下方式判断。
开源BI工具3:dataease
开源BI工具3:dataease

数据集下载渠道汇总
Hugging Face – The AI community building the future.Machine Learning Datasets | Papers With Code
基于llama_factory的qwen3全参微调
【代码】基于llama_factory的qwen3全参微调。
vllm的部署和使用
qwen2.5模型下载。

vllm的部署和使用
qwen2.5模型下载。

使用anaconda 安装paddle gpu环境
使用anaconda 安装paddle gpu环境

深度学习核心词汇-英文
temporal dimension 时间维度spatial dimension 空间维度








