logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型训练-训练数据量与训练周期(epoch)的关系

本文总结了不同数据量下的训练周期推荐。对于1k-5k的小数据集,建议1-3个epoch(全参)或3-10个(LoRA),需采用早停机制防过拟合。5k-20k中等规模数据可适当增加epoch至2-5(全参)或5-10(LoRA)。超过20k的大数据集,1-3个epoch(全参)或2-5个(LoRA)即可,避免过拟合且迭代收益有限。核心原则是根据数据规模调整训练轮次,大数据集快速迭代,小数据集谨慎训练

#人工智能#机器学习#深度学习
Python|flash_attn 安装方法

对于flash_attn对应的cxx11abiFALSE还是cxx11abiTRUE,使用如下方式判断。

#深度学习
开源BI工具3:dataease

开源BI工具3:dataease

文章图片
#开源
数据集下载渠道汇总

Hugging Face – The AI community building the future.Machine Learning Datasets | Papers With Code

基于llama_factory的qwen3全参微调

【代码】基于llama_factory的qwen3全参微调。

vllm的部署和使用

qwen2.5模型下载。

文章图片
vllm的部署和使用

qwen2.5模型下载。

文章图片
深度学习核心词汇-英文

temporal dimension 时间维度spatial dimension 空间维度

文章图片
#深度学习#人工智能#神经网络
    共 36 条
  • 1
  • 2
  • 3
  • 4
  • 请选择