logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型总体训练框架

大模型训练流程分为三个阶段:预训练(Pretrain)基于海量无标注数据学习语言规律和世界知识;指令微调(SFT)使用人类标注数据教会模型对话能力;对齐阶段(RLHF)通过强化学习确保输出符合人类价值观。LoRA作为参数高效微调技术,可应用于SFT和RLHF阶段以节省资源。

文章图片
#人工智能#深度学习#机器学习 +1
Qwen2.5-VL研究_待完善...

Qwen-2.5VL多模态大模型,模块介绍

文章图片
#人工智能#深度学习#学习 +1
从零开始的模型训练(CIFAR10分类)

本文介绍了使用PyTorch构建CIFAR10分类模型的过程。作者最初尝试融合VGG16架构,但效果不佳,最终采用ResNet-18进行微调。模型通过修改输入卷积层和全连接层适配CIFAR10数据集,使用SGD优化器配合余弦退火学习率调度,在100个epoch内完成训练。训练过程使用了数据增强技术,并通过TensorBoard进行可视化监控。完整代码包括自定义的SmallResnet模型和训练脚本

文章图片
#分类#人工智能#python +1
强化学习基本概念~随时更新补充

本文梳理了强化学习的基本概念框架,主要包括三个部分:1)核心要素定义(状态/观测、动作、奖励、策略等);2)随机性来源分析(动作选择和状态转移);3)价值函数体系(动作价值函数Q和状态价值函数V)。文章通过知乎专栏和GitHub资料,结合具体示例说明了强化学习的交互流程和核心数学原理,包括马尔可夫性质、蒙特卡洛估计等。最后指出强化学习的优化目标是通过逼近Q和V函数,找到最优动作序列以获得最大累积奖

文章图片
#人工智能#学习
深度理解-DiT

Diffusion模型通过前向扩散和反向去噪过程实现图像生成。前向过程逐步添加高斯噪声破坏图像,反向过程则通过U-Net预测并去除噪声重建图像。DiT(Diffusion Transformer)研究表明Transformer可替代U-Net,提供更好扩展性。

文章图片
#学习#算法#深度学习 +1
Qwen2.5-VL研究_待完善...

Qwen-2.5VL多模态大模型,模块介绍

文章图片
#人工智能#深度学习#学习 +1
Qwen2.5-VL研究_待完善...

Qwen-2.5VL多模态大模型,模块介绍

文章图片
#人工智能#深度学习#学习 +1
从零开始的模型训练(CIFAR10分类)

本文介绍了使用PyTorch构建CIFAR10分类模型的过程。作者最初尝试融合VGG16架构,但效果不佳,最终采用ResNet-18进行微调。模型通过修改输入卷积层和全连接层适配CIFAR10数据集,使用SGD优化器配合余弦退火学习率调度,在100个epoch内完成训练。训练过程使用了数据增强技术,并通过TensorBoard进行可视化监控。完整代码包括自定义的SmallResnet模型和训练脚本

文章图片
#分类#人工智能#python +1
VAD代码(1)

如果配置文件里有,train.py 会自动导入你指定的插件目录(如),以便支持自定义的模型、头、损失等。

文章图片
#论文阅读#自动驾驶#学习 +1
强化学习基本概念~随时更新补充

本文梳理了强化学习的基本概念框架,主要包括三个部分:1)核心要素定义(状态/观测、动作、奖励、策略等);2)随机性来源分析(动作选择和状态转移);3)价值函数体系(动作价值函数Q和状态价值函数V)。文章通过知乎专栏和GitHub资料,结合具体示例说明了强化学习的交互流程和核心数学原理,包括马尔可夫性质、蒙特卡洛估计等。最后指出强化学习的优化目标是通过逼近Q和V函数,找到最优动作序列以获得最大累积奖

文章图片
#人工智能#学习
到底了