
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
大模型训练流程分为三个阶段:预训练(Pretrain)基于海量无标注数据学习语言规律和世界知识;指令微调(SFT)使用人类标注数据教会模型对话能力;对齐阶段(RLHF)通过强化学习确保输出符合人类价值观。LoRA作为参数高效微调技术,可应用于SFT和RLHF阶段以节省资源。

Qwen-2.5VL多模态大模型,模块介绍

本文介绍了使用PyTorch构建CIFAR10分类模型的过程。作者最初尝试融合VGG16架构,但效果不佳,最终采用ResNet-18进行微调。模型通过修改输入卷积层和全连接层适配CIFAR10数据集,使用SGD优化器配合余弦退火学习率调度,在100个epoch内完成训练。训练过程使用了数据增强技术,并通过TensorBoard进行可视化监控。完整代码包括自定义的SmallResnet模型和训练脚本

本文梳理了强化学习的基本概念框架,主要包括三个部分:1)核心要素定义(状态/观测、动作、奖励、策略等);2)随机性来源分析(动作选择和状态转移);3)价值函数体系(动作价值函数Q和状态价值函数V)。文章通过知乎专栏和GitHub资料,结合具体示例说明了强化学习的交互流程和核心数学原理,包括马尔可夫性质、蒙特卡洛估计等。最后指出强化学习的优化目标是通过逼近Q和V函数,找到最优动作序列以获得最大累积奖

Diffusion模型通过前向扩散和反向去噪过程实现图像生成。前向过程逐步添加高斯噪声破坏图像,反向过程则通过U-Net预测并去除噪声重建图像。DiT(Diffusion Transformer)研究表明Transformer可替代U-Net,提供更好扩展性。

Qwen-2.5VL多模态大模型,模块介绍

Qwen-2.5VL多模态大模型,模块介绍

本文介绍了使用PyTorch构建CIFAR10分类模型的过程。作者最初尝试融合VGG16架构,但效果不佳,最终采用ResNet-18进行微调。模型通过修改输入卷积层和全连接层适配CIFAR10数据集,使用SGD优化器配合余弦退火学习率调度,在100个epoch内完成训练。训练过程使用了数据增强技术,并通过TensorBoard进行可视化监控。完整代码包括自定义的SmallResnet模型和训练脚本

本文梳理了强化学习的基本概念框架,主要包括三个部分:1)核心要素定义(状态/观测、动作、奖励、策略等);2)随机性来源分析(动作选择和状态转移);3)价值函数体系(动作价值函数Q和状态价值函数V)。文章通过知乎专栏和GitHub资料,结合具体示例说明了强化学习的交互流程和核心数学原理,包括马尔可夫性质、蒙特卡洛估计等。最后指出强化学习的优化目标是通过逼近Q和V函数,找到最优动作序列以获得最大累积奖









