
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
Qwen2-VL多模态大模型微调实战。本文我们将简要介绍基于 transformers、peft 等框架,使用 Qwen2-VL-2B-Instruct 模型在上进行Lora微调训练,同时使用监控训练过程与评估模型效果。

基于LSTM模型的股票预测任务,是领域的经典任务之一。这篇文章我将带大家使用这四个开源工具,完成从Google股票数据集的准备、代码编写、可视化训练与预测的全过程。

一个清晰、有组织的README文件对于任何项目都是不可或缺的,它不仅提高了工作效率,还能加强团队间的沟通和项目的可持续性。本文将引导你如何精心打造文件目录结构,使其既直观又具有可读性,从而提升你的项目管理技能。

MiniCPM-O-2.6 多模态大模型微调实战。本文我们将简要介绍基于 transformers、peft 等框架,使用 MiniCPM-O-2.6模型在上进行Lora微调训练,同时使用监控训练过程与评估模型效果。

本文我们将简要介绍基于 transformers、peft 等框架,使用 Qwen2-VL-2B-Instruct 模型在上进行Lora微调训练,同时使用监控训练过程与评估模型效果。

🚀 DQN实战:3分钟极速训练倒立摆控制模型 | 附完整代码+可视化训练;📌 核心技术亮点:DQN双剑合璧:融合深度神经网络与Q-Learning,通过经验回放打破数据关联性,目标网络稳定训练过程,解决高维状态空间难题;CartPole极简环境:4维状态空间+2个离散动作,完美契合入门级深度强化学习实战(附环境配置指南)

EasyR1是基于veRL的一个高效、可扩展、多模态强化学习LLM训练框架,由LLaMA Factory作者hiyouga打造,很很短的时间内获得了1.8k Star。EasyR1 受益于 veRL 的 HybridEngine 和 vLLM 0.7 的 SPMD mode,并适配了 Qwen2.5-VL 模型,在多模态几何题任务 Geometry3k 上通过 30 个 batch 的 GRPO

本文手把手教你使用 Qwen3.5-4B 基座模型,在 Chat-嬛嬛数据集上进行 SFT/LoRA

本文介绍了使用PyTRIO微调Qwen3.5-4B模型进行文本分类任务的实验。仅用200条训练数据(总消耗约0.5M token),就将验证准确率从基模型的73%提升至91%。实验在CPU环境下完成,通过PyTRIO云服务实现模型训练,全过程仅需几分钟,成本约2.5元。文章详细展示了数据准备、训练配置、评估结果及完整代码,证实了小样本微调对提升模型性能的有效性。相关代码和数据集已在GitHub和M

TRIO:面向大模型后训练的AI基础设施 TRIO是一个面向大模型后训练的AI Infra产品,允许开发者在本地编写训练循环(数据处理、loss设计、reward计算等),同时将复杂的分布式训练、GPU调度等底层任务交给云端完成。其核心特性包括: 本地开发云端执行:在本地运行Python脚本,云端GPU执行计算 支持LoRA后训练:采用LoRA方式轻量级更新模型 训练自由度高:提供sample、f








