
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
🚀 DQN实战:3分钟极速训练倒立摆控制模型 | 附完整代码+可视化训练;📌 核心技术亮点:DQN双剑合璧:融合深度神经网络与Q-Learning,通过经验回放打破数据关联性,目标网络稳定训练过程,解决高维状态空间难题;CartPole极简环境:4维状态空间+2个离散动作,完美契合入门级深度强化学习实战(附环境配置指南)

EasyR1是基于veRL的一个高效、可扩展、多模态强化学习LLM训练框架,由LLaMA Factory作者hiyouga打造,很很短的时间内获得了1.8k Star。EasyR1 受益于 veRL 的 HybridEngine 和 vLLM 0.7 的 SPMD mode,并适配了 Qwen2.5-VL 模型,在多模态几何题任务 Geometry3k 上通过 30 个 batch 的 GRPO

本文手把手教你使用 Qwen3.5-4B 基座模型,在 Chat-嬛嬛数据集上进行 SFT/LoRA

本文介绍了使用PyTRIO微调Qwen3.5-4B模型进行文本分类任务的实验。仅用200条训练数据(总消耗约0.5M token),就将验证准确率从基模型的73%提升至91%。实验在CPU环境下完成,通过PyTRIO云服务实现模型训练,全过程仅需几分钟,成本约2.5元。文章详细展示了数据准备、训练配置、评估结果及完整代码,证实了小样本微调对提升模型性能的有效性。相关代码和数据集已在GitHub和M

TRIO:面向大模型后训练的AI基础设施 TRIO是一个面向大模型后训练的AI Infra产品,允许开发者在本地编写训练循环(数据处理、loss设计、reward计算等),同时将复杂的分布式训练、GPU调度等底层任务交给云端完成。其核心特性包括: 本地开发云端执行:在本地运行Python脚本,云端GPU执行计算 支持LoRA后训练:采用LoRA方式轻量级更新模型 训练自由度高:提供sample、f

本教程详细介绍了基于Qwen3.5模型的Agentic-RL(强化学习驱动的智能体)训练实践,以股票交易为案例构建了一个名为"量化龙虾"的自主交易Agent。文章分为三部分:首先阐述了Agent设计思路,包括数据获取、市场分析和交易决策功能;其次解析了Agentic-RL的核心原理,强调其通过多轮交互轨迹优化模型策略的特性;最后提供了完整的训练实现方案。 教程选择股票交易作为演示场景,主要因为金融

SwanLab机器学习实战教程是一个主打「开箱即用」的AI训练系列教程,我们致力于提供手把手帮助你跑起训练。Qwen2-VL是通义千问团队最近开源的大语言模型,由阿里云通义实验室研发。以Qwen2-VL作为基座多模态大模型,通过的方式实现特定场景下的OCR,是学习的入门任务。本文我们将简要介绍基于 transformers、peft 等框架,使用 Qwen2-VL-2B-Instruct 模型在上

使用PyTorch进行深度学习训练时,经常需要打印模型结构,查看每一层的名称、尺寸、精度、参数量等等,并在最后计算总参数量。

SwanLab是一个开源、现代化设计的深度学习训练跟踪与可视化工具,常被称为"中国版 Weights & Biases + Tensorboard"。SwanLab同时支持云端和离线使用,并适配了从再到等30多种主流AI训练框架,Python API设计也简洁易上手,能轻松嵌入你的训练代码。面向人工智能研究者,SwanLab设计了友好的Python API 和漂亮的UI界面,并提供训练可视化、自动

Stable Baselines3 (SB3) 是一个强化学习的开源库,基于 PyTorch 框架构建。它是 Stable Baselines 项目的继任者,旨在提供一组可靠且经过良好测试的RL算法实现,便于研究和应用。StableBaseline3主要被应用于机器人控制、游戏AI、自动驾驶、金融交易等领域。你可以使用sb3快速进行模型训练,同时使用SwanLab进行实验跟踪与可视化。








