logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

从零复现 LingBot-VA Post-Training:常见问题与对策

本文总结了复现LingBot-VA模型在RoboTwin数据集上post-training时遇到的6个典型问题及解决方案。关键点包括:必须使用lingbot-va-base初始化模型;训练数据需预处理为LeRobot格式而非原始数据;Attention机制存在兼容性问题需特殊处理;FSDP在不同PyTorch版本下行为差异显著;训练稳定性需通过step 0-10验证;checkpoint仅保存模型

#人工智能
StarVLA模型LIBERO基准复现指南

本文简述AutoDL云服务器部署StarVLA模型并进行LIBERO评估的核心流程:创建两个Python3.10环境(分别用于LIBERO模拟器和模型推理),通过huggingface-cli下载7.9GB模型文件,准备LeRobot格式数据集,修改评估脚本路径配置,修复模型配置文件兼容性问题,解决无头服务器渲染问题(设置EGL或OSMesa渲染后端)。同时总结常见问题解决方案,强调环境配置、模型

AutoDL云服务器复现StarVLA全记录

路径尽量使用绝对路径。严格遵循官方推荐的 flash-attn 版本。huggingface_hub 版本需根据任务切换。注释掉调试代码以正常执行。此记录基于实际操作整理,希望对后续使用者有所帮助。

从入门到入土 4:从理论到实践——构建大规模图像与视频生成器

本文探讨了生成模型从理论到工程落地的关键技术挑战与解决方案。针对高维图像/视频数据建模难题,提出了两大核心策略:神经网络架构创新(U-Net/DiT)和潜空间压缩技术(VAE)。文章详细分析了Stable Diffusion 3和Meta Movie Gen等工业级系统的设计要点,包括多模态DiT架构、时空压缩、文本条件融合等关键技术。通过构建"微分方程+数据驱动学习+高效架构&quot

#人工智能#机器学习
从入门到入土 3:Score Matching 与 Guidance——从学习梯度到控制生成

本文介绍了基于分数匹配(Score Matching)和引导技术(Guidance)的生成模型方法。核心内容包括:1)分数函数作为概率密度的方向指示器,可通过去噪分数匹配学习;2)利用学习到的分数函数构造随机微分方程(SDE)进行灵活采样;3)条件生成技术,特别是Classifier-Free Guidance(CFG),通过混合无条件和条件模型实现精确控制生成内容。该方法为当前主流生成模型(如S

#人工智能#机器学习
从入门到入土 2:Flow Matching——如何训练一个生成模型

本文介绍了Flow Matching(流匹配)方法,这是一种训练生成模型的高效算法。Flow Matching将生成问题转化为微分方程模拟,通过神经网络学习驱动噪声到目标数据分布的速度场。其核心思想是先为每个数据点构建条件概率路径,再整合为边际概率路径。训练时,神经网络直接拟合已知的条件速度场,而非复杂的边际速度场,这通过条件流匹配损失函数实现。算法流程简洁:混合数据点和噪声后,回归预测速度与目标

#人工智能#机器学习
到底了