
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本周系统学习了强化学习基础理论与多模态模型核心技术。深入掌握了强化学习的核心概念,包括马尔可夫决策过程、价值函数、策略优化等基础理论;精读多模态大模型论文,重点研究了视觉标记器与视觉编码器的技术差异与协同机制,明确了视觉标记器的图像分块与向量化功能,以及视觉编码器的高级语义特征提取作用。通过理论梳理与论文精读,构建了从强化学习基础到多模态视觉处理的完整知识框架。

本门适合刚开始学习RL的人进行入门,初步学习掌握强化学习各种基本概念,然后再进一步深入学习。

本周聚焦多模态大模型架构创新与交互式智能体训练方法。深入研究了字节Seed1.5-VL的三阶段预训练策略(MLP适配器对齐→视觉定位OCR→视频推理扩展)与强化学习后训练机制(拒绝采样+PPO算法),重点分析了其动态帧采样和时间戳标记等核心技术;系统学习了LLaVA-mini的视觉token压缩与模态预融合优化方案,以及USERRL框架的交互式训练环境设计与轨迹级评分机制。研究构建了从多模态特征对

本周系统学习了李宏毅机器学习基础内容,深入理解了机器学习的三大核心任务,即回归任务、分类任务和结构化学习,以及完整的训练流程,包括模型定义、损失函数设计和基于梯度下降的优化方法。同时,掌握了 PyTorch 的核心操作,例如张量的创建与运算如加法、索引和尺寸修改,张量与 NumPy 数组的相互转换,以及如何利用 GPU 加速计算的 CUDA 张量应用。

本周通过对MMTok的复现测试,验证了其在Qwen2.5-VL-7B模型上的实际表现,并获得了关键发现:低视觉token保留比例下,模型在OCR和局部结构识别任务中的性能退化早于语义理解任务。这一现象与Nüwa等近期工作指出的“空间完整性破坏”相吻合,说明现有token pruning方法更倾向于保语义而非保结构。基于此,下一步将系统化这一观察,利用GQA等数据集进行定量评估,以证明问题的普遍性,

本周聚焦多模态大模型实践与推理模型技术突破。系统完成了Qwen2.5-VL多模态模型的完整部署流程,包括测试版Transformers库源码编译、多规格模型(3B/7B/72B)参数获取及显存需求验证;深入测试了模型的五大核心能力——多图识别、目标定位(边界框坐标输出)、OCR文字提取、文档解析和视频理解;同步研究了DeepSeek-R1推理模型的创新训练范式,重点分析了纯强化学习激励机制(准确率

本周聚焦扩散模型与Mamba模型的创新方法。系统研究了DiT模型的核心机制,包括图像分块嵌入策略、四种条件嵌入方案及其参数初始化策略;深入推导了扩散模型的数学原理;研读了论文CCViM,其创新性地将上下文聚类与视觉状态空间模型结合,通过局部网格聚类增强VMamba的全局建模能力。

本周深入研究了混合专家模型(MoE)的核心原理与Stable Diffusion的图像生成机制。系统分析了MoE架构中稀疏层与门控网络的协同工作机制,详细解析了动态路由策略、负载均衡优化及辅助损失函数设计;全面掌握了Stable Diffusion的完整工作流程,包括CLIP文本编码、U-Net噪声预测、VAE隐空间压缩等关键技术环节。通过理论推导与架构分析,建立了从大模型参数效率优化到生成式模型










