logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

学习周报十七-多模态学习

本周系统学习了强化学习基础理论与多模态模型核心技术。深入掌握了强化学习的核心概念,包括马尔可夫决策过程、价值函数、策略优化等基础理论;精读多模态大模型论文,重点研究了视觉标记器与视觉编码器的技术差异与协同机制,明确了视觉标记器的图像分块与向量化功能,以及视觉编码器的高级语义特征提取作用。通过理论梳理与论文精读,构建了从强化学习基础到多模态视觉处理的完整知识框架。

文章图片
#学习#人工智能#多模态
强化学习(RL)入门基础

本门适合刚开始学习RL的人进行入门,初步学习掌握强化学习各种基本概念,然后再进一步深入学习。

文章图片
#人工智能#学习
大模型学习周报十六

本周聚焦多模态大模型架构创新与交互式智能体训练方法。深入研究了字节Seed1.5-VL的三阶段预训练策略(MLP适配器对齐→视觉定位OCR→视频推理扩展)与强化学习后训练机制(拒绝采样+PPO算法),重点分析了其动态帧采样和时间戳标记等核心技术;系统学习了LLaVA-mini的视觉token压缩与模态预融合优化方案,以及USERRL框架的交互式训练环境设计与轨迹级评分机制。研究构建了从多模态特征对

文章图片
#学习#人工智能#深度学习 +1
机器学习课程学习周报一

本周系统学习了李宏毅机器学习基础内容,深入理解了机器学习的三大核心任务,即回归任务、分类任务和结构化学习,以及完整的训练流程,包括模型定义、损失函数设计和基于梯度下降的优化方法。同时,掌握了 PyTorch 的核心操作,例如张量的创建与运算如加法、索引和尺寸修改,张量与 NumPy 数组的相互转换,以及如何利用 GPU 加速计算的 CUDA 张量应用。

文章图片
#机器学习#学习#人工智能 +1
学习周报四十三

本周通过对MMTok的复现测试,验证了其在Qwen2.5-VL-7B模型上的实际表现,并获得了关键发现:低视觉token保留比例下,模型在OCR和局部结构识别任务中的性能退化早于语义理解任务。这一现象与Nüwa等近期工作指出的“空间完整性破坏”相吻合,说明现有token pruning方法更倾向于保语义而非保结构。基于此,下一步将系统化这一观察,利用GQA等数据集进行定量评估,以证明问题的普遍性,

文章图片
#学习
多模态学习-周报三十八

本周聚焦多模态大模型实践与推理模型技术突破。系统完成了Qwen2.5-VL多模态模型的完整部署流程,包括测试版Transformers库源码编译、多规格模型(3B/7B/72B)参数获取及显存需求验证;深入测试了模型的五大核心能力——多图识别、目标定位(边界框坐标输出)、OCR文字提取、文档解析和视频理解;同步研究了DeepSeek-R1推理模型的创新训练范式,重点分析了纯强化学习激励机制(准确率

文章图片
#学习#人工智能#transformer +1
学习周报三十二

本周通过对两篇论文的研读与实践,深入理解了当前大模型训练与多模态生成中的两个关键优化方向。

文章图片
#学习#人工智能
AI基础学习周报十三

本周聚焦扩散模型与Mamba模型的创新方法。系统研究了DiT模型的核心机制,包括图像分块嵌入策略、四种条件嵌入方案及其参数初始化策略;深入推导了扩散模型的数学原理;研读了论文CCViM,其创新性地将上下文聚类与视觉状态空间模型结合,通过局部网格聚类增强VMamba的全局建模能力。

文章图片
#人工智能#学习#深度学习 +1
学习周报十九

本周深入研究了混合专家模型(MoE)的核心原理与Stable Diffusion的图像生成机制。系统分析了MoE架构中稀疏层与门控网络的协同工作机制,详细解析了动态路由策略、负载均衡优化及辅助损失函数设计;全面掌握了Stable Diffusion的完整工作流程,包括CLIP文本编码、U-Net噪声预测、VAE隐空间压缩等关键技术环节。通过理论推导与架构分析,建立了从大模型参数效率优化到生成式模型

文章图片
#学习
学习周报二十六

本周通过理论分析与案例复盘,获得了关于模型优化与学术交流的双重启示。Qwen提出的门控注意力机制通过引入可学习的Sigmoid门,赋予模型“拒绝分配”的能力,实验证明其能将首Token注意力占比从46.7%降至4.8%,最大激活值从1053降至94,有效提升了训练稳定性与推理效率。

文章图片
#学习
    共 24 条
  • 1
  • 2
  • 3
  • 请选择