
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
强化学习(Reinforcement Learning, RL)是一种机器学习方法,它通过来学习如何采取最优行为,从而最大化长期累积奖励。与有监督学习不同,强化学习不仅关注预测,还强调决策与反馈循环。
如何把每一帧的视觉信息变成对 LLM 更友好的 token 序列,并在计算预算可控下支持更长视频。:对每帧生成视觉 embedding:从用户指令生成 text-guided queryToken 生成策略:为每帧生成两类 token::概括“与问题相关”的全局信息:保留一定数量的细节信息(可自适应池化控制长度):释放 LLM 在图像/视频任务的指令跟随潜力先计算 query 与视觉 token
把 Kimi-VL 的训练路线压缩成一句话:先用混合目标把视觉底座“练到能看清与能对齐”,再用联合预训练把多模态与语言能力“拧成一股绳”,再用冷却阶段把能力结构“精炼与去噪”,最后用长上下文激活与后训练把模型推到“可用、可控、可长序列推理”的状态。高分辨率真实场景 vs 训练吞吐与工程复杂度:MoonViT 原生分辨率 + packing多模态能力提升 vs 语言能力退化:联合预训练中先语言后多模
大语言模型(LLM)的目标,是让模型输出更符合人类偏好与意图:更有用、更安全、更少胡编、语气更合适。InstructGPT(论文)是最早系统化把用到 LLM post-training 的工作之一,它把“人类偏好”变成一个可优化的学习信号,并用来做稳定的策略优化。,并解释 Actor/Critic/Reward/Reference 四模型在训练环路中的角色、关键公式、以及为什么这些设计能跑得稳。
迁移方式:GPT-1 主推“预训练 + 微调”;GPT-2 主推“预训练 + zero-shot”。规模与数据:GPT-2 数据与参数显著扩大(典型说法是 GPT-2 约 40GB 高质量文本,GPT-1 数据规模更小)。训练细节:LayerNorm 位置、初始化等工程细节更适配更深模型。贡献意义:GPT-2 强化了一个重要结论:当模型容量与数据多样性足够时,语言模型会呈现明显的通用迁移与多任务能
输入类型Temporal ID 规则空间 ID 规则文本所有 token 共享同一 Temporal 设定(等价于 1D)等价于 1D-RoPE音频按固定时间片递增(例如每 40ms 一个 ID)不适用图像Temporal 固定(或统一)按像素/patch 的 height/width 分配视频(含音频)video 帧按真实时间戳映射到 Temporal;音频按固定间隔递增同图像:每帧内按 hei
Qwen-VL 的训练流程分为 3 个阶段,每一阶段的目标都不同。Qwen-VL:固定分辨率 + Adapter 压缩到固定 256优点:序列长度稳定,工程容易局限:高分辨率细节受限,空间/时间建模能力有限Qwen2-VL:原生动态分辨率 + 2×2 merge + 2D-RoPE + MRoPE优点:细节保留更好,位置建模更贴近图像/视频结构工程关键:merge 与 packing 控制 tok
任务训练目标核心作用注意力掩码要点ITC对齐图像-文本嵌入空间全局语义对齐禁止 Query 与 Text 互看,避免信息泄漏ITG给图像生成文本迫使 Query 提取可生成信息Text 可看 Query,Query 不可看 Text,且 Text 因果ITM判断图文是否匹配细粒度对齐 + 难负例Query 与 Text 双向互看,强化融合表示。
FFN 输入维度d4096d = 4096d4096传统 FFN 常取中间维度4d163844d = 163844d16384但使用SwiGLU后,FFN 由“2 个矩阵”变成“3 个矩阵”。为了让参数量大致保持不变,通常把中间层宽度从4d4d4d缩小到大约232/32/323×16384≈1092232×16384≈10922110081100811008这类“取整到某个倍数”的做法很常见,因
讨论默认以论文与技术报告中的描述为准,并配合必要的直观案例帮助理解。







