
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
每次前向推理会激活全部参数。典型的 Transformer 就是 Dense:每层的注意力与 FFN 都对所有 token 执行同样的计算路径。
PPO(Proximal Policy Optimization)在大模型对齐(如 RLHF)里已经形成了一套相对“标准”的工程范式:用 SFT policy 初始化 Actor,用 reference policy(通常就是 SFT policy) 做 KL 约束,再配合一系列稳定性技巧(GAE、归一化、loss clipping、混合训练目标等)。这些技巧背后的共同目标是:下面按“模型层面 →
Packing的核心思想是:把多条短序列“拼接”成一条更长的序列,让每个 batch 的 token 数尽量贴近上限,从而提高η\etaη。按 batch 内最长样本长度对齐:把 batch 内样本打包后再按该 batch 最长长度 pad按模型最大长度对齐:每个 pack 直接凑到最大长度LmaxL_{\max}Lmax(例如 4k / 8k / 128k),最大化吞吐本质上,Packing
强化学习(Reinforcement Learning, RL)是一种机器学习方法,它通过来学习如何采取最优行为,从而最大化长期累积奖励。与有监督学习不同,强化学习不仅关注预测,还强调决策与反馈循环。
如何把每一帧的视觉信息变成对 LLM 更友好的 token 序列,并在计算预算可控下支持更长视频。:对每帧生成视觉 embedding:从用户指令生成 text-guided queryToken 生成策略:为每帧生成两类 token::概括“与问题相关”的全局信息:保留一定数量的细节信息(可自适应池化控制长度):释放 LLM 在图像/视频任务的指令跟随潜力先计算 query 与视觉 token
把 Kimi-VL 的训练路线压缩成一句话:先用混合目标把视觉底座“练到能看清与能对齐”,再用联合预训练把多模态与语言能力“拧成一股绳”,再用冷却阶段把能力结构“精炼与去噪”,最后用长上下文激活与后训练把模型推到“可用、可控、可长序列推理”的状态。高分辨率真实场景 vs 训练吞吐与工程复杂度:MoonViT 原生分辨率 + packing多模态能力提升 vs 语言能力退化:联合预训练中先语言后多模
大语言模型(LLM)的目标,是让模型输出更符合人类偏好与意图:更有用、更安全、更少胡编、语气更合适。InstructGPT(论文)是最早系统化把用到 LLM post-training 的工作之一,它把“人类偏好”变成一个可优化的学习信号,并用来做稳定的策略优化。,并解释 Actor/Critic/Reward/Reference 四模型在训练环路中的角色、关键公式、以及为什么这些设计能跑得稳。
迁移方式:GPT-1 主推“预训练 + 微调”;GPT-2 主推“预训练 + zero-shot”。规模与数据:GPT-2 数据与参数显著扩大(典型说法是 GPT-2 约 40GB 高质量文本,GPT-1 数据规模更小)。训练细节:LayerNorm 位置、初始化等工程细节更适配更深模型。贡献意义:GPT-2 强化了一个重要结论:当模型容量与数据多样性足够时,语言模型会呈现明显的通用迁移与多任务能
输入类型Temporal ID 规则空间 ID 规则文本所有 token 共享同一 Temporal 设定(等价于 1D)等价于 1D-RoPE音频按固定时间片递增(例如每 40ms 一个 ID)不适用图像Temporal 固定(或统一)按像素/patch 的 height/width 分配视频(含音频)video 帧按真实时间戳映射到 Temporal;音频按固定间隔递增同图像:每帧内按 hei







