logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

6.1 大模型结构:从 Transformer 到 MoE

每次前向推理会激活全部参数。典型的 Transformer 就是 Dense:每层的注意力与 FFN 都对所有 token 执行同样的计算路径。

#transformer#深度学习#人工智能
3.3 PPO 训练中的Trick与常见问题(面向大模型 / RLHF 场景)

PPO(Proximal Policy Optimization)在大模型对齐(如 RLHF)里已经形成了一套相对“标准”的工程范式:用 SFT policy 初始化 Actor,用 reference policy(通常就是 SFT policy) 做 KL 约束,再配合一系列稳定性技巧(GAE、归一化、loss clipping、混合训练目标等)。这些技巧背后的共同目标是:下面按“模型层面 →

#分类#深度学习#数据挖掘 +2
7.1 大模型的packing

Packing的核心思想是:把多条短序列“拼接”成一条更长的序列,让每个 batch 的 token 数尽量贴近上限,从而提高η\etaη。按 batch 内最长样本长度对齐:把 batch 内样本打包后再按该 batch 最长长度 pad按模型最大长度对齐:每个 pack 直接凑到最大长度Lmax⁡L_{\max}Lmax​(例如 4k / 8k / 128k),最大化吞吐本质上,Packing

#人工智能#机器学习#深度学习 +2
2.1 强化学习基础(概念、流程、目标)

强化学习(Reinforcement Learning, RL)是一种机器学习方法,它通过来学习如何采取最优行为,从而最大化长期累积奖励。与有监督学习不同,强化学习不仅关注预测,还强调决策与反馈循环。

#人工智能#深度学习#机器学习 +1
5、Video-LLAMA / LLaMA-VID / LLaVA-Video

如何把每一帧的视觉信息变成对 LLM 更友好的 token 序列,并在计算预算可控下支持更长视频。:对每帧生成视觉 embedding:从用户指令生成 text-guided queryToken 生成策略:为每帧生成两类 token::概括“与问题相关”的全局信息:保留一定数量的细节信息(可自适应池化控制长度):释放 LLM 在图像/视频任务的指令跟随潜力先计算 query 与视觉 token

#人工智能#深度学习
6、KIMI-VL介绍

把 Kimi-VL 的训练路线压缩成一句话:先用混合目标把视觉底座“练到能看清与能对齐”,再用联合预训练把多模态与语言能力“拧成一股绳”,再用冷却阶段把能力结构“精炼与去噪”,最后用长上下文激活与后训练把模型推到“可用、可控、可长序列推理”的状态。高分辨率真实场景 vs 训练吞吐与工程复杂度:MoonViT 原生分辨率 + packing多模态能力提升 vs 语言能力退化:联合预训练中先语言后多模

#计算机视觉#人工智能#机器学习
3.2 LLM 对齐中的 RLHF + PPO(以 InstructGPT 为例)

大语言模型(LLM)的目标,是让模型输出更符合人类偏好与意图:更有用、更安全、更少胡编、语气更合适。InstructGPT(论文)是最早系统化把用到 LLM post-training 的工作之一,它把“人类偏好”变成一个可优化的学习信号,并用来做稳定的策略优化。,并解释 Actor/Critic/Reward/Reference 四模型在训练环路中的角色、关键公式、以及为什么这些设计能跑得稳。

#人工智能#python#深度学习 +2
3.1 GPT 系列:Generative Pre-Training(从 GPT-1 到 GPT-3)

迁移方式:GPT-1 主推“预训练 + 微调”;GPT-2 主推“预训练 + zero-shot”。规模与数据:GPT-2 数据与参数显著扩大(典型说法是 GPT-2 约 40GB 高质量文本,GPT-1 数据规模更小)。训练细节:LayerNorm 位置、初始化等工程细节更适配更深模型。贡献意义:GPT-2 强化了一个重要结论:当模型容量与数据多样性足够时,语言模型会呈现明显的通用迁移与多任务能

#gpt-3#机器学习#人工智能 +2
4、Qwen-omni

输入类型Temporal ID 规则空间 ID 规则文本所有 token 共享同一 Temporal 设定(等价于 1D)等价于 1D-RoPE音频按固定时间片递增(例如每 40ms 一个 ID)不适用图像Temporal 固定(或统一)按像素/patch 的 height/width 分配视频(含音频)video 帧按真实时间戳映射到 Temporal;音频按固定间隔递增同图像:每帧内按 hei

#人工智能#深度学习#机器学习 +1
3、Qwen系列

Qwen-VL 的训练流程分为 3 个阶段,每一阶段的目标都不同。Qwen-VL:固定分辨率 + Adapter 压缩到固定 256优点:序列长度稳定,工程容易局限:高分辨率细节受限,空间/时间建模能力有限Qwen2-VL:原生动态分辨率 + 2×2 merge + 2D-RoPE + MRoPE优点:细节保留更好,位置建模更贴近图像/视频结构工程关键:merge 与 packing 控制 tok

#人工智能#深度学习#机器学习 +1
    共 58 条
  • 1
  • 2
  • 3
  • 6
  • 请选择