logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

2.1 强化学习基础(概念、流程、目标)

强化学习(Reinforcement Learning, RL)是一种机器学习方法,它通过来学习如何采取最优行为,从而最大化长期累积奖励。与有监督学习不同,强化学习不仅关注预测,还强调决策与反馈循环。

#人工智能#深度学习#机器学习 +1
5、Video-LLAMA / LLaMA-VID / LLaVA-Video

如何把每一帧的视觉信息变成对 LLM 更友好的 token 序列,并在计算预算可控下支持更长视频。:对每帧生成视觉 embedding:从用户指令生成 text-guided queryToken 生成策略:为每帧生成两类 token::概括“与问题相关”的全局信息:保留一定数量的细节信息(可自适应池化控制长度):释放 LLM 在图像/视频任务的指令跟随潜力先计算 query 与视觉 token

#人工智能#深度学习
6、KIMI-VL介绍

把 Kimi-VL 的训练路线压缩成一句话:先用混合目标把视觉底座“练到能看清与能对齐”,再用联合预训练把多模态与语言能力“拧成一股绳”,再用冷却阶段把能力结构“精炼与去噪”,最后用长上下文激活与后训练把模型推到“可用、可控、可长序列推理”的状态。高分辨率真实场景 vs 训练吞吐与工程复杂度:MoonViT 原生分辨率 + packing多模态能力提升 vs 语言能力退化:联合预训练中先语言后多模

#计算机视觉#人工智能#机器学习
3.2 LLM 对齐中的 RLHF + PPO(以 InstructGPT 为例)

大语言模型(LLM)的目标,是让模型输出更符合人类偏好与意图:更有用、更安全、更少胡编、语气更合适。InstructGPT(论文)是最早系统化把用到 LLM post-training 的工作之一,它把“人类偏好”变成一个可优化的学习信号,并用来做稳定的策略优化。,并解释 Actor/Critic/Reward/Reference 四模型在训练环路中的角色、关键公式、以及为什么这些设计能跑得稳。

#人工智能#python#深度学习 +2
3.1 GPT 系列:Generative Pre-Training(从 GPT-1 到 GPT-3)

迁移方式:GPT-1 主推“预训练 + 微调”;GPT-2 主推“预训练 + zero-shot”。规模与数据:GPT-2 数据与参数显著扩大(典型说法是 GPT-2 约 40GB 高质量文本,GPT-1 数据规模更小)。训练细节:LayerNorm 位置、初始化等工程细节更适配更深模型。贡献意义:GPT-2 强化了一个重要结论:当模型容量与数据多样性足够时,语言模型会呈现明显的通用迁移与多任务能

#gpt-3#机器学习#人工智能 +2
4、Qwen-omni

输入类型Temporal ID 规则空间 ID 规则文本所有 token 共享同一 Temporal 设定(等价于 1D)等价于 1D-RoPE音频按固定时间片递增(例如每 40ms 一个 ID)不适用图像Temporal 固定(或统一)按像素/patch 的 height/width 分配视频(含音频)video 帧按真实时间戳映射到 Temporal;音频按固定间隔递增同图像:每帧内按 hei

#人工智能#深度学习#机器学习 +1
3、Qwen系列

Qwen-VL 的训练流程分为 3 个阶段,每一阶段的目标都不同。Qwen-VL:固定分辨率 + Adapter 压缩到固定 256优点:序列长度稳定,工程容易局限:高分辨率细节受限,空间/时间建模能力有限Qwen2-VL:原生动态分辨率 + 2×2 merge + 2D-RoPE + MRoPE优点:细节保留更好,位置建模更贴近图像/视频结构工程关键:merge 与 packing 控制 tok

#人工智能#深度学习#机器学习 +1
4、BLIP-2:用 Q-Former 低成本桥接视觉与大语言模型

任务训练目标核心作用注意力掩码要点ITC对齐图像-文本嵌入空间全局语义对齐禁止 Query 与 Text 互看,避免信息泄漏ITG给图像生成文本迫使 Query 提取可生成信息Text 可看 Query,Query 不可看 Text,且 Text 因果ITM判断图文是否匹配细粒度对齐 + 难负例Query 与 Text 双向互看,强化融合表示。

#语言模型#人工智能#自然语言处理
4.2 FFN 计算与激活函数:从标准 FFN 到 GLU / SwiGLU / GeGLU

FFN 输入维度d4096d = 4096d4096传统 FFN 常取中间维度4d163844d = 163844d16384但使用SwiGLU后,FFN 由“2 个矩阵”变成“3 个矩阵”。为了让参数量大致保持不变,通常把中间层宽度从4d4d4d缩小到大约232/32/323×16384≈1092232​×16384≈10922110081100811008这类“取整到某个倍数”的做法很常见,因

#人工智能#缓存#transformer +1
4.1 LLaMA 系列:从 LLaMA-1 到 LLaMA-3

讨论默认以论文与技术报告中的描述为准,并配合必要的直观案例帮助理解。

#人工智能#机器学习#python +2
    共 55 条
  • 1
  • 2
  • 3
  • 6
  • 请选择