logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

为什么大模型的输出 要比输入token 贵?

摘要(148字): 大模型推理分为输入(Prefill)和输出(Decode)两阶段: 输入阶段并行处理所有Token,权重加载一次完成矩阵运算,算力利用率近100%,成本低; 输出阶段需串行生成Token,每步重新加载全部权重(如GPT-3需140GB/次),显存带宽成为瓶颈,GPU利用率仅10%-30%,算术强度(1 FLOPS/Byte)远低于硬件屋脊点(156 FLOPS/Byte),导致

#人工智能
强化学习的优化策略PPO和DPO详解并分析异同

总结来说,PPO和DPO在算法框架和目标函数上有共同之处,但在实现方式、并行化程度以及适用的计算环境上存在差异,DPO特别适用于需要大规模并行处理的场景。总结来说,PPO专注于通过剪切概率比率来稳定策略更新,而DPO在此基础上引入分布式计算,以提高数据收集和处理的效率,加快学习速度。

文章图片
#人工智能
为什么大模型的输出 要比输入token 贵?

摘要(148字): 大模型推理分为输入(Prefill)和输出(Decode)两阶段: 输入阶段并行处理所有Token,权重加载一次完成矩阵运算,算力利用率近100%,成本低; 输出阶段需串行生成Token,每步重新加载全部权重(如GPT-3需140GB/次),显存带宽成为瓶颈,GPU利用率仅10%-30%,算术强度(1 FLOPS/Byte)远低于硬件屋脊点(156 FLOPS/Byte),导致

#人工智能
qwen3-vl中的架构层面三个创新点:MRoPE-interleave/deepstack/文本时间戳对齐

Qwen3-VL是阿里推出的多模态大模型,通过三大创新优化视觉-文本融合:1)MRoPE-Interleave采用交替编码解决频率分布问题;2)DeepStack机制分阶段多层插入视觉token,避免信息丢失;3)T-RoPE实现帧级时间对齐。这些技术使视觉信息能持续参与深度推理,显著提升多模态理解能力,同时保持参数高效性。相关原理详见《DeepStack》论文及官方技术文档。

文章图片
最大似然与交叉熵之间的关系以及互相推导过程

交叉熵是衡量两个概率分布( p )和( q )之间差异的指标。在机器学习中,( p )通常代表真实分布,而( q )代表模型预测的分布。

文章图片
#机器学习#人工智能
LLama的激活函数SwiGLU 解释

3.3 自适应性:GLU是一种类似于长短期记忆网络(LSTM)带有门机制的网络结构,通过门机制控制信息通过的比例,来让模型自适应地选择哪些单词和特征对预测下一个词有帮助。Swish函数结合了线性函数和非线性函数的特点,能够自适应地调整激活函数的形状,因此在某些深度学习模型中,Swish函数的表现优于常见的ReLU函数。其中,Swish_β(x) = x σ(β x),σ为sigmoid函数,⊗为逐

文章图片
#算法#人工智能
用于图像生成的Scaling Transformers

Scaling Transformers 是一种用于图像生成的神经网络架构,它通过扩展传统的 Transformer 模型来处理大规模数据集和高分辨率图像。这种模型通过改进注意力机制和网络结构,提高了处理大型图像的效率和生成质量。

#transformer#人工智能
理解CNN、DNN、RNN(递归神经网络以及循环神经网络)以及LSTM网络结构笔记

一文理解CNN、DNN、RNN 内部网络结构区别:http://www.36dsj.com/archives/65643理解 LSTM 网络:http://www.jianshu.com/p/9dc9f41f0b29RNN以及LSTM的介绍和公式梳理:http://blog.csdn.net/Dark_Scope/article/details/47056361深度学习解决局部极值和梯

#神经网络#cnn#dnn +1
docker部署,启动失败 OCI runtime create failed: container_linux.go:348:

docker run hello-world出现一下问题,docker: Error response from daemon: OCI runtime create failed: container_linux.go:348:starting container process caused "process_linux.go:297:copying bootstrap data to pip

#docker#linux
基于人类反馈的强化学习(RLHF)

例如,在InstructGPT项目中,使用PPO算法训练LM时,会计算LM当前输出与初始输出之间的KL散度作为惩罚项。例如,InstructGPT项目中,标注人员会创造性地编写输入提示(比如,“给出五个重燃职业激情的建议”)和对应的输出,覆盖了开放式问答、创意思考、对话和文本重写等多种创造性任务。值得注意的是,在某些情况下,这一步骤可能不是必需的。以InstructGPT为例,标注人员会将模型生成

文章图片
#人工智能
    共 66 条
  • 1
  • 2
  • 3
  • 7
  • 请选择