logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

FP8深度解析:深度学习的“压缩饼干“

FP8是深度学习领域新兴的低精度浮点格式,通过优化存储降低计算成本。文章从三个维度解析FP8: 存储优势:相比FP32,FP8将GPT-3等大模型存储需求从700GB降至175GB,节省50%空间。 技术原理:浮点数采用"符号-指数-尾数"三件套结构,FP8提供两种格式选择: E4M3(4位指数+3位尾数):精度优先,适合权重和激活值 E5M2(5位指数+2位尾数):范围优先,适合梯度和损失值

#深度学习#人工智能
强化学习(RLVR)真的能提升大语言模型的推理能力吗?——解读最新研究

Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?

文章图片
#语言模型#人工智能#自然语言处理
什么是重要性采样(Importance Sampling, IS)? PPO等强化学习算法是否使用重要性采样?

重要性采样(Importance Sampling, IS)是一种用于从一个概率分布估计另一个概率分布的期望的技术。

#算法#机器学习#人工智能
DeepSearch:通过蒙特卡罗树搜索克服可验证奖励强化学习的瓶颈

DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search

文章图片
#人工智能#深度学习#机器学习
Sidecar 机制:给 AI Agent 挂一个并行的安全边车

本文介绍了AI Agent开发中的Sidecar安全机制。该机制通过独立运行的轻量级模型对主Agent执行的每个工具调用进行实时审查,确保操作安全。Sidecar与主模型并行运行,仅接收结构化的工具调用数据(工具名和参数),不查看主模型的思考过程,从而避免提示注入攻击。审查过程专注于简单的分类任务(判断操作是否越界),因此轻量模型即可胜任。这种设计在保证安全的同时几乎不增加延迟,是AI Agent

#人工智能#安全#大数据
面试题解析:LLM 训练中,什么时候需要“先 SFT 后 RL“?

这篇文章探讨了大型语言模型(LLM)训练中"先监督微调(SFT)后强化学习(RL)"的必要性及其边界条件。核心观点是:RL需要一个能可靠解析的打分起点,当基础模型较小且任务要求严格的结构化输出时,必须先用SFT建立输出格式(形),RL才能有效学习策略(神)。但足够强的基础模型可以跳过SFT直接RL(如DeepSeek-R1-Zero案例),不过最终产品往往仍需SFT来优化输出质量。文章通过训练机制

#面试
深入理解 SFT 的 Loss Masking:如何做到“只对回答部分回传梯度“

SFT Loss Masking 技术解析 核心要点: 预测机制:语言模型始终基于前文预测下一个token,每个位置都会产生预测和损失 掩码原理:通过将prompt部分的label设为-100(ignore_index),使损失函数跳过这些位置 实现方式:仅保留response部分的真实token id,其他位置标记为-100 技术效果:梯度仅从response部分的损失回传,避免模型学习提问模式

    共 636 条
  • 1
  • 2
  • 3
  • 64
  • 请选择