
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
BF16的指数范围跟FP32对齐,虽然尾数少,但数值稳定性极强,几乎不会溢出,也不需要额外缩放。FP8分E4M3和E5M2两种标准,速度是FP16的2到4倍,显存占用只有FP16的四分之一。FP16的速度是FP32的4到8倍,显存也减半,但容易出现数值溢出。在V100那个年代,它是模型训练的主力,但训练大模型时必须配合Loss Scaling来防止梯度爆炸,用起来比较折腾。精度后缀才是关键,同样的

BF16的指数范围跟FP32对齐,虽然尾数少,但数值稳定性极强,几乎不会溢出,也不需要额外缩放。FP8分E4M3和E5M2两种标准,速度是FP16的2到4倍,显存占用只有FP16的四分之一。FP16的速度是FP32的4到8倍,显存也减半,但容易出现数值溢出。在V100那个年代,它是模型训练的主力,但训练大模型时必须配合Loss Scaling来防止梯度爆炸,用起来比较折腾。精度后缀才是关键,同样的

生活领域包括MiniMax星野(生活陪伴)、HeyQ(家庭组织)、Ohai!腾讯CodeBuddy(AI对话/代码补全/MCP Server,支持200+语言)、智谱ZCode(轻量级AI代码编辑)、字节Trae(自主代码库探索与终端命令)、百度Comate(多模态全栈自动编程)、商汤小浣熊(需求分析到测试全流程)、华为云CodeArts(Agent Space/Agentic DevOps)、智

生活领域包括MiniMax星野(生活陪伴)、HeyQ(家庭组织)、Ohai!腾讯CodeBuddy(AI对话/代码补全/MCP Server,支持200+语言)、智谱ZCode(轻量级AI代码编辑)、字节Trae(自主代码库探索与终端命令)、百度Comate(多模态全栈自动编程)、商汤小浣熊(需求分析到测试全流程)、华为云CodeArts(Agent Space/Agentic DevOps)、智








