logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型每一层transformer输出的激活值会膨胀

【摘要】实验使用Qwen2.5-0.5B模型(24层,hidden_size=896)分析Transformer各层隐藏状态分布。通过拼接896维隐藏层为1维数组并可视化激活值,发现:1)随着层数加深,所有维度数值逐渐膨胀(推测由残差连接累积导致);2)序列中第一个token的膨胀现象最早出现;3)最终层所有token均出现显著数值膨胀。实验以"The capital of France is P

文章图片
#transformer#深度学习#人工智能
大模型每一层transformer输出的激活值会膨胀

【摘要】实验使用Qwen2.5-0.5B模型(24层,hidden_size=896)分析Transformer各层隐藏状态分布。通过拼接896维隐藏层为1维数组并可视化激活值,发现:1)随着层数加深,所有维度数值逐渐膨胀(推测由残差连接累积导致);2)序列中第一个token的膨胀现象最早出现;3)最终层所有token均出现显著数值膨胀。实验以"The capital of France is P

文章图片
#transformer#深度学习#人工智能
wsl如何使用claude code加国产模型

本文介绍了在WSL和Windows系统中配置Claude Code以使用国产AI模型(DeepSeek/Qwen/Kimi)的方法。作者发现WSL会优先读取Windows系统下的.claude/settings.json配置而非bashrc,详细说明了npm和Claude Code的安装步骤,并提供了三种国产模型的配置模板(包括API地址和模型参数)。对于普通Linux系统,则需要在.bashrc

#人工智能#rust#vscode +2
wsl如何使用claude code加国产模型

本文介绍了在WSL和Windows系统中配置Claude Code以使用国产AI模型(DeepSeek/Qwen/Kimi)的方法。作者发现WSL会优先读取Windows系统下的.claude/settings.json配置而非bashrc,详细说明了npm和Claude Code的安装步骤,并提供了三种国产模型的配置模板(包括API地址和模型参数)。对于普通Linux系统,则需要在.bashrc

#人工智能#rust#vscode +2
到底了