
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
【摘要】实验使用Qwen2.5-0.5B模型(24层,hidden_size=896)分析Transformer各层隐藏状态分布。通过拼接896维隐藏层为1维数组并可视化激活值,发现:1)随着层数加深,所有维度数值逐渐膨胀(推测由残差连接累积导致);2)序列中第一个token的膨胀现象最早出现;3)最终层所有token均出现显著数值膨胀。实验以"The capital of France is P

【摘要】实验使用Qwen2.5-0.5B模型(24层,hidden_size=896)分析Transformer各层隐藏状态分布。通过拼接896维隐藏层为1维数组并可视化激活值,发现:1)随着层数加深,所有维度数值逐渐膨胀(推测由残差连接累积导致);2)序列中第一个token的膨胀现象最早出现;3)最终层所有token均出现显著数值膨胀。实验以"The capital of France is P

本文介绍了在WSL和Windows系统中配置Claude Code以使用国产AI模型(DeepSeek/Qwen/Kimi)的方法。作者发现WSL会优先读取Windows系统下的.claude/settings.json配置而非bashrc,详细说明了npm和Claude Code的安装步骤,并提供了三种国产模型的配置模板(包括API地址和模型参数)。对于普通Linux系统,则需要在.bashrc
本文介绍了在WSL和Windows系统中配置Claude Code以使用国产AI模型(DeepSeek/Qwen/Kimi)的方法。作者发现WSL会优先读取Windows系统下的.claude/settings.json配置而非bashrc,详细说明了npm和Claude Code的安装步骤,并提供了三种国产模型的配置模板(包括API地址和模型参数)。对于普通Linux系统,则需要在.bashrc







