登录社区云,与社区用户共同成长
邀请您加入社区
1.先备份ollama的模型存放文件夹,防止出现意外情况。如果模型存放文件夹指定在其它盘,需要去其它盘找到并备份;
2.将原先的ollama进行卸载;
3.到ollama官网下载最新版本的ollama安装文件(windows版本);
4.下载完成后,点击安装即可。因之前模型存放路径的环境变量已经配置好,所以无需重新配置;
5.检查安装,使用ollama -v命令,如果显示最新版本号,则表明安装成功。
免费领 150 小时云算力,进群参与显卡、AI PC 幸运抽奖
更多推荐
WSL2 GPU 直连与 vLLM 大模型推理
DCU使用技术报告_中篇_gfx936_DCU_Qwen3.5-27B_Triton-ROCm_Attention与GEMV深度优化实战
系列文章中篇。上篇解决了环境、基线和 Profile 的可信度问题;这一篇进入算子层,记录专用 Prefill Attention、Q10/Q20 Query 复用、Gate/Up Triton GEMV,以及一批看起来合理但最终没有采用的实验。
DCU使用技术报告_下篇_gfx936_DCU_Qwen3.5-27B_rocBLAS-hipBLASLt调优、vLLM工程化与踩坑实战
这次做 DCU 推理优化,最容易上瘾的是看一个 kernel 从 0.50 ms 变成 0.33 ms。真正难的却是后面的判断:它一层有多少次调用,是否命中 CUDA Graph,是否改变生成路径,是否只在某个 chunk 上有效,部署到另一个容器后会不会悄悄回退。Profile 找热点,真实形状做微基准,局部候选用 guard 接入,服务结果决定去留,精度最后否决。DCU、ROCm、Triton
扫一扫分享内容
为遵守国家网络实名制规定,未绑定将限制内容发布与互动
所有评论(0)