logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Strix Halo 笔记本跑大模型,Vulkan 才是 Windows 下的唯一解

本文深度解析 AMD Strix Halo 笔记本在 Windows 下运行大模型的最佳方案。实测证明 Vulkan 是唯一能稳定释放算力的后端,相比 ROCm 显著提升生成速度与显存利用率。文章提供 LM Studio 与 Ollama 的实战配置指南,助开发者避开驱动陷阱,高效部署本地 AI 应用。

#Strix Halo
Ryzen AI 笔记本跑大模型,Ollama 一行命令搞定

本文详解如何在搭载 AMD Strix Halo 架构的 Ryzen AI 笔记本上,通过 Ollama 一行命令快速部署本地大模型。利用统一内存架构实现 Radeon GPU 自动加速,大幅提升代码生成与离线推理效率,同时确保数据隐私安全,打造高效私有 AI 工作站。

#Ollama
大模型长文本推理显存不够用,ROCm 7.x 量化与重计算实战技巧

本文详解 ROCm 7.x 环境下大模型长文本推理的显存优化方案。通过 FP8 量化与激活值重计算实战技巧,有效解决 HIP out of memory 报错,在单卡资源有限时实现上下文翻倍,助力开发者低成本部署百亿参数模型。

实测数据说话,AMD GPU 跑大模型到底快不快

本文通过实测数据深度解析 AMD GPU 跑大模型的性能表现。基于 SGLang 框架与 TileLang 优化,对比了延迟、吞吐及显存效率。结果显示,在高并发场景下 AMD 方案性价比突出,为大规模推理部署提供客观参考。

PyTorch 迁移避坑指南,在 AMD 显卡上运行大模型的细节

本文详解 PyTorch 模型从 CUDA 迁移至 AMD 显卡的实战经验。基于 ROCm 7.x 生态,涵盖环境配置、自定义算子适配及性能优化策略。通过 Triton 重写与工具剖析,助开发者在 AMD Instinct GPU 上高效运行大模型,实现低成本推理部署。

成本与性能兼得,MI300X 运行 Llama3 大模型的实践思考

本文深入探讨利用 AMD MI300X 部署 Llama3 大模型的实践方案。通过 FP8 量化策略与 ROCm 环境调优,有效解决显存瓶颈,实现成本与性能的最佳平衡,为高并发推理提供高效、稳定的技术路径。

告别显存焦虑,64GB 统一内存让本地 32B 大模型丝滑运行

本文解析 AMD Strix Halo 统一内存架构如何打破显存瓶颈,让 64GB 内存笔记本丝滑运行 32B 大模型。通过量化技术与高带宽优势,实现本地 AI 高效推理与多任务并行,彻底告别显存焦虑,赋能开发者流畅部署大参数模型。

LLaMA-Factory 微调大模型教程,AMD 环境也能轻松搞定

本文详解在 AMD GPU 环境下利用 LLaMA-Factory 微调大模型的实战教程。涵盖 ROCm 环境搭建、PyTorch 配置及 LoRA 微调全流程,解决梯度爆炸等常见难题,助开发者轻松掌握大模型微调技术,高效部署 AI 应用。

#LoRA
为什么你的 AMD 显卡跑不动大模型,可能是后端选错了

AMD Strix Halo 笔记本跑大模型卡顿?可能是后端选错。本文解析 ROCm 在 Windows 下的兼容难题,推荐 Vulkan 作为最佳解决方案。通过 LM Studio 或 Ollama 切换 Vulkan 后端,可释放 GPU 算力,将生成速度提升至 30 tokens/s,让本地 AI 应用流畅运行。

本地大模型实战,14B 参数模型在 Strix Halo 上的代码辅助表现

本文实战评测 AMD Strix Halo 架构运行 Qwen2.5-Coder-14B 本地大模型的表现。通过 Vulkan 后端加速,实现代码重构、单元测试生成等任务的高效处理,首字延迟低至 0.4 秒。文章详解环境搭建与参数调优,展示端侧 AI 在保障数据隐私的同时,为开发者提供流畅的代码辅助体验。

    共 143 条
  • 1
  • 2
  • 3
  • 15
  • 请选择