logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

HX 370上使用 NPU 加速 LLM 实践

《在HX 370上使用NPU加速LLM实践》介绍了如何利用AMD Ryzen AI 300系列处理器(如HX 370)集成的XDNA 2架构NPU来运行大语言模型。文章详细说明了安装Lemonade Server工具、配置NPU的Turbo模式、选择适配的ONNX格式模型以及通过镜像站加速下载模型的方法。作者还分享了如何让Lemonade自动识别模型,并验证NPU是否正常工作。相比GPU推理,NP

文章图片
#人工智能#个人开发#云计算
养慢虾哲学:涡喷发动机——P100(16G)提速LLM突破50+Tokens/s

本文记录了作者通过升级显卡提升大模型推理性能的实践。作者先是用GTX960辅助P104矿卡获得一定性能提升,但受限于显存带宽瓶颈,最终选择升级到P100数据中心卡(16GB HBM2显存/732GB/s带宽)。测试显示,P100单卡运行27B量化模型时生成速度提升近一倍,在显存接近满载时仍保持稳定;与P104组合运行35B MoE完整版模型时,预填充和生成速度分别达到466t/s和53.55t/s

文章图片
#服务器#人工智能#云计算 +1
Quadro P2000 5G 老卡跑 35B 大模型:从“鸡肋”到“真香”的调优实录

摘要: 本文记录了在老旧Quadro P2000显卡(5GB显存)上成功运行35B参数MoE模型的全过程。通过对比测试发现,35B MoE模型在优化参数(ngl=8)下生成速度达11.88 t/s,反超9B稠密模型45%,且回答质量显著提升。关键优化包括精准控制GPU加载层数、采用KV Cache量化(q4_0)缓解显存压力。测试涵盖Qwen3.5和Gemma-4系列模型,证明老卡搭配MoE架构仍

文章图片
#云计算#人工智能
AMD AI9 HX370 小主机跑 Qwen3.6-27B:8.5 t/s 的“养慢虾“哲学

本文介绍了一种基于1升体积小主机的本地AI部署方案,搭载AMDAI9HX370处理器和Radeon890M集成显卡,通过优化配置在96GB内存中流畅运行27B参数的稠密大模型Qwen3.6-27B-MTP(Q4量化)。关键创新在于:1)利用推测解码技术(76.7%接受率)将生成速度提升至8.5t/s;2)采用KV缓存量化等内存优化手段;3)实现65W超低功耗与静音运行。作者通过实际日志分析证明,该

文章图片
#人工智能
P104-100 矿卡跑 35B-A3B 大模型:从“电子垃圾”到“Token FREE”

《矿卡重生记:8GB显存P104在Ubuntu上跑35B MoE模型的实战指南》 本文记录了作者将一张被淘汰的NVIDIA P104-100矿卡(8GB显存)改造成AI推理卡的完整过程。通过破解驱动、优化PCIe通道、精细调整卸载层数等技术手段,最终在Ubuntu系统上实现了Qwen3.6-28B MoE模型51t/s的prefill速度和20t/s的生成速度。文章详细分享了驱动安装、编译调优、P

文章图片
#人工智能#云计算#个人开发
养慢虾哲学:nanobot适配低速大模型

本文介绍了如何优化本地低速LLM(如8.5t/s)与Nanobot的配合使用。主要内容包括:1)Nanobot的初始配置,建议在虚拟机中安装并设置多项目工作区;2)解决低速LLM导致的超时问题,通过修改openai_compat_provider.py将默认120秒超时延长至1800秒;3)让Nanobot自我诊断上下文构建等系统问题;4)强调工具应适应人的使用节奏,低速LLM也能有效工作。作者提

文章图片
#人工智能#云计算#个人开发
llama.cpp 让 2840 亿参数的大脑 (Ds4-Flash)住进了筒子楼

一张没有显示输出的矿卡,一张九年前的亮机卡。一块在暗无天日的矿场里燃烧过青春,一块在某个玩家的机箱里安静地老去。它们被从电子垃圾堆里打捞出来,插进同一块主板,接通电源,风扇重新转起。我曾试图让那个为 M4、DGX Spark 们准备量化模型的专用引擎接纳它们,结果换来一阵沉默的拒绝。而最终,是那个从不嫌弃任何硬件的通用运行器,伸出了手。此时此刻,在这两片废弃硅片的深处,一个拥有 2840 亿个参数

文章图片
#深度学习#人工智能
AMD AI9 HX370 小主机跑 Qwen3.6-27B:8.5 t/s 的“养慢虾“哲学

本文介绍了一种基于1升体积小主机的本地AI部署方案,搭载AMDAI9HX370处理器和Radeon890M集成显卡,通过优化配置在96GB内存中流畅运行27B参数的稠密大模型Qwen3.6-27B-MTP(Q4量化)。关键创新在于:1)利用推测解码技术(76.7%接受率)将生成速度提升至8.5t/s;2)采用KV缓存量化等内存优化手段;3)实现65W超低功耗与静音运行。作者通过实际日志分析证明,该

文章图片
#人工智能
P104 8GB 魔改矿卡跑 28B MoE:从 20 t/s 到 30 t/s 的终极压榨

《榨干P104矿卡潜能:30t/s跑28B大模型的调优实战》摘要:通过深入分析MoE模型结构特性,作者在Ubuntu系统下对8GB显存的NVIDIA P104矿卡进行极限调优。关键发现包括:1)采用-ngl999参数将非MoE模块全载入GPU;2)通过二分法精准定位--n-cpu-moe=24的临界值,平衡显存占用与计算效率;3)验证8线程为CPU-GPU数据传输最优解。经过四轮压力测试,最终实现

文章图片
#人工智能
P2000 5GB 跑 35B MoE 模型:从 12 t/s 到 18 t/s 的调优实录

本文分享了对仅5GB显存的Quadro P2000显卡进行深度调优的经验,通过MoE模型的分层卸载策略,成功将Qwen3.6-35B/28B大模型的推理速度提升至18t/s。关键发现包括:必须确保--n-cpu-moe≥30以避免显存溢出导致的性能暴跌,最佳线程数为8而非越多越好,以及如何通过二分法快速定位参数甜点。最终配置(-ngl 999 --n-cpu-moe 36 -t 8)让这张&quo

文章图片
#人工智能#深度学习
    共 19 条
  • 1
  • 2
  • 请选择