
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文详解 Ollama 国内镜像源配置与自定义模型存储路径设置。通过配置 OLLAMA_REGISTRY 加速下载,利用 OLLAMA_MODELS 将大模型迁移至 D 盘,有效解决网络超时与 C 盘空间不足痛点,助开发者高效部署本地大模型。
本文详解如何利用官方 Docker 镜像在 AMD MI300X 上快速部署 Llama 3.1。通过 ROCm 7.x 与 vLLM 的深度优化,支持 BF16 及 FP8 量化,显著降低环境配置成本并提升推理吞吐,是大模型高效落地的稳定方案。
摘要 本文提供了一份在AMD ROCm环境下编译部署PyTorch的完整实战指南。主要内容包括:1)环境准备与权限配置,强调用户组设置和编译器版本检查;2)驱动验证与GPU架构识别,通过rocm-smi和rocminfo工具确认硬件状态;3)源码编译关键步骤,重点说明PYTORCH_ROCM_ARCH等环境变量设置;4)部署优化实践,介绍vLLM服务的显存调优和启动参数配置。文章针对ROCm平台的
本文深入解析 ROCm 7.x 新特性,揭示其如何通过 hipBLASLt 稀疏优化、HIP 编译器指令调度及 vLLM 异步执行流,显著提升大模型推理效率。实测显示长上下文场景延迟降低 20%,为高并发应用提供稳定高性能支持。
摘要: SGLang通过RadixAttention和连续批处理技术优化大语言模型本地部署的显存管理,显著提升推理效率。安装时需注意CUDA版本匹配,推荐使用pip install "sglang[all]"。加载LLaMA-3-8B模型后,通过调整--mem-fraction-static等参数可平衡显存与吞吐量。测试显示,SGLang在并发请求下吞吐量可达传统方式的2-3倍,尤其适合消费级显卡
本文详解基于 AMD Instinct GPU 的多卡并行推理实战。通过优化张量并行配置、检查硬件拓扑、实施 NUMA 进程绑核及调优 RCCL 通信后端,有效打破显存墙并提升大模型吞吐量。文章提供基准测试方法,助力企业实现线性加速比,最大化集群算力效率。
本文详解 Ollama 国内镜像源配置与自定义模型存储路径设置。通过配置 OLLAMA_REGISTRY 加速下载,利用 OLLAMA_MODELS 将大模型迁移至 D 盘,有效解决网络超时与 C 盘空间不足痛点,助开发者高效部署本地大模型。
本文详解 AMD Instinct GPU 部署 vLLM 全流程,涵盖 DevCloud 环境初始化、ROCm 7.x 驱动安装验证及 PyTorch 源码编译关键点。通过精准配置用户权限与架构变量,解决常见报错,助开发者快速启动高效推理服务,掌握 AI 大模型在 AMD 生态的落地实践。
本文分享在 GitHub 高效查找 AI 开源项目的技巧,通过高级筛选语法锁定活跃项目。重点解析如何利用提交频率、文档质量及 Issues 互动判断项目健康度,帮助开发者精准定位 LLaMA-Factory 等高质量工具,避免无效搜索。
本文是一篇面向Git初学者的实用指南,旨在帮助读者快速掌握代码版本管理的核心技能: 环境配置:详细说明了Git本地安装步骤和远程平台账号注册方法,强调邮箱一致性的重要性。 概念解析:用写日记的生动类比解释Git核心概念(工作区、暂存区、版本库、分支),使抽象概念易于理解。 实战操作:分步演示仓库创建、代码提交、分支管理和远程推送的全流程,提供可直接运行的命令示例。 协作开发:介绍Pull Requ







