登录社区云,与社区用户共同成长
邀请您加入社区
本文测试了AMD 7900XTX显卡(24GB显存)在本地运行LTX-2.3数字人生成系统的性能表现。通过15组不同分辨率和时长的测试,得出以下结论:1. 7900XTX可稳定运行低显存方案,生成5-10秒带同步音频的数字人口播视频;2. 实用推荐参数:640×640分辨率10秒(最快)、544×960竖屏7-8秒、768×768高清5-7秒;3. 主要瓶颈是采样速度而非内存,建议采用短片段拼接方
数字人直播的省钱,从来不是选最便宜的入门工具,而是选最适合自身运营周期、全周期投入产出比最高的方案。当直播从 “尝鲜” 变成 “生意”,本地部署,注定会成为越来越多商家的必然选择。
数字人直播已成为商家重要工具,但90%的商家因选错系统面临隐性成本高、断流限流等问题。通过对5款主流系统的实测对比,发现登登AI凭借全本地化架构在运行稳定性(99.7%无故障率)、成本透明度(3年总成本1.36万元)、转化能力(话术重复率9.2%)和合规性(风控通过率99.7%)全面领先。云端方案短期试水成本低,但长期运营时登登AI的买断制优势显著:日均直播>5小时的企业,3年可节省80%以
dataclass"""缓存配置"""block_size: int = 16 # 每个缓存块包含的 token 数max_cache_blocks: int = 4096 # 最多缓存的 KV Block 数eviction_policy: str = "lru" # 淘汰策略: "lru" 或 "lfu"enable_kv_cache: bool = True # 是否同时启用常规 KV Ca
硬核编译,集编译技巧大全
在 AMD Radeon Cloud 的 ROCm 单卡环境上,用 LoRA 对 Gemma 4 做情绪分类微调。单卡 17 分钟跑完 1 轮,准确率从 0.625 提升到 0.915,Macro F1 从 0.4824 提升到 0.8645。本文记录完整调优过程与结果分析。
本文详细记录了在AMD Radeon Cloud单卡环境下,使用Qwen3-0.6B模型和LoRA方法微调明日方舟干员助手的过程。作者从环境配置(ROCm 6.x)、数据集构建(8,846条干员问答对)到模型训练(8-15分钟完成)进行了完整说明,重点展示了小模型(0.6B参数)通过LoRA高效微调(仅训练0.22%参数)实现专业化任务的能力。最终得到的助手不仅能准确回答干员属性、技能等游戏知识,
在之前的篇章中我们已经使用 ollama 部署了一个基于预量化(gguf)的 Qwen1.5 模型,这个模型除了提供研发使用外,我还想提供给公司内部使用,因此还需要一个 ui 交互界面。显然,这对于我们开发人员来说不是什么难事(毕竟 ollama 已经提供了相对比较完善的 API 接口了),但都 2024 年了与其自己开发还不如先找个开箱即用的…你看,这不已经有大神开发出 open-webui 了
作为 Google DeepMind 的最新力作,Gemma 4 带来了五种不同规模的参数(E2B、E4B、12B、26B MoE、31B),并且在 **12B 以上版本中完全消除了独立编码器**,将图像、音频与文本直接投影到单个解码器 Transformer 空间中。对于需要高吞吐、多并发的团队,或者需要部署 31B 密集模型、26B MoE 模型的场景,必须采用 **vLLM** 框架,利用其
用 AMD Radeon RX 7900 XTX 单卡,以 Qwen3-4B 为底座、LoRA 做参数高效微调,训练一个《绝区零》仪玄角色助手,再通过 vLLM 部署推理,配合 ChromaDB 向量检索和防 OOC 校验器,实现风格还原 + 知识准确 + 人设稳定。本文记录从环境配置、数据集构建、LoRA 微调、vLLM 部署到踩坑填坑的全流程,AMD ROCm 生态实战可复现。
Ollama+DeepSeek本地化部署简要步骤
测下来,Klein 不是跑分玩具,是能嵌进内容生产链路的模型。24G 卡上 9B 已稳,4B 也千万别扔——一个出活,一个探路,配合 ComfyUI 和后期工具,日常输出效率能提一大截。这篇文章只讲到「能不能跑、怎么选、实际体感」,想看完整可落地的部署方案Flux2-Klein-4B / 9B 需要下载哪些模型文件;在 ComfyUI 中如何放置这些文件;为什么不能直接套用旧的 FLUX.1 工作
本文介绍了在AMD开发者云平台上部署Google Gemma4-E4B-it大模型的完整流程。首先通过ROCm环境验证GPU可用性,然后使用ModelScope下载模型权重(约15G)。关键步骤包括安装适配ROCm的vLLM推理框架(需重装特定版本)、启动HTTP服务进行模型加载,并通过新终端进行对话测试。文章提供了详细命令速查表,并针对常见问题(如下载失败、显存不足等)给出解决方案。整个部署过程
分块缓存架构:以固定大小的块为单位存储 KV 缓存,兼顾匹配粒度和存储效率哈希前缀匹配:通过 SHA256 哈希快速定位缓存块,O(1) 查询复杂度多策略淘汰:实现 LRU 和 LFU 两种淘汰策略,支持灵活的空间管理并发安全:使用 RLock 保证多线程环境下的数据一致性分级存储:支持 GPU → CPU → 磁盘的三级缓存层次性能监控:完整的统计系统,便于调优和诊断前缀缓存是大模型推理优化的核
Ollama是一款开源工具,其目标是简化大语言模型在本地环境的部署和使用。它支持多种流行的开源大语言模型,如 Llama 2、Qwen2.5等。介绍Ollama部署和常用命令。
但是占用显存较多,显存是缓慢上升的过程,到二十多步的时候就开始爆了。启用webui共有两种方式,一种是直接启动,一种是通过docker启动。使用的GPU 第一块卡,刚开始的时候 批处理设置的太大,容易造成显卡内存溢出,根据自己的实际情况设置。接下来又问了一句”鲁迅可以打周树人吗“,回答是没有问题,就是速度慢了点,右边还有很多的参数可以调整。③使用stage=3的时候,每step 40s,刚开始使用
注:如果你的模型比较大,一台显卡无法加载你的模型,你可以选择使用deepspeed单机多卡,DeepSpeed stage选择zero3,如果你一张显卡能够微调,但你有多张显卡的话,这里建议你使用zero2,可以提高接近两倍的训练速度,也就是节省一半的时间。如果你的模型参数比较大,一张卡无法加载你的模型参数,那么你就需要使用单机多卡来训练模型,你可选择deepspeed的zero3,如果你的一张显
使用vLLM容器部署开源模型,暴露一个 API 接口,使用另一个容器访问。
本文介绍了使用vLLM框架部署大语言模型的方法。主要内容包括:1)环境配置,建议安装vLLM和flash-attn;2)模型部署,提供原始模型和LoRA微调模型两种部署方式,详细说明启动参数及调用方法;3)示例代码展示如何使用Python API和curl命令调用服务。文章还包含参数说明表格,并推荐了更详细的参数解读资料。部署过程支持多GPU并行,可加载本地模型或HuggingFace模型库中的模
vLLM是一个高效的大语言模型推理开源工具,采用PagedAttention和连续批处理技术提升显存利用率和推理效率。实验显示在14GB显存显卡上运行Qwen3-VL-4B-Instruct模型时,合理配置max-model-len等参数可优化资源使用。建议max-num-seqs设为1-2,gpu-memory-utilization设为0.95,避免使用cpu-offload-gb等影响性能的
通过vLLM源码构建Docker镜像,提升了构建的灵活性与安全性,同时也优化了研发与部署的效率。
LLaMA-Factory是一个集多种微调技术于一身的高效框架,支持包括Qwen2-7B在内的多种大型语言模型。它通过集成如LoRA、QLoRA等先进的微调算法,以及提供丰富的实验监控工具,如LlamaBoard、TensorBoard等,为用户提供了一个便捷、高效的微调环境。详细见。
前面这个写过,但觉得写的不是很好,这次是参考命令运行脚本,讲解各个参数含义。后续尽可能会更新,可以关注一下专栏!!LLaMA-Factory项目的地址:https://github.com/hiyouga/LLaMA-Factory/blob/main/README_zh.md在LLaMA-Factory项目中,单显卡可以用命令或web页面训练,多显卡只能用用命令的方式,此文章以命令和单显卡为主讲