登录社区云,与社区用户共同成长
邀请您加入社区
为了将 70B 大语言模型的部署成本打下来,我们将线上 vLLM 推理集群的模型权重与激活值从 FP16 全量量化到了 INT8(采用 W8A8 方案)。量化效果立竿见影:单卡 A100-80G 的显存占用直接从 140GB(需 2 卡并行)缩减到了 70GB,单卡即可拉起,推理吞吐量(Tokens/s)提升了将近一倍。然而上线不到两天,客服渠道就接到了多起投诉。在处理复杂代码推导和长文本逻辑分析
本文介绍了在Ubuntu 22.04系统上部署Qwen2.5-VL-3B-Instruct视觉模型的完整流程。教程详细说明了硬件配置要求(NVIDIA RTX GPU+CUDA 12.6)、系统依赖安装、Python虚拟环境搭建、模型下载(支持ModelScope和HuggingFace两种方式)以及使用vLLM框架启动推理服务的关键步骤。重点提供了vLLM服务的启动参数优化建议,包括显存管理、并
本文系统分析了十种主流大语言模型(LLM)服务引擎和工具的技术特点与应用场景,涵盖从浏览器端推理到企业级部署的解决方案。WebLLM利用WebGPU实现浏览器端高性能推理;LM Studio提供本地化离线运行环境;Ollama专注轻量级本地部署;vLLM则通过PagedAttention技术优化GPU内存管理。这些工具在兼容性、计算效率、数据隐私等方面各具优势,同时也存在硬件依赖、模型支持等局限性
Meta-Llama-3.1-8B-Instruct 是 Meta 公司推出的新一代开源大语言模型。作为 8B 参数级别中的标杆模型,该版本经过了深度的指令微调(Instruction-Tuned),不仅具备出色的多语言文本理解能力,在逻辑推理、复杂指令遵循以及代码生成方面均表现出行业领先的水准。其标准的 Transformer 架构设计,保障了极高的生态兼容性与系统稳定性。
如何解决主流E2M1格式在FP4预训练中因几何不对称导致的系统性收缩偏差及训练不稳定问题?论文揭示了非均匀格式的收缩偏差根源,提出基于均匀网格的UFP4配方,实现了全路径RHT并显著提升训练精度。
轴向编码(分类法):将这些标注的错误归类为不同的、可管理的类别,以识别应用中最主要的痛点(例如,检索上下文不佳、工具使用错误、或语调不当)。编写有针对性的评估:让数据分析过程中发现的模式驱动你的测试策略。构建自动化评估,专门用于捕捉这些观察到的错误,而不是编写通用或任意的测试。回顾真实轨迹:收集具有代表性的用户交互数据集(如果应用是全新的,也可以生成合成数据),并逐一回顾对话,直到不再出现新的见解
1.理论带宽与有效带宽的鸿沟:PCIe 6.0 x16虽具备256GB/s的理论双向带宽(注:实际主流仍为PCIe 5.0 x16,双向128GB/s),但受协议开销、小数据块传输效率及双向数据争抢影响,实际有效吞吐量仅20-40GB/s,远低于显存内部带宽(如GDDR6X可达1TB/s以上)。•提供api供外部调用场景:优先考虑高显存显卡,甚至应该考虑HBM的计算卡,这类场景通常需要较高并发,但
几百 GB 的模型权重,怎么管理?这听起来像个"小事",但只要做大模型部署的人都知道,权重管理是个真坑。模型权重 140 GB,从 HuggingFace 下载要 8 小时,每次部署都重下太崩溃微调出了 50 个 LoRA,全堆在某台机器上,谁也不知道哪个是哪个推理服务想升级模型版本,发现没法平滑滚动——所有节点都要重新拉权重内网部署不能上 HuggingFace,怎么搭一个私有化的「HF Hub
目标: 从最基础的门电路出发, 用 sympy 的SOPform工具验证 CMOS 数字电路设计的"晶体管数估算"方法, 并把这一思路逐级扩展, 最终用于27B 参数 LLM 推理芯片的规模与速度估算。研究方法3-to-8 译码器↓ (1 输入对应 1 输出, 8 位最小案例验证)2×2 → 3×3 → 4×4 乘法器↓ (用 SOP 最小化, 确认增长趋势)8×8 (sympy 超时失败)↓16
本文详细介绍了大模型分布式推理中的五种并行策略:数据并行(DP)、张量并行(TP)、流水并行(PP)、专家并行(EP)和上下文并行(CP)。重点分析了各策略的核心思想、适用场景及通信开销: DP适合小模型高并发场景,但无法解决大模型显存问题 TP通过算子切分实现层内并行,需NVLink级高速互联 PP采用层间切分,适合跨机部署,但存在计算气泡 EP专为MoE模型设计,通过专家分布解决稀疏计算 CP
如果说 2017-2023 大模型的关键词是(参数和数据越多越好),那 2024-2026 就出现了一个全新关键词——Test-Time Scaling(推理时扩展)。这是和 MoE 并列的,过去三年大模型最重要的两大架构创新。让模型在回答前,先「思考很久」。简单一句话背后,是 OpenAI o1(2024.09)、DeepSeek R1(2025.01)、Claude 4 Thinking、Ge
*视觉语言模型(Vision Language Model, VLM)**是一类能够同时处理视觉信息(图像、视频)和文本信息,并在两种模态之间建立深度语义关联的人工智能模型。核心本质:VLM通过在共享的语义嵌入空间中对齐视觉特征和语言表示,实现"看图说话"、"听文生图"的跨模态理解与生成能力。理解图像内容并用自然语言描述遵循涉及视觉的复杂文本指令推理跨越视觉和语言的多模态信息泛化到训练时从未见过的
**摘要:**智谱AI开源新一代旗舰模型GLM-5.2,在推理能力、上下文长度、效率与生态四个维度实现突破。该模型具备128K长文本处理能力,推理性能提升30%,支持复杂指令遵循与专业级代码生成,在多项基准测试中媲美GPT-4级别模型。通过架构优化与量化技术,推理成本降至商业模型的1/5-1/10。国家超算互联网平台提供即用API服务,结合宽松开源协议,使企业能快速私有化部署。GLM-5.2标志着
本文系统性地解析了大模型(LLM)行业的发展现状、职位分类、核心技术知识图谱,并提供了候选人评估与面试提问技巧,最后还介绍了大模型人才寻访策略。文章涵盖了国内外大模型发展现状、产业链构成、人才需求、核心技术演进、职位详细解读、评估面试技巧以及人才寻访策略等多个方面,为猎头和算法候选人提供了全面的大模型职位知识参考。 目录包括:大模型行业全景、职位分类、各职位详细解读、核心技术知识图谱、候选人评估与
LuxTTS 是基于 ZipVoice 架构、支持商用的轻量化开源零样本语音克隆工具,仅需 3 秒人声素材即可复刻音色,48kHz 高采样率输出,显存占用低、推理速度快,兼容 NVIDIA、CPU、苹果 M 系列设备。文中对比多款主流 TTS 工具硬件与功能差异,提供源码本地部署、云端在线网页、可视化 UI 四种使用方案,附完整运行代码、音频规范与故障解决办法,适用于自媒体配音、有声书制作等场景,
Z-Image-Turbo是阿里开源的中文文生图模型(6B参数),具备三大核心优势:1)硬件门槛低(6G显存可运行,8G显卡10秒生成1024图);2)原生中文支持优秀;3)Apache-2.0协议商用免费。在AIArena评测中位列开源模型第一,画质优于部分闭源模型。对比Stable Diffusion推理速度快3-6倍,较32B参数的Flux模型效率提升20倍且人像更稳定,相比Midjourn
想体验大模型训练全流程(词元化→预训练→SFT微调→对话),却卡在没有GPU、租用昂贵这道门槛上?本文基于AMD"AI开发者计划"提供的免费48GB显存云GPU,手把手实操跑通Karpathy开源的nanochat项目。全程零硬件成本,适合零基础开发者和学生跟着操作。
面对GPU、Token、KV Cache、Wavefront、JIT编译……AI算力小白常常一头雾水,搞不清一条消息从输入框到大模型回答之间到底发生了什么,更分不清英伟达、AMD、华为三大生态的对应关系。本文让一句"Hi"变身第一人称旅行者,亲身穿越AI算力帝国的8层架构——从Cherry Studio到GPU芯片再原路返回,把抽象的算力黑箱拆成一段可读、可感、可记住的旅程。
在 AMD Radeon Cloud 的 ROCm 单卡环境上,用 LoRA 对 Gemma 4 做情绪分类微调。单卡 17 分钟跑完 1 轮,准确率从 0.625 提升到 0.915,Macro F1 从 0.4824 提升到 0.8645。本文记录完整调优过程与结果分析。
本文详细记录了在AMD Radeon Cloud单卡环境下,使用Qwen3-0.6B模型和LoRA方法微调明日方舟干员助手的过程。作者从环境配置(ROCm 6.x)、数据集构建(8,846条干员问答对)到模型训练(8-15分钟完成)进行了完整说明,重点展示了小模型(0.6B参数)通过LoRA高效微调(仅训练0.22%参数)实现专业化任务的能力。最终得到的助手不仅能准确回答干员属性、技能等游戏知识,