登录社区云,与社区用户共同成长
邀请您加入社区
为了将 70B 大语言模型的部署成本打下来,我们将线上 vLLM 推理集群的模型权重与激活值从 FP16 全量量化到了 INT8(采用 W8A8 方案)。量化效果立竿见影:单卡 A100-80G 的显存占用直接从 140GB(需 2 卡并行)缩减到了 70GB,单卡即可拉起,推理吞吐量(Tokens/s)提升了将近一倍。然而上线不到两天,客服渠道就接到了多起投诉。在处理复杂代码推导和长文本逻辑分析
本文基于YOLOv5算法设计了一个口罩佩戴检测系统,旨在通过深度学习技术提升公共场景下的疫情防控效率。系统采用850张标注数据(包含佩戴口罩、未正确佩戴和未佩戴三类),通过数据增强和80/20划分训练集与验证集。详细阐述了YOLOv5网络结构、训练流程及预测实现,并展示了包括准确率、召回率等性能指标。实验结果表明,该系统能有效识别口罩佩戴状态,具有实际应用价值。最后通过PyQt实现了图形化交互界面
Go 中声明变量但不初始化,变量会自动获得该类型的"零值"。这是一个非常贴心的设计,避免了 C/C++ 中未初始化变量的未定义行为。这篇文章会从变量声明讲到所有基本类型,再到格式化输出,涵盖你日常编码需要的全部基础。:缩写全大写(URL、ID、HTTP),驼峰不蛇形(不用下划线),大写公开小写私(首字母控制可见性)。是 Go 中最常用的调试输出函数,掌握格式化动词能让你的调试效率翻倍。Go 社区有
本文介绍了作者为个人Django博客开发在线工具箱的过程。该工具箱整合了图片压缩、格式转换、二维码生成、JSON格式化等常用工具,强调本地处理以确保隐私安全。文章分享了整体设计思路,包括前后端职责划分(Django负责页面路由和渲染,前端JS处理核心功能),并列举了适合纯前端实现的技术方案(如Canvas处理图片、Web Crypto API生成哈希)。作者还提供了具体实现示例,如利用File A
本文介绍了NumPy库的核心概念和基本操作。NumPy作为Python科学计算的基础库,其核心是ndarray(N维数组)对象,相比原生Python列表具有显著优势:内存块风格(连续存储、类型一致)、并行化运算和底层C语言实现带来的高效计算。文章详细讲解了ndarray的属性(形状、维度、类型等)、不同维度的数组表示方法,以及数据类型体系。最后介绍了数组的基本操作,包括生成方法和索引切片机制。Nu
模型推理部署是将AI能力转化为生产服务的关键环节。推理调度器管理请求队列和批处理,GPU资源管理器分配和监控显存,模型热加载支持不停机更新。三者协同,构成推理服务化的基础设施。工程落地的核心考量:批处理大小需要根据延迟SLA和吞吐目标权衡;GPU显存分配需要预留KV Cache和运行时开销;冷启动问题需要预热实例或预加载策略;量化是降低显存和成本的有效手段,但需要评估精度损失。推理部署不是一次性工
i++ {// 获取json标签continue // 跳过没有标签或显式忽略的字段// 解析标签name = strings.ToLower(field.Name) // 默认使用小写字段名// 处理omitemptycontinuereturn!v.Bool()default:// 使用示例ID: 0, // 会被omitempty忽略Product: "Go编程指南",
AI 模型部署架构的核心优化方向有三个:通过动态批处理提升 GPU 利用率、通过模型路由降低综合推理成本、通过弹性伸缩应对流量波动。动态批处理是最立竿见影的优化——从单请求推理切换到动态批处理,GPU 利用率通常能从 30% 提升到 70% 以上。落地路线:先用 vLLM/TGI 等推理框架跑通单实例部署,验证模型推理性能基准;再引入动态批处理和模型路由,优化吞吐量和成本;最后部署弹性伸缩,应对流
LLM 推理优化的核心是减少显存带宽瓶颈和提高 GPU 利用率。PagedAttention 减少显存碎片,连续批处理提高 GPU 利用率,量化用精度换速度,Speculative Decoding 用小模型加速大模型。按 ROI 排序:量化 > 连续批处理 > KV Cache 优化 > Speculative Decoding。所有优化手段都必须在业务数据集上验证精度损失,通用指标(如 per
在通过创建全新虚拟环境条件下,使用方式安装VLLM后,遇到了VLLM使用方面的异常,经过多种方式尝试解决,最终无果。仔细查看官方文档后,发现其中有2段话尤为重要:1.如果使用的是不同的CUDA版本,或者想要使用现有的PyTorch安装,则需要从源代码构建vLLM。2.vLLM的二进制文件默认使用CUDA 12.1和公共PyTorch发行版本进行编译。另外还提供使用CUDA 11.8和公共PyTor
支持包括Qwen2-7B在内的多种大型语言模型。它通过集成如LoRA、QLoRA等先进的微调算法,以及提供丰富的实验监控工具,如LlamaBoard、TensorBoard等,为用户提供了一个便捷、高效的微调环境。此外,LLaMA-Factory还支持多模态训练方法和多硬件平台,包括GPU和Ascend NPU,进一步拓宽了其应用范围。
GitHub也能CI/CD了!如何使用GitHub的Action?一,什么是CI/CD见另一篇文章二,GitHub的ActionGitHub的Action是一种自动化的CI/CD工具,可以让你在GitHub上自动执行一些指令,比如构建、部署、推送代码等。不光如此,在触发action之后,相当于我们有了一个暂时的服务器,用这个甚至可以白嫖一些计算资源,ひひひひひ三,GitHub Actions 的使
6月18日,第十四届“中国•海峡项目成果交易会”在福州隆重开幕,担当起“双创”大舞台的新角色。一年一度的“6.18”已成为大力推进自主创新,引导高校和科研机构科技创新资源、成果与企业需求对接,推进科技成果向现实生产力转化,实现合作共赢的平台。作为福建省最大的项目交流盛会,吸引了逾4000家来自海内外知名企业、科研院所参加。第十四届“中国•海峡项目成...
简介GitHub作为一个开源的托管服务,自然是允许许多集成开发环境与Github进行连接,可以将代码托管到Github上(有点像是代码的云),也可以将Github上的别人的项目代码直接克隆到自己电脑上运行,其基本原理如图。接下来就直接介绍IntelliJ IDEA和Github的连接。详解1.首先当然是先要有一个Github的账号了(哈哈哈,说个废话)2.如果是在windows上操作,先下载一个G
整体通俗理解下,大模型和参数,大模型就是一个聪明的大脑,它通过观察大量数据图片、文字等你想让他学的一切,根据你让他学的东西,来转化成相关的参数(也就是数字,因为机器只认数字),每个参数帮助它理解数据的不同方面,比如颜色、形状或语言的含义。根据大量的数据训练的深入,不断产生、优化、调整这些参数,大脑就越聪明,能够更好地完成给他的命令。普通人如果想玩AI大模型,使用 LM Studio 也是个不错的选
ollama使用官方脚本安装本地文件。本地文件可以用下载工具先下载好。
推荐理由:有可视化界面,大模型库全面,维护方便,对windows用户友好,模型迁移方便(迁移时直接复制粘贴即可),多模态大模型支持特别友好,接口参数固定(目前是)缺点:更新频繁,模型下载过慢,似乎对linux操作系统不是特别友好,模型下载往往需要下载一天(可能下载失败)
再比如 PyTorch,它死死占据了深度学习研究 85% 的江山,因为深度学习的核心是模型权重,至于外面封装的那层皮是什么语言,PyTorch 根本不在乎。但到了 2026 年,Claude、GPT-5.5、DeepSeek 这些模型早已是“代码大神”,甚至在 SWE-bench 这种极其硬核的基准测试中,都已经达到人类高级工程师的水平。这话听着反直觉,逻辑却很硬:“Rust 编译器就像一位严苛但