
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
GGUF是一种专为本地大模型部署设计的文件格式,与量化算法(如AWQ/GPTQ)不同,它致力于将模型权重、结构、分词器等所有必要信息打包成单一文件,实现开箱即用的便捷体验。其核心优势在于: 自包含单文件:整合模型全部组件,避免多文件管理的繁琐。 跨平台兼容性:通过CPU优化和内存映射技术,支持笔记本、Mac等无GPU设备运行。 高效加载设计:文件结构分为元数据(键值对存储配置)和张量数据(分块量化
KV Cache 量化:解决长上下文推理中的显存瓶颈 摘要: 本文探讨了长上下文推理中的关键显存瓶颈——KV Cache问题。当模型权重被量化到4bit后,加载后剩余显存看似充足,但在处理长上下文或高并发时仍会出现OOM现象,原因在于动态增长的KV Cache显存占用。文章从注意力机制原理出发,详细分析了KV Cache的组成、计算方式和显存占用规律,指出在短对话中KV Cache仅占几百MB,但
文章摘要: 本文深入解析了模型量化中的两种主要方法——PTQ(训练后量化)和QAT(量化感知训练)的区别与应用场景。PTQ直接对预训练模型进行量化,速度快、成本低,适合大模型部署;QAT则在训练阶段模拟量化过程,精度更高但计算成本昂贵。文章通过原理拆解、代码示例和对比分析指出:PTQ凭借性价比优势成为大模型时代的主流选择,而QAT仅在极低比特或高精度要求的特殊场景下才值得考虑。作者用一个PyTor
前三篇我们讲了为什么量化、量化的数学、还有 PTQ/QAT 两条路。这篇要讲讲 FP32、FP16、BF16、INT8、INT4、FP8、NF4——它们到底是啥,一个比特一个比特是怎么排的,又各自适合干什么。
本文介绍了GPTQ量化方法的原理与实战应用。GPTQ是一种4bit量化技术,其核心创新在于从"权重对齐"转向"输出对齐",通过二阶Hessian矩阵和误差补偿机制,在低比特下保持模型精度。文章详细拆解了GPTQ的数学原理,包括优化目标、Hessian矩阵的作用以及算法流程,并通过接地气的类比帮助读者理解其"边量化边补偿"的核心思想。文中还讨论了关键设计参数(如校准数据、分组大小、阻尼系数等)的影响
这篇文章详细介绍了如何将HuggingFace模型转换为GGUF格式并进行量化推理的完整流程。主要内容包括: 整体流程:从HuggingFace模型到GGUF格式转换(FP16),再进行量化压缩,最后本地推理运行 关键步骤: 编译安装llama.cpp工具链 使用convert_hf_to_gguf.py脚本将模型转换为FP16的GGUF格式 用llama-quantize工具进行不同档位的量化(
这是《大模型量化从0到1》系列的第 2 篇。上一篇我们建立了"三角权衡"的直觉,知道了量化能省显存、代价是精度。但要真正理解 GPTQ、AWQ、GGUF 为什么效果不同,你必须先看懂。这一篇我们不放过任何一个公式,从最基础的映射一路手撕到 per-group 量化,每个公式都配可运行的 NumPy/PyTorch 代码,让你亲眼看到每一个数字是怎么算出来的。看完这篇,后面所有格式的原理你都能秒懂。
erate bitsandbytes ### 5.2 加载原始 FP16 模型 ```python from transformers import AutoModelForCausalLM model_name = "facebook/opt-6.7b" # 6.7B 参数 model_fp16 = AutoModelForCausalLM.from_pretrained(model_name,
前三篇我们讲了为什么量化、量化的数学、还有 PTQ/QAT 两条路。这篇要讲讲 FP32、FP16、BF16、INT8、INT4、FP8、NF4——它们到底是啥,一个比特一个比特是怎么排的,又各自适合干什么。
文章摘要: 本文深入解析了模型量化中的两种主要方法——PTQ(训练后量化)和QAT(量化感知训练)的区别与应用场景。PTQ直接对预训练模型进行量化,速度快、成本低,适合大模型部署;QAT则在训练阶段模拟量化过程,精度更高但计算成本昂贵。文章通过原理拆解、代码示例和对比分析指出:PTQ凭借性价比优势成为大模型时代的主流选择,而QAT仅在极低比特或高精度要求的特殊场景下才值得考虑。作者用一个PyTor







