logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型量化从0到1(二):量化的数学本质——对称、非对称与 per-group 手撕

这是《大模型量化从0到1》系列的第 2 篇。上一篇我们建立了"三角权衡"的直觉,知道了量化能省显存、代价是精度。但要真正理解 GPTQ、AWQ、GGUF 为什么效果不同,你必须先看懂。这一篇我们不放过任何一个公式,从最基础的映射一路手撕到 per-group 量化,每个公式都配可运行的 NumPy/PyTorch 代码,让你亲眼看到每一个数字是怎么算出来的。看完这篇,后面所有格式的原理你都能秒懂。

#语言模型#自然语言处理#算法 +4
大模型量化从0到1(一):为什么要量化?显存、精度、速度的三角权衡

erate bitsandbytes ### 5.2 加载原始 FP16 模型 ```python from transformers import AutoModelForCausalLM model_name = "facebook/opt-6.7b" # 6.7B 参数 model_fp16 = AutoModelForCausalLM.from_pretrained(model_name,

#机器学习#线性回归#人工智能 +1
大模型量化从0到1(四):FP16、INT8、INT4、FP8、NF4 到底差在哪

前三篇我们讲了为什么量化、量化的数学、还有 PTQ/QAT 两条路。这篇要讲讲 FP32、FP16、BF16、INT8、INT4、FP8、NF4——它们到底是啥,一个比特一个比特是怎么排的,又各自适合干什么。

#pytorch#人工智能#python +2
大模型量化从0到1(三):PTQ 和 QAT 到底怎么选,一篇讲透

文章摘要: 本文深入解析了模型量化中的两种主要方法——PTQ(训练后量化)和QAT(量化感知训练)的区别与应用场景。PTQ直接对预训练模型进行量化,速度快、成本低,适合大模型部署;QAT则在训练阶段模拟量化过程,精度更高但计算成本昂贵。文章通过原理拆解、代码示例和对比分析指出:PTQ凭借性价比优势成为大模型时代的主流选择,而QAT仅在极低比特或高精度要求的特殊场景下才值得考虑。作者用一个PyTor

#人工智能#机器学习#深度学习 +2
大模型量化从0到1(五):GPTQ 原理详解 + 从零量化一个真实大模型

本文介绍了GPTQ量化方法的原理与实战应用。GPTQ是一种4bit量化技术,其核心创新在于从"权重对齐"转向"输出对齐",通过二阶Hessian矩阵和误差补偿机制,在低比特下保持模型精度。文章详细拆解了GPTQ的数学原理,包括优化目标、Hessian矩阵的作用以及算法流程,并通过接地气的类比帮助读者理解其"边量化边补偿"的核心思想。文中还讨论了关键设计参数(如校准数据、分组大小、阻尼系数等)的影响

#python#人工智能#算法 +1
大模型量化从0到1(六):AWQ 为什么更准——激活感知权重量化的巧思

摘要: AWQ(激活感知权重量化)是一种创新的4bit量化方法,其核心思想是通过激活而非权重本身判断通道重要性。研究发现,保护激活幅度大的1%关键通道即可显著保持模型精度。AWQ采用数学上的等价缩放技术,对重要权重放大(提高量化精度)并对应缩小激活值,在保持INT4统一精度的同时降低关键通道的量化误差。相比GPTQ的误差补偿策略,AWQ通过预统计激活分布和缩放系数搜索实现更高效的保护,且无需混合精

#机器学习#人工智能#深度学习
大模型量化从0到1(八):GGUF 格式彻底解剖——llama.cpp 生态的基石

GGUF是一种专为本地大模型部署设计的文件格式,与量化算法(如AWQ/GPTQ)不同,它致力于将模型权重、结构、分词器等所有必要信息打包成单一文件,实现开箱即用的便捷体验。其核心优势在于: 自包含单文件:整合模型全部组件,避免多文件管理的繁琐。 跨平台兼容性:通过CPU优化和内存映射技术,支持笔记本、Mac等无GPU设备运行。 高效加载设计:文件结构分为元数据(键值对存储配置)和张量数据(分块量化

#人工智能#深度学习#pytorch
大模型量化从0到1(七):autoawq 实战——把一个真实模型量化到 INT4

本文是一篇AWQ量化实战指南,通过autoawq库完整演示了将FP16大模型量化为INT4的流程。文章从环境准备、模型选择开始,详细讲解了校准数据准备、量化执行、参数配置等关键步骤,量化后模型大小缩减至原版的30%左右。核心参数如w_bit、q_group_size、zero_point等均对应AWQ原理,量化后的模型可直接加载推理。全文提供可复现代码,帮助读者快速掌握量化技术,在保持模型精度的同

#语言模型#自然语言处理#算法 +1
大模型量化从0到1(九):用 llama.cpp 把模型转成 GGUF 并跑本地推理

这篇文章详细介绍了如何将HuggingFace模型转换为GGUF格式并进行量化推理的完整流程。主要内容包括: 整体流程:从HuggingFace模型到GGUF格式转换(FP16),再进行量化压缩,最后本地推理运行 关键步骤: 编译安装llama.cpp工具链 使用convert_hf_to_gguf.py脚本将模型转换为FP16的GGUF格式 用llama-quantize工具进行不同档位的量化(

#pytorch#人工智能#python +1
大模型量化从0到1(十):bitsandbytes——一行配置就量化的最省心方案

文章摘要: 本文深入解析了bitsandbytes量化工具,它通过在线量化实现"加载即4bit/8bit"的便捷体验,无需预先校准或转换模型。与GPTQ/AWQ等离线量化方案不同,bitsandbytes在模型加载时实时转换权重,牺牲部分精度换取极致易用性。其核心技术包括LLM.int8()的混合精度处理离群值、QLoRA推广的NF4正态分布量化,以及双重量化压缩scale参数。文章提供了黄金配置

#python#人工智能#机器学习 +1
    共 27 条
  • 1
  • 2
  • 3
  • 请选择