【96G显卡本地部署DeepSeek-V4-Flash-0731的Q2量化版】实现推理速度90+词元秒
【本地部署DeepSeek-V4-Flash-0731-Q2实现推理速度90+词元秒】
结论:
在本地单机部署,个人使用可以达到80~90 tokens/s,使用Q2量化版。启动参数如下:
PS D:\llama_cpp> cat .\huihuiaiDS.bat
@echo off
D:
cd /D D:\llama_cpp
llama-server ^
-m "F:\.lmstudio\huihui-ai\Huihui-DeepSeek-V4-Flash-0731-GGUF\DeepSeek-V4-Flash-Q2-0731.gguf" ^
-md "F:\modelscope\DeepSeek-V4-Flash-0731-GGUF\dspark\dspark-DeepSeek-V4-Flash-0731-BF16.gguf" ^
--alias "deepseek-v4-flash-0731-abli-Q2" ^
-c 196608 ^
-t 16 ^
-b 2048 ^
-ub 512 ^
-np 1 ^
--spec-type draft-dspark ^
--spec-draft-n-max 3 ^
--kv-unified ^
--port 12340
pause
PS D:\llama_cpp> .\huihuiaiDS.bat
下面是详细的运行报告和不同版本的测速报告:
运行环境介绍(硬件&软件):
内存:128G的 DDR5 4800 MT/S (32G * 4 )
显卡:96G显存的RTX Pro 6000 型号的显卡
硬盘:NVME硬盘 2T+
CPU:Intel i9-13900KF
系统:Windows 11
驱动版本:NVIDIA-SMI 595.71
CUDA Version:13.2
LLAMA CPP 版本:#b10295 版:llama-b10295-bin-win-cuda-13.3-x64 + CUDA 13.3 DLL
不同量化版本的运行脚本和速度情况:
1: unsloth / DeepSeek-V4-Flash-0731-GGUF / UD-IQ3_XXS 的速度约20 token/s
运行脚本如下:
PS D:\llama_cpp> cat .\deepseekServer.bat
@echo off
D:
cd /D D:\llama_cpp
llama-server ^
-m "F:\modelscope\DeepSeek-V4-Flash-0731-GGUF\UD-IQ3_XXS\DeepSeek-V4-Flash-0731-UD-IQ3_XXS-00001-of-00004.gguf" ^
--alias "DeepSeek-V4-Flash-0731-IQ3_XXS" ^
-c 196608 ^
-t 16 ^
-b 2048 ^
-ub 512 ^
-np 2 ^
--top-k 40 ^
--kv-unified ^
-ngl 40 ^
--no-mmap ^
--port 12340
pause
2:: 尝试加入DFlash技术,看看能否实现加速:结论是草稿接受度0.40的情况下,速度下降到了10-13 ts左右。
脚本如下:
PS D:\llama_cpp> cat .\deepseekServer_DSpark.bat
@echo off
D:
cd /D D:\llama_cpp
llama-server ^
-m "F:\modelscope\DeepSeek-V4-Flash-0731-GGUF\UD-IQ3_XXS\DeepSeek-V4-Flash-0731-UD-IQ3_XXS-00001-of-00004.gguf" ^
-md "F:\modelscope\DeepSeek-V4-Flash-0731-GGUF\dspark\dspark-DeepSeek-V4-Flash-0731-BF16.gguf" ^
--alias "DeepSeek-V4-Flash-0731-IQ3_XXS" ^
-c 196608 ^
-t 16 ^
-b 2048 ^
-ub 512 ^
-np 2 ^
--top-k 40 ^
--kv-unified ^
--spec-type draft-dspark ^
--spec-draft-n-max 3 ^
-ngl 36 ^
--no-mmap ^
--port 12340
pause
3: 以下测试LMStudio community发布的 DeepSeek-V4-Flash-0731-mxfp4 模型的速度,此量化模型的准确率最高(几乎达到99%准确率),模型大约 156 GB。
先看如果加入DSpark的草稿模型时,速度如何:结论 2 ts
PS D:\llama_cpp> cat .\runServer_DSMXFP4_DSpark.bat
@echo off
D:
cd /D D:\llama_cpp
llama-server ^
-m "F:\.lmstudio\lmstudio-community\DeepSeek-V4-Flash-0731-GGUF\DeepSeek-V4-Flash-0731-MXFP4-00001-of-00004.gguf" ^
-md "F:\.lmstudio\lmstudio-community\DeepSeek-V4-Flash-0731-GGUF\dspark-DeepSeek-V4-Flash-0731-MXFP4.gguf" ^
--alias "DeepSeek-V4-Flash-0731-MXFP4" ^
--spec-type draft-dspark ^
--spec-draft-n-max 3 ^
-c 196608 ^
-t 24 ^
-b 2048 ^
-ub 512 ^
-np 1 ^
--top-k 40 ^
--kv-unified ^
--no-mmap ^
--port 12340
pause
请看运行时的资源情况
其实可以看到,内存被大量占用。由于超过了128G,很多时间都消耗在了内存交换上,因此推理速度很慢。
现在尝试取消DFlash的功能,不加载DSpark草稿模型: 先说结论:17-18 ts
PS D:\llama_cpp> cat .\runServer_DSMXFP4_NoDSpark.bat
@echo off
D:
cd /D D:\llama_cpp
llama-server ^
-m "F:\.lmstudio\lmstudio-community\DeepSeek-V4-Flash-0731-GGUF\DeepSeek-V4-Flash-0731-MXFP4-00001-of-00004.gguf" ^
--alias "DeepSeek-V4-Flash-0731-MXFP4" ^
-c 196608 ^
-t 24 ^
-b 2048 ^
-ub 512 ^
-np 1 ^
--top-k 40 ^
--kv-unified ^
--no-mmap ^
--port 12340
pause
PS D:\llama_cpp> .\runServer_DSMXFP4_NoDSpark.bat
0.00.159.607 W DEPRECATED: --mmap and --no-mmap are deprecated. use --load-mode mmap instead
0.00.159.768 I cmn common_param: common_params_print_info: verbosity = 3 (adjust with the `-lv N` CLI arg)
0.00.231.029 W srv llama_server: -----------------
0.00.231.038 W srv llama_server: CORS is set to allow all origins ('*') and no API key is set
0.00.231.040 W srv llama_server: this can be a security risk (cross-origin attacks)
0.00.231.041 W srv llama_server: more info: https://github.com/ggml-org/llama.cpp/pull/25655
0.00.231.041 W srv llama_server: -----------------
0.00.235.399 I srv load_model: loading model 'F:\.lmstudio\lmstudio-community\DeepSeek-V4-Flash-0731-GGUF\DeepSeek-V4-Flash-0731-MXFP4-00001-of-00004.gguf'
1.48.853.251 I srv load_model: initializing, n_slots = 1, n_ctx_slot = 196608, kv_unified = 'true'
1.48.877.992 I srv init: chat template supports preserving reasoning, consider enabling it via --reasoning-preserve
1.48.878.857 I srv llama_server: model loaded
1.48.878.868 I srv llama_server: listening on http://127.0.0.1:12340
启动之后,我们运行一下:
我们没有指定GPU运行的层数和CPU运行的层数,LLAMA CPP 自动处理了。我们自己可以尝试通过-ngl 36 或者 48 来设置。这里我就不尝试了。(尝试过了,速度还是没有超过50 ts的可能)个人认为,低于40-50 ts的推理速度,聊天可以,但是用来做代理任务和写代码等任务还是太慢了。
主角登场
很多社区的大型实验室给出了很多版本的DS的量化版本,根据LMStudio的推荐,我选用了huihui-AI 的版本,他给出的Q2量化版文件大小为 87 GB,这对96G现存的显卡来说非常友好。虽然Q2的准确率下降到了70%+左右,但是如果速度能够达到90 ts的话,比qwen-3.6-27B还是要强上许多,毕竟200B+的参数量在这里。
加入DFlash可以提速50%以上
本文开头已经给出运行脚本(加上了DSpark),我这里给出如果不加草稿模型的运行速度作为参考: 50+ t/s
@echo off
D:
cd /D D:\llama_cpp
llama-server ^
-m "F:\.lmstudio\huihui-ai\Huihui-DeepSeek-V4-Flash-0731-abliterated-GGUF\DeepSeek-V4-Flash-Q2-0731.gguf" ^
--alias "deepseek-v4-flash-0731-abli-Q2" ^
-c 32768 ^
-t 12 ^
-b 2048 ^
-ub 512 ^
-np 1 ^
--kv-unified ^
--port 12340
pause
如图:
从显存资源图也可以看到运行时显存没有完全占用,所以非常适合将剩余的显存来运行草稿模型(DSpark)于是有了开头的脚本,可以实现90 t/s的速度。
这里,我们再次把启动脚本放出来:
PS D:\llama_cpp> cat .\huihuiaiDS.bat
@echo off
D:
cd /D D:\llama_cpp
llama-server ^
-m "F:\.lmstudio\huihui-ai\Huihui-DeepSeek-V4-Flash-0731-GGUF\DeepSeek-V4-Flash-Q2-0731.gguf" ^
-md "F:\modelscope\DeepSeek-V4-Flash-0731-GGUF\dspark\dspark-DeepSeek-V4-Flash-0731-BF16.gguf" ^
--alias "deepseek-v4-flash-0731-abli-Q2" ^
-c 196608 ^
-t 16 ^
-b 2048 ^
-ub 512 ^
-np 1 ^
--spec-type draft-dspark ^
--spec-draft-n-max 3 ^
--kv-unified ^
--port 12340
pause
PS D:\llama_cpp> .\huihuiaiDS.bat
后话
就在我前天还是使用LLAMA_CPP 的版本还是b10297的时候,现在就发布了b10329版本了。更新好快。这个发布应该是AI做的。现在技术迭代实在是太快了。
Deepseek V4 Flash 正式版,也就是 0731 版本作为能在本地部署的话,可以说比qwen 3.6系列要强一些的,期待社区继续用强化qwen 3.6的方法,继续挖掘DSv4F的更多能力,又或者等待Qwen 3.8系列推出开源版本。
视频开源模型 MiniMax H3 现在很热闹,让视频生成领域非常火爆。希望编程领域也能继续发光发热,大家加油!
如果本文章对你有帮助,或者让你更加了解如何在本地部署 DeepSeek 大语言模型,请你为我点赞吧~~感谢!!
更多推荐
所有评论(0)