RTX 4090 本地部署 AI 图像模型实测:FLUX.2 / Qwen-Image / Z-Image 显存占用与出图速度对比(2026)
·
摘要
很多人买了 24GB 的 RTX 4090,想本地跑当下最强的文生图模型,但不确定「跑不跑得动、跑多快、显存够不够」。本文用同一张 4090,在 ComfyUI 下实测了 4 个开源模型(Qwen-Image-2512、Z-Image-Turbo、FLUX.1-dev、FLUX.2-dev)的显存占用、出图速度、中文渲染,并与 4 个闭源 API 模型横向对照,给出可落地的本地部署选型建议。
关键词:RTX 4090、文生图、本地部署、ComfyUI、显存、FLUX.2、Qwen-Image、Z-Image-Turbo、fp8 量化

一、环境与方法
- 硬件:RTX 4090 24GB;前端 ComfyUI;开源模型均用 fp8 量化版,通过
/promptAPI 驱动。 - 统一 1024×1024、同一随机种子,4 个固定 prompt(人像 / 复杂场景 / 中英文字海报 / 国风)。
- 闭源(Nano-Banana-Pro / Seedream-4.5 / GPT-Image-2 / FLUX.2-pro)经 fal.ai API 做对照基准。
二、核心实测:开源模型在 4090 上的显存与速度
| 模型 | 参数量 | 4090 峰值显存 | 出图速度 | 中文渲染 | 商用许可 |
|---|---|---|---|---|---|
| Z-Image-Turbo | 6B | ~21GB | ~5 秒/张(最快) | 好(英文偶有小拼写错) | Apache 2.0 |
| Qwen-Image-2512 | ~20B | ~22GB | ~27 秒/张 | 完美 | Apache 2.0 |
| FLUX.1-dev | 12B | ~18GB | ~14 秒/张 | 崩(乱码) | 非商用 |
| FLUX.2-dev | 32B | 模型 33.8GB 超显存,靠流式 offload | 134–718 秒/张 | 完美 | 非商用 |
结论一句话:24GB 的 4090 上,Z-Image-Turbo 和 Qwen-Image 是最舒服的两个——fp8 量化后刚好压进显存,速度可用。FLUX.2-dev 的 33.8GB 主模型 + 17GB 文本编码器远超 24GB,ComfyUI 只能把权重在显存/内存间反复换入换出,单张要几分钟,本地跑量不现实。

三、部署要点(避坑)
- fp8 量化是 24GB 卡的关键:Qwen-Image-2512 用
qwen_image_2512_fp8_e4m3fn,Z-Image 用z_image_turbo_bf16+ Qwen3-4B 文本编码器,都能压进 24GB。 - FLUX.2-dev 想本地跑:得用 fp8 主模型 + fp8/fp4 的 Mistral 文本编码器(bf16 编码器有 33GB,fp8 砍到 18GB、fp4 砍到 12GB),配合 ComfyUI 的动态 VRAM offload。即便如此也只是「能跑」,不是「跑得快」。
- 大模型务必串行:两个 >20GB 的模型同时加载会直接撑爆显存+内存,把 ComfyUI 搞崩。一个跑完卸载再换下一个。
- 首张慢是正常的:模型从机械盘加载到显存,首张往往要 1-4 分钟,之后同一会话内每张就快了。
四、横向对照:闭源 API 怎么选
| 模型 | 单价 | 速度 | 适合 |
|---|---|---|---|
| Nano-Banana-Pro | $0.15/张 | ~32s | 最高质量 |
| Seedream-4.5 | $0.03/张 | ~26s | 批量/中文/4K,性价比之王 |
| FLUX.2-pro | $0.06/张 | ~15s | 便宜快 |
| GPT-Image-2 | ~$0.20/张 | ~172s | 质量高但慢且贵 |
五、中文渲染对比(本地部署最常见需求)
做中文海报/带字图的人最关心这个。实测同一张中英混排海报:Qwen-Image-2512 / FLUX.2-dev / Z-Image-Turbo 都能写对中文,而 FLUX.1-dev 把中文渲染成乱码。所以本地做中文带字图,别用 FLUX.1-dev,用 Qwen-Image 系。

六、本地部署选型建议
- 单卡 4090 跑量首选:Z-Image-Turbo(最快、最省、Apache)
- 中文/复杂提示:Qwen-Image-2512(中文完美、Apache)
- 追极致画质:用 FLUX.2-pro 的 API,别在 4090 本地硬扛 FLUX.2-dev
- 角色一致性自托管:Qwen-Image-Edit-2509 实测能保脸,可做连续角色

本文为个人主观实测,非盲测;显存/速度/价格为实测当日快照,模型更新很快,以官方与你自己环境为准。
实测源于我一个 AI 陪伴/短剧 side project(隐界)的选型,顺手整理成教程分享。
更多推荐
所有评论(0)