摘要

很多人买了 24GB 的 RTX 4090,想本地跑当下最强的文生图模型,但不确定「跑不跑得动、跑多快、显存够不够」。本文用同一张 4090,在 ComfyUI 下实测了 4 个开源模型(Qwen-Image-2512、Z-Image-Turbo、FLUX.1-dev、FLUX.2-dev)的显存占用、出图速度、中文渲染,并与 4 个闭源 API 模型横向对照,给出可落地的本地部署选型建议。

关键词:RTX 4090、文生图、本地部署、ComfyUI、显存、FLUX.2、Qwen-Image、Z-Image-Turbo、fp8 量化


在这里插入图片描述

一、环境与方法

  • 硬件:RTX 4090 24GB;前端 ComfyUI;开源模型均用 fp8 量化版,通过 /prompt API 驱动。
  • 统一 1024×1024、同一随机种子,4 个固定 prompt(人像 / 复杂场景 / 中英文字海报 / 国风)。
  • 闭源(Nano-Banana-Pro / Seedream-4.5 / GPT-Image-2 / FLUX.2-pro)经 fal.ai API 做对照基准。

二、核心实测:开源模型在 4090 上的显存与速度

模型参数量4090 峰值显存出图速度中文渲染商用许可
Z-Image-Turbo6B~21GB~5 秒/张(最快)好(英文偶有小拼写错)Apache 2.0
Qwen-Image-2512~20B~22GB~27 秒/张完美Apache 2.0
FLUX.1-dev12B~18GB~14 秒/张崩(乱码)非商用
FLUX.2-dev32B模型 33.8GB 超显存,靠流式 offload134–718 秒/张完美非商用

结论一句话:24GB 的 4090 上,Z-Image-Turbo 和 Qwen-Image 是最舒服的两个——fp8 量化后刚好压进显存,速度可用。FLUX.2-dev 的 33.8GB 主模型 + 17GB 文本编码器远超 24GB,ComfyUI 只能把权重在显存/内存间反复换入换出,单张要几分钟,本地跑量不现实
在这里插入图片描述

三、部署要点(避坑)

  1. fp8 量化是 24GB 卡的关键:Qwen-Image-2512 用 qwen_image_2512_fp8_e4m3fn,Z-Image 用 z_image_turbo_bf16 + Qwen3-4B 文本编码器,都能压进 24GB。
  2. FLUX.2-dev 想本地跑:得用 fp8 主模型 + fp8/fp4 的 Mistral 文本编码器(bf16 编码器有 33GB,fp8 砍到 18GB、fp4 砍到 12GB),配合 ComfyUI 的动态 VRAM offload。即便如此也只是「能跑」,不是「跑得快」。
  3. 大模型务必串行:两个 >20GB 的模型同时加载会直接撑爆显存+内存,把 ComfyUI 搞崩。一个跑完卸载再换下一个。
  4. 首张慢是正常的:模型从机械盘加载到显存,首张往往要 1-4 分钟,之后同一会话内每张就快了。

四、横向对照:闭源 API 怎么选

模型单价速度适合
Nano-Banana-Pro$0.15/张~32s最高质量
Seedream-4.5$0.03/张~26s批量/中文/4K,性价比之王
FLUX.2-pro$0.06/张~15s便宜快
GPT-Image-2~$0.20/张~172s质量高但慢且贵

五、中文渲染对比(本地部署最常见需求)

做中文海报/带字图的人最关心这个。实测同一张中英混排海报:Qwen-Image-2512 / FLUX.2-dev / Z-Image-Turbo 都能写对中文,而 FLUX.1-dev 把中文渲染成乱码。所以本地做中文带字图,别用 FLUX.1-dev,用 Qwen-Image 系
在这里插入图片描述

六、本地部署选型建议

  • 单卡 4090 跑量首选:Z-Image-Turbo(最快、最省、Apache)
  • 中文/复杂提示:Qwen-Image-2512(中文完美、Apache)
  • 追极致画质:用 FLUX.2-pro 的 API,别在 4090 本地硬扛 FLUX.2-dev
  • 角色一致性自托管:Qwen-Image-Edit-2509 实测能保脸,可做连续角色

在这里插入图片描述

本文为个人主观实测,非盲测;显存/速度/价格为实测当日快照,模型更新很快,以官方与你自己环境为准。
实测源于我一个 AI 陪伴/短剧 side project(隐界)的选型,顺手整理成教程分享。

更多推荐