logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

RTX 4090 本地部署 5 个开源大模型实测:vLLM + AWQ 量化,MoE 凭什么快 5 倍(2026最新)

24G 显存决定了消费级单卡的模型上限。精度30B 权重占用24G 能否跑BF16~60 GB❌FP8~30 GB❌16–19 GB✅ 留 ~4G 给 KV cache所以 4090 的甜点区就是30B 级 + INT4 量化。再大(如 GLM-4.5-Air 106B)即便 INT4 也要 50G+,单卡放不下。

#开源
端到端语音对话(Qwen2.5-Omni)真打不过级联ASR+LLM+TTS?RTX 4090 单卡实测全记录

关键词:Qwen2.5-Omni、端到端语音对话、speech-to-speech、SenseVoice、CosyVoice2、级联语音、RTX 4090、本地部署、显存 OOM、RTF一句话结论:在口径下,Qwen2.5-Omni-7B 端到端 speech-in→speech-out 完整回复要,而 SenseVoice + LLM + CosyVoice2 级联只要——端到端反而更慢。但端到

#语音识别#人工智能
RTX 4090 本地部署 AI 图像模型实测:FLUX.2 / Qwen-Image / Z-Image 显存占用与出图速度对比(2026)

很多人买了 24GB 的 RTX 4090,想本地跑当下最强的文生图模型,但不确定「跑不跑得动、跑多快、显存够不够」。本文用同一张 4090,在 ComfyUI 下实测了 4 个开源模型(Qwen-Image-2512、Z-Image-Turbo、FLUX.1-dev、FLUX.2-dev)的显存占用、出图速度、中文渲染,并与 4 个闭源 API 模型横向对照,给出可落地的本地部署选型建议。关键词

文章图片
#人工智能
端到端语音对话(Qwen2.5-Omni)真打不过级联ASR+LLM+TTS?RTX 4090 单卡实测全记录

关键词:Qwen2.5-Omni、端到端语音对话、speech-to-speech、SenseVoice、CosyVoice2、级联语音、RTX 4090、本地部署、显存 OOM、RTF一句话结论:在口径下,Qwen2.5-Omni-7B 端到端 speech-in→speech-out 完整回复要,而 SenseVoice + LLM + CosyVoice2 级联只要——端到端反而更慢。但端到

#语音识别#人工智能
RTX 4090 本地部署 5 个开源大模型实测:vLLM + AWQ 量化,MoE 凭什么快 5 倍(2026最新)

24G 显存决定了消费级单卡的模型上限。精度30B 权重占用24G 能否跑BF16~60 GB❌FP8~30 GB❌16–19 GB✅ 留 ~4G 给 KV cache所以 4090 的甜点区就是30B 级 + INT4 量化。再大(如 GLM-4.5-Air 106B)即便 INT4 也要 50G+,单卡放不下。

#开源
开源 vs 闭源 AI 图像模型横评(2026):8 个顶级模型同场景实测,开源追上闭源了吗?

2026 年中,AI 图像生成已经是"闭源 API"和"开源本地"两条路线并行。问题是:**开源到底追上闭源了吗?差距还剩多少?各自赢在哪?**我用同一组场景、同一个随机种子,把当下最顶尖的 **4 个闭源 + 4 个开源**模型真跑了一遍(共 47 张图),从画质、提示词遵循、中英文字、角色一致性、成本五个维度做了横评。本文给结论和数据。> 关键词:AI 图像生成、文生图、开源 vs 闭源、模型

文章图片
#开源#人工智能
ajax跨域问题分析与springboot解决方法

前后端分离ajaxVsCode 插件作用:模拟一个默认在5500端口的本地服务jq ajax主要参数$.ajax({//请求方式type:'POST',//发送请求的地址url:'fzz.php',//服务器返回的数据类型dataType:'json',//发送到服务器的数据,对象必须为key/value的格式,j...

到底了