2026 主流 AI大模型& 智能体对比速览
数据时间:2026 年 1 月 - 7 月(春节档至 Q2 末)
Top 4 冠军榜
|
日活账户冠军 腾讯 WorkBuddy 日活 1300 万(7 月) |
国民级 C 端 豆包 Seed 2.1 日均 Token 调用 180 万亿(7 月) |
API 调用王 DeepSeek V4 高峰 9-12/14-18 · 峰谷定价 |
4 增长最快 GLM-5.2 ARR 5 月 ×15 → 10 亿美元 |
数据来源:IDC 2025、Artificial Analysis 2025 Q1、各厂商官网与公开 PR、第三方技术博客(截止 2026/7)。
一、16 家能力矩阵速览(含推荐)
评分 0-100,颜色越绿越强;推荐等级分「强推荐 / 一般推荐 / 不推荐」三档。
|
厂商/产品 |
旗舰模型 |
综合 |
编程 |
推理 |
长文 |
多模态 |
Agent |
开源 |
推荐 |
|
豆包 Seed 2.1 |
Seed 2.1 Pro/Turbo(6月)|旧版 Seed 2.0(2月) |
92 |
80 |
86 |
82 |
96 |
88 |
— |
强推荐 |
|
通义千问 Qwen3.7-Max |
Qwen3.7-Max(5月)|旧版 Qwen3.6-Plus(4月) |
92 |
88 |
92 |
92 |
88 |
92 |
✅ MIT/Apache |
强推荐 |
|
DeepSeek V4 |
V4 Pro/Flash(4月预览→7月正式版)|旧版 V3.2(128K) |
91 |
95 |
95 |
96 |
65 |
86 |
✅ MIT/Apache |
强推荐 |
|
智谱 GLM-5.2 |
GLM-5.2(6月)|旧版 GLM-5.1(4月) |
93 |
95 |
93 |
92 |
80 |
97 |
✅ MIT/Apache |
强推荐 |
|
Kimi K3 |
K3(7月,2.8T)|旧版 K2.5(1月,1.04T) |
92 |
94 |
92 |
95 |
88 |
94 |
✅ MIT/Apache |
强推荐 |
|
文心一言 5.0 |
ERNIE 5.0 / 端侧 ERNIE(H1 仍为最新) |
82 |
76 |
82 |
80 |
84 |
80 |
— |
强推荐 |
|
腾讯混元 Hy3 |
Hy3 preview(4月)|旧版 HY2.0(2025) |
84 |
78 |
84 |
82 |
82 |
86 |
✅ MIT/Apache |
强推荐 |
|
华为盘古 + V4 昇腾版 |
盘古 5.0 + DeepSeek V4 Pro/Flash Day0 适配 |
80 |
72 |
80 |
78 |
76 |
80 |
— |
强推荐 |
|
讯飞星火 |
Spark 4.0 Ultra(H1 仍为最新) |
78 |
70 |
80 |
76 |
80 |
74 |
— |
强推荐 |
|
MiniMax M3 |
M3(6月,MSA)|前代 M2.7(4月,自我进化) |
88 |
90 |
85 |
95 |
90 |
93 |
— |
强推荐 |
|
阶跃星辰 |
Step3.5Flash/StepAudio2.5/StepImageEdit2(4月) |
80 |
72 |
78 |
76 |
90 |
78 |
— |
强推荐 |
|
小米 MiMo |
MiMo-V2.5 / V2.5-Pro / tts/asr(4月) |
82 |
78 |
82 |
78 |
84 |
80 |
✅ MIT/Apache |
强推荐 |
|
商汤 SenseNova U1 |
SenseNova U1 / Sage 端侧(4月开源) |
80 |
72 |
78 |
76 |
88 |
78 |
✅ MIT/Apache |
强推荐 |
|
Hermes Agent v0.14.0 |
v0.14.0(5月,GEPA 自进化)|前代 v0.8.0(4月,双 LLM) |
82 |
78 |
80 |
85 |
70 |
92 |
✅ MIT/Apache |
强推荐 |
|
腾讯 WorkBuddy v5.3.3 |
v5.3.3(7月,Hy3+DeepSeek/GLM/Kimi 多模型)|前代 v1.0(3月) |
84 |
78 |
82 |
86 |
85 |
88 |
— |
强推荐 |
|
OpenAI Codex CLI v0.132.0 |
v0.132.0(5月,Rust 重写)|前代 v0.130.0(5月) |
88 |
98 |
90 |
88 |
70 |
96 |
— |
强推荐 |
说明:绿=强(≥90)/ 浅绿=良好(84-89)/ 黄=中等(76-83)/ 橙=偏弱(68-75)/ 灰=弱(<68)。
二、2026 H1 发布时间线(35+ 关键节点)
按时间倒序整理 16 家厂商在 H1 阶段的关键发版事件,含春节档到 7 月的密集发布。
|
时间 |
厂商 / 事件 |
|
2026/1 |
Kimi K2.5(1.04 万亿参数发布) |
|
2026/Q1 |
华为盘古 5.0 + 昇腾超节点首发适配 DeepSeek V4 |
|
2026/Q1 |
讯飞 Spark 4.0 Ultra(全栈国产算力训练) |
|
2026/2 春节档 |
豆包 Doubao-Seed-2.0 全模态矩阵首发(Pro/Lite/Mini) |
|
2026/2/3 |
OpenAI Codex macOS App 正式发布(多智能体并行) |
|
2026/2/25 |
Hermes Agent 首版上线 GitHub(Nous Research 开源) |
|
2026/3 初 |
腾讯 WorkBuddy v1.0 上线(桌面 AI 办公智能体) |
|
2026/3 |
百度文心 ERNIE 5.0 + 端侧 ERNIE 双轨发布 |
|
2026/4 上旬 |
小米 MiMo-V2.5 推理 + V2.5-Pro 全模态 Agent + tts/asr(28 日全部 MIT 开源) |
|
2026/4 中旬 |
商汤 SenseNova U1 全面开源 + 端侧 Sage 车端基座 |
|
2026/4 |
智谱 GLM-5.1(10 万昇腾训练) |
|
2026/4 |
MiniMax M2.7(自我进化 Agent) |
|
2026/4 |
Hermes Agent v0.8.0(双 LLM 架构,Star 破 6 万) |
|
2026/4/22-29 |
阶跃星辰一周三发(Step3.5Flash / StepAudio2.5 / StepImageEdit2) |
|
2026/4/23 |
腾讯混元 Hy3 preview(姚顺雨加盟后首款) |
|
2026/4/24 |
DeepSeek V4 Pro/Flash 预览发布(1M 上下文、昇腾 Day0 适配) |
|
2026/5 |
通义 Qwen3.7-Max(35h 零人工芯片内核优化) |
|
2026/5 |
豆包 Seed 2.0-lite 首款全模态理解模型 |
|
2026/5 |
Hermes Agent v0.14.0(GEPA 学习闭环) |
|
2026/5/7 |
Codex for Chrome 扩展上线 |
|
2026/5/14 |
Codex 移动端远程连接预览(iOS/Android → Mac) |
|
2026/5/18 |
Codex CLI v0.131.0(SubagentStart Hook) |
|
2026/5/20 |
Codex CLI v0.132.0(文件系统 deny 标准化) |
|
2026/5/22 |
Codex CLI v0.134.0a2 alpha 发布 |
|
2026/6 |
WorkBuddy 月访问 2097 万(登顶国内 PC 端第一) |
|
2026/6 |
WorkBuddy 企业版发布 + 湾擎省级政务智能中枢(广州) |
|
2026/6 |
通义 Qwen3.7-Plus 登顶 Vision Arena 全球前五 |
|
2026/6 |
智谱 GLM-5.2(1M 上下文真正可用,ARR 5月×15 涨到 10 亿美元) |
|
2026/6 |
豆包 Seed 2.1 Pro/Turbo(Coding + Agent 专项) |
|
2026/6 |
MiniMax M3(MSA 稀疏注意力,1M 上下文,Computer Use) |
|
2026/7 |
Kimi K3(2.8 万亿参数,全球最大开源) |
|
2026/7 |
通义 Qwen3.8-Max 预览(2.4 万亿参数,对齐 Claude Fable 5) |
|
2026/7 |
DeepSeek V4 正式版(首次引入峰谷定价) |
|
2026/7/13 |
WorkBuddy 基于混元 Hy3 本地 Agent 优化 |
|
2026/7/23 |
WorkBuddy v5.3.3(最新版本) |
三、部署方式速查 · 离线内网 vs 联网 API
核心问题:能不能在完全断网的内网环境里把模型跑起来?分三档:可离线 / 部分离线 / 仅 SaaS。
可离线(9 家):适合政企信创、涉密场景、数据合规严格行业
| # | 厂商 | 说明 |
|
1 |
通义千问 Qwen3.7-Max |
可离线 · Qwen3 系列开源权重可私有化 |
|
2 |
DeepSeek V4 |
可离线 · V4 MIT 开源 + 昇腾 Day0 适配 |
|
3 |
智谱 GLM-5.2 |
可离线 · GLM 全栈开源 + 国产算力全适配 |
|
4 |
Kimi K3 |
可离线 · K3 全球最大开源 2.8T 权重可下载 |
|
5 |
腾讯混元 Hy3 |
可离线 · 混元开源版本权重可下载(Hy3 preview 闭源) |
|
6 |
华为盘古 + V4 昇腾版 |
可离线 · 盘古主打政企私有化 |
|
7 |
小米 MiMo |
可离线 · MIT 宽松许可,4 月全部开源 |
|
8 |
商汤 SenseNova U1 |
可离线 · U1 全面开源 + 端侧 Sage 车端本地 |
|
9 |
Hermes Agent v0.14.0 |
可离线 · MIT 开源 + 自托管(macOS/Linux/WSL2/Termux) |
部分离线(4 家):混合方案,云端主用 + 端侧/部分本地
| # | 厂商 | 说明 |
|
1 |
文心一言 5.0 |
部分离线 · 端侧 ERNIE 可本地运行 |
|
2 |
讯飞星火 |
部分离线 · 政企/教育可私有化 |
|
3 |
MiniMax M3 |
部分离线 · 非商用许可(商用需申请) |
|
4 |
OpenAI Codex CLI v0.132.0 |
部分离线 · CLI 端可本地跑(国内需配置 openai_base_url 中转) |
仅 SaaS/API(3 家):必须联网调用,无法私有化
| # | 厂商 | 说明 |
|
1 |
豆包 Seed 2.1 |
仅 API · 闭源无权重 |
|
2 |
阶跃星辰 |
仅 API · 闭源(车端嵌入式另算) |
|
3 |
腾讯 WorkBuddy v5.3.3 |
仅桌面客户端 · 闭源 SaaS(强联网) |
四、部署成本速查 · 从免费到千万级
按典型场景估算私有化硬件采购 + 云端 API 持续费用,分四档。
极低成本(2 家)
|
# |
厂商 |
|
1 |
MiniMax |
|
2 |
Hermes Agent |
|
3 |
Codex CLI |
低成本(4 家)
|
# |
厂商 |
|
1 |
豆包 Seed 2.1 |
|
2 |
DeepSeek V4 |
|
3 |
腾讯混元 Hy3 |
|
4 |
阶跃星辰 |
|
5 |
WorkBuddy |
中高成本(7 家)
|
# |
厂商 |
|
1 |
通义千问 Qwen3.7-Max |
|
2 |
智谱 GLM-5.2 |
|
3 |
Kimi K3 |
|
4 |
文心一言 5.0 |
|
5 |
讯飞星火 |
|
6 |
MiniMax M3 |
|
7 |
商汤 SenseNova U1 |
高成本(1 家)
|
# |
厂商 |
|
1 |
华为盘古 + V4 昇腾版 |
五、16 家品牌血统 · 国产 vs 国际
关键统计:16 家中 14 家是国产品牌(团队在中国),2 家国际开源代表(Hermes / Codex);合规严格场景下纯内资 4 家(华为 / MiniMax / 阶跃 / 讯飞)。
|
# |
品牌 |
母公司/团队 |
总部 |
注册地 |
国产? |
|
1 |
豆包 |
字节跳动·火山引擎 |
北京 |
开曼(港股拟上市) |
国产(团队) |
|
2 |
通义千问 |
阿里巴巴·阿里云 |
杭州 |
开曼(港股 9988) |
国产(团队) |
|
3 |
DeepSeek |
深度求索(幻方量化) |
北京 |
开曼(红筹) |
国产(团队) |
|
4 |
智谱 GLM |
智谱 AI·清华系 |
北京 |
开曼(港股 2513) |
国产(团队) |
|
5 |
Kimi |
月之暗面 |
北京 |
开曼(红筹) |
国产(团队) |
|
6 |
文心一言 |
百度 |
北京 |
开曼(NASDAQ:BIDU) |
国产(团队) |
|
7 |
腾讯混元 |
腾讯 |
深圳 |
开曼(港股 0700) |
国产(团队) |
|
8 |
华为盘古 |
华为云 |
深圳 |
中国(纯内资) |
国产(真正内资) |
|
9 |
讯飞星火 |
科大讯飞 |
合肥 |
中国(A 股 002230) |
国产(A 股内资) |
|
10 |
MiniMax |
MiniMax AI |
上海 |
中国(未上市) |
国产(内资创业) |
|
11 |
阶跃星辰 |
阶跃星辰 |
上海 |
中国(未上市) |
国产(内资创业) |
|
12 |
小米 MiMo |
小米 |
北京 |
开曼(港股 1810) |
国产(团队) |
|
13 |
商汤日日新 |
商汤科技 |
上海/香港 |
开曼(港股 0020) |
国产(团队) |
|
14 |
Hermes Agent |
Nous Research |
美国 |
美国 |
国际开源 |
|
15 |
WorkBuddy |
腾讯云 CodeBuddy 团队 |
深圳 |
开曼(港股 0700 旗下) |
国产(团队) |
|
16 |
Codex CLI |
OpenAI |
美国旧金山 |
美国(NASDAQ:MSFT 投资) |
国际开源 |
六、16 家厂商详情速览
豆包 Seed 2.1 · 国产综合·C端 · 字节跳动·火山引擎
综合 92 编程 80 推理 86 长文 82 多模态 96 Agent 88
简介:2026/2 春节档发布 Doubao-Seed-2.0 全模态矩阵,6 月迭代为 Seed 2.1(Pro 编码/Agent + Turbo 性价比)。
优势:Seed 2.1 Pro 主打 Coding+Agent、IMO/CMO/ICPC 三项金牌;Seedance 2.0 实现 60 秒电影级音视频。
短板:纯文本深度推理弱于 DeepSeek/GLM;Agent 长链路工程化逊于 GLM-5。
版本:Seed 2.1 Pro/Turbo(6月)|旧版 Seed 2.0(2月)
部署:仅 API · 闭源无权重
推荐:强推荐 · 多模态创作、抖音/飞书生态、视频生成、C 端全能
通义千问 Qwen3.7-Max · 开源第一·企业 · 阿里巴巴·阿里云
综合 92 编程 88 推理 92 长文 92 多模态 88 Agent 92
简介:Qwen3.7-Max 5 月阿里云峰会发布,自主完成 35 小时零人工芯片内核优化(1158 次工具调用)。
优势:35h 零人工任务执行、推理速度 +10 倍;Qwen3.7-Plus 整合「看/想/写/做/验」智能体工作流。
短板:中文对话风格比豆包略生硬;Qwen3.8-Max 仍为预览版、未正式开放。
版本:Qwen3.7-Max(5月)|旧版 Qwen3.6-Plus(4月)
部署:可离线 · Qwen3 系列开源权重可私有化
推荐:强推荐 · 开源生态、长文档、阿里云集成、极致性价比
DeepSeek V4 · 性价比之王·开源 · 深度求索(幻方量化)
综合 91 编程 95 推理 95 长文 96 多模态 65 Agent 86
简介:2026/4/24 发布 V4 Pro(1.6T 总参/49B 激活)+ V4 Flash,发布当日百度千帆 Day0 上线。
优势:1M 上下文原生 + AIME 99.4% 数学断层第一 + 1M 召回率 97% + 输入 ¥0.25/百万 token。
短板:多模态起步晚;私有化部署仍需较大 GPU 集群(建议 API 调用)。
版本:V4 Pro/Flash(4月预览→7月正式版)|旧版 V3.2(128K)
部署:可离线 · V4 MIT 开源 + 昇腾 Day0 适配
推荐:强推荐 · 代码、数学/科学推理、长文本、极致性价比
智谱 GLM-5.2 · Agent 工程之王·港股 · 智谱 AI·清华
综合 93 编程 95 推理 93 长文 92 多模态 80 Agent 97
简介:GLM-5.2(6月)上下文从 200K 升级到 1M 真正可用,ARR 5 个月从 1 亿涨到 10 亿美元。
优势:单次 6000+ 工具调用 + 600+ 迭代循环;可 8 小时自主搭 Linux 桌面;Coding Plan $18/月(Claude 1/10)。
短板:年内三连涨 80%;模型自建需 8×H100。
版本:GLM-5.2(6月)|旧版 GLM-5.1(4月)
部署:可离线 · GLM 全栈开源 + 国产算力全适配
推荐:强推荐 · 企业级 Agent、复杂工程代码、私有化+国产算力
Kimi K3 · 2.8T·全球最大开源 · 月之暗面
综合 92 编程 94 推理 92 长文 95 多模态 88 Agent 94
简介:K3(7月)总参数 2.8 万亿(全球最大开源),KDA 混合线性注意力 + AttnRes 跳跃连接。
优势:KDA 注意力让 KV 缓存 -75%、解码速度 +6.3 倍;Frontend Code Arena 1679 分登顶全球第一。
短板:API 输出 $15/百万偏高;C 端 199 元/月才能用满血 1M;自部署硬件要求极高。
版本:K3(7月,2.8T)|旧版 K2.5(1月,1.04T)
部署:可离线 · K3 全球最大开源 2.8T 权重可下载
推荐:强推荐 · 长文档、办公协作、多智能体并行
文心一言 5.0 · 合规之王·端云双轨 · 百度
综合 82 编程 76 推理 82 长文 80 多模态 84 Agent 80
简介:千帆 DeepSeek V4 Day0 适配 + ERNIE 端侧大模型双轨并行,端到端 AI 解决方案覆盖云+端。
优势:中文合规体系最完善(政务/金融/医疗首选);端侧 AI 实时响应+数据不上云。
短板:模型能力被 DeepSeek/GLM/豆包压一头;创新功能少。
版本:ERNIE 5.0 / 端侧 ERNIE(H1 仍为最新)
部署:部分离线 · 端侧 ERNIE 可本地运行
推荐:强推荐 · 政务/金融/医疗合规、端侧 AI、车载场景
腾讯混元 Hy3 · 微信生态·姚顺雨首秀 · 腾讯
综合 84 编程 78 推理 84 长文 82 多模态 82 Agent 86
简介:2026/4/23 发布 Hy3 preview(295B 总参/21B 激活),首 token 延迟 -54%。
优势:快慢思考融合设计;推理效率 +40%;元宝/QQ/腾讯文档 900+ 业务已接入;¥28/月最低价。
短板:模型能力目前仍弱于 GLM/DeepSeek;Agent 能力刚起步。
版本:Hy3 preview(4月)|旧版 HY2.0(2025)
部署:可离线 · 混元开源版本权重可下载(Hy3 preview 闭源)
推荐:强推荐 · 微信生态集成、游戏 AI NPC、企业微信场景
华为盘古 + V4 昇腾版 · 国产算力底座·信创 · 华为云
综合 80 编程 72 推理 80 长文 78 多模态 76 Agent 80
简介:华为云首发适配 DeepSeek V4,三层优化(PD 分离调度 + 融合算子 + 互联存储)。
优势:昇腾 950 超节点 + CANN 异构架构;FP4+FP8 混合精度;国产 AI 全栈闭环。
短板:面向 C 端产品少;V4-Pro 服务吞吐受算力限制。
版本:盘古 5.0 + DeepSeek V4 Pro/Flash Day0 适配
部署:可离线 · 盘古主打政企私有化
推荐:强推荐 · 国产化全栈、政务/金融信创、超大模型私有化
讯飞星火 · 语音王者·教育 · 科大讯飞
综合 78 编程 70 推理 80 长文 76 多模态 80 Agent 74
简介:Spark 4.0 Ultra 全国产算力训练,教育领域覆盖全国 80% 重点学校。
优势:语音识别+同传业内第一;教育渠道下沉最深;国产化全栈。
短板:消费端认知弱于豆包/文心;多模态创作能力落后。
版本:Spark 4.0 Ultra(H1 仍为最新)
部署:部分离线 · 政企/教育可私有化
推荐:强推荐(垂直)· 语音、教育、智能硬件、司法/政务
MiniMax M3 · MSA·自研稀疏注意力 · MiniMax AI(上海)
综合 88 编程 90 推理 85 长文 95 多模态 90 Agent 93
简介:M3(6月)MSA 稀疏注意力架构彻底取代 MOE,原生支持图片/视频输入 + Computer Use。
优势:MSA 架构让 1M 上下文单 token 算力仅 M2.5 的 1/20;SWE-Bench Pro 59% 超 GPT-5.5。
短板:采用非商用许可证(商用需申请);自建成本仍高。
版本:M3(6月,MSA)|前代 M2.7(4月,自我进化)
部署:部分离线 · 非商用许可(商用需申请)
推荐:强推荐 · 1M 长文本、原生多模态、Computer Use 自动化
阶跃星辰 · 智能座舱·毫秒响应 · 阶跃星辰(上海)
综合 80 编程 72 推理 78 长文 76 多模态 90 Agent 78
简介:4 月三连发(Step3.5Flash 提速 300%、StepAudio2.5 ASR 推理快 4 倍、StepImageEdit2 3.5B)。
优势:毫秒级响应 + 智能座舱(极氪 8X 首发 + 千里科技原生智驾);动态量化降低成本 40%。
短板:通用对话与代码能力落后于 GLM/DeepSeek。
版本:Step3.5Flash/StepAudio2.5/StepImageEdit2(4月)
部署:仅 API · 闭源(车端嵌入式另算)
推荐:强推荐 · 智能座舱、车载 AI、图像编辑、低延迟
小米 MiMo · 登顶开源榜·MIT · 小米
综合 82 编程 78 推理 82 长文 78 多模态 84 Agent 80
简介:2026/4 一口气发 4 款(旗舰推理 V2.5 + 全模态 Agent V2.5-Pro + tts/asr),28 日全部 MIT 协议开源。
优势:局部滑动视窗 + 全局注意力 6:1 交错,KV 缓存内存占用缩减近 7 倍;统一 Credit 点数体系。
短板:刚开源,生态与社区还在起步。
版本:MiMo-V2.5 / V2.5-Pro / tts/asr(4月)
部署:可离线 · MIT 宽松许可,4 月全部开源
推荐:强推荐 · 小米生态硬件、低内存部署、统一计费需求
商汤 SenseNova U1 · NEO-unify·车端 · 商汤科技
综合 80 编程 72 推理 78 长文 76 多模态 88 Agent 78
简介:基于 NEO-unify 自研架构,首次单一模型同时统一多模态理解+推理+生成。
优势:单一架构覆盖理解/推理/生成;端侧 Sage 单台车日省 30 元;适配寒武纪/沐曦/海光 DCU/昇腾。
短板:消费端品牌认知弱;模型版本迭代节奏慢。
版本:SenseNova U1 / Sage 端侧(4月开源)
部署:可离线 · U1 全面开源 + 端侧 Sage 车端本地
推荐:强推荐 · 智能驾驶、车端 Agent、视频生成(Seko)
Hermes Agent v0.14.0 · 自进化 Agent·GEPA · (开源)
综合 82 编程 78 推理 80 长文 85 多模态 70 Agent 92
简介:2026/2/25 上线 GitHub,4 个月 Star 6 万+;GEPA 学习闭环 + 双 LLM 异步协同。
优势:5+ 次同类任务自动提炼 Skill;4 层分层记忆跨会话永久保留;200+ 模型兼容;15+ 消息平台统一网关。
短板:非国产项目,企业采购合规需评估;资源占用较高(双 LLM 需 ≥4GB 内存)。
版本:v0.14.0(5月,GEPA 自进化)|前代 v0.8.0(4月,双 LLM)
部署:可离线 · MIT 开源 + 自托管(macOS/Linux/WSL2/Termux)
推荐:强推荐 · 个人长期项目、自进化学习、跨平台统一记忆
腾讯 WorkBuddy v5.3.3 · 免部署桌面工作台 · 腾讯云 CodeBuddy 团队
综合 84 编程 78 推理 82 长文 86 多模态 85 Agent 88
简介:2026/3/9 上线,6 月月访问 2097 万次领跑国内 PC 端;混元 Hy3 首发 + 中国信通院可信认证。
优势:免部署、官网下载即用;100% 兼容 OpenClaw 全量技能;混元 Hy3 60%+ 用户首选;通过中国信通院可信认证。
短板:闭源,仅桌面客户端;本地自定义能力偏保守。
版本:v5.3.3(7月,Hy3+DeepSeek/GLM/Kimi 多模型)|前代 v1.0(3月)
部署:仅桌面客户端 · 闭源 SaaS(强联网)
推荐:强推荐 · 职场通用办公、桌面端一句话自动化、企业微信/QQ 生态
OpenAI Codex CLI v0.132.0 · 终端编程·OS 级沙箱 · OpenAI
综合 88 编程 98 推理 90 长文 88 多模态 70 Agent 96
简介:2026/5/20 发布 CLI v0.132.0,GitHub 83,200+ Stars;Rust 重写 + 唯一 OS 级沙箱。
优势:OS 级沙箱(Seatbelt/Landlock+seccomp+bubblewrap 纵深防御);Terminal-Bench 2.0 77.3% 领先 Claude Code。
短板:非国产,国内需代理或 base_url 中转;模型绑定 OpenAI 不能自由切换。
版本:v0.132.0(5月,Rust 重写)|前代 v0.130.0(5月)
部署:部分离线 · CLI 端可本地跑(国内需配置 openai_base_url 中转)
推荐:强推荐 · ChatGPT Plus、终端原生编程、OS 级安全沙箱、Mac/Linux 开发者
七、AI Agent 三层架构 · 从算力到应用
底层算力训出模型 → 中间层模型提供能力 → 顶层 Agent 解决具体业务问题。
客户买的 = 中间层 + 顶层(模型 + Agent),底层是基础设施。
三层四步流转
|
步骤 |
从哪层 |
到哪层 |
谁触发 |
时长 |
客户看到什么 |
|
1. 训练 |
底层算力+数据 |
中间层模型 |
模型公司 |
几周-几月 |
发布新闻 |
|
2. 部署 |
中间层权重 |
客户环境 |
客户/销售 |
几小时 |
模型能用了 |
|
3. 调用 |
顶层 Agent |
中间层模型 |
Agent |
2-10 秒 |
返回答案 |
|
4. 执行 |
顶层 Agent |
客户业务 |
Agent |
几秒-几分钟 |
任务完成 |
八、场景化选型建议(按主要使用场景)
|
使用场景 |
推荐组合 |
|
文档生成 / AI 对话 |
GLM-5.2 主用 + 豆包 Seed 2.1 兜底(多模态补强) |
|
PPT 生成 |
Qwen3.7-Plus(视觉强) + 豆包 Seed 2.1(多模态) |
|
代码生成 |
DeepSeek V4 主用 + GLM-5.2 兜底(Agent 工程) |
|
知识库分析(长文) |
Kimi K3 主用(1M 上下文) + DeepSeek V4 兜底(性价比) |
|
多模态创作 |
豆包 Seed 2.1(视频/图像 SOTA) + 商汤 Seko |
|
桌面办公 |
WorkBuddy v5.3.3(市场第一) + 豆包桌面客户端 |
数据截止 2026/7 · 仅供学习与选型参考
备注:部分数据为公开口径估算;实际部署请以厂商最新报价为准。
更多推荐

所有评论(0)