从GLM-5.3看后训练:同基座性能暴涨50%,一文读懂大模型“第二次进化“
从GLM-5.3看后训练:同基座性能暴涨50%,一文读懂大模型"第二次进化"
导读:2026年8月14日,智谱AI发布GLM-5.3。最震撼的不是它多强,而是它怎么变强的——与上一代GLM-5.2使用完全相同的7430亿参数基座,仅靠后训练就让编程能力提升50%,网络安全能力翻倍。这证明了一个关键判断:预训练决定下限,后训练决定上限。本文从GLM-5.3出发,系统科普后训练的核心概念、技术栈和实战路线。
⚠️ 适用范围:本文基于GLM-5.3官方发布数据(2026-08-14)及公开技术文献整理。Benchmark数据为智谱官方口径,引用前请复核。文中涉及的开源工具版本截至2026年8月。
文章目录
一、GLM-5.3发布了一个什么模型
先看关键事实:
| 项目 | 规格 |
|---|---|
| 发布时间 | 2026年8月14日 |
| 发布方 | 智谱AI(Z.ai) |
| 总参数 | 约7430亿(与GLM-5.2完全相同的基座) |
| 上下文窗口 | 1M(100万token) |
| 最大输出 | 128K token |
| 开源协议 | MIT(无地域限制) |
| 核心能力 | 编程、长程任务、网络安全 |
最关键的一句话:GLM-5.3与GLM-5.2使用同一个基座模型,所有性能提升全部来自后训练 [1]。
这意味着什么?打个比方:基座模型是同一台发动机,后训练是驾驶技术的飞跃。发动机没换,但驾驶员从"刚拿驾照"变成了"赛道冠军"。
性能跃升有多夸张
| Benchmark | GLM-5.2 | GLM-5.3 | 提升幅度 | 说明 |
|---|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 | +514% | 开源第一 |
| DeepSWE v1.1 | 46.2 | 66.9 | +45% | 长程软件工程 |
| ExploitBench | 24.4% | 54.4% | +123% | 翻倍增长 |
| CyberGym | 77.2% | 84.5% | +9.5% | 超过GPT-5.6 |
| AutomationBench | 26.2 | 48.2 | +84% | 自动化任务 |
| Agents’ Last Exam | 23.8 | 28.5 | +20% | 开源第一 |
重点看Terminal-Bench 3.0:从4.6到28.3,这不是"调参优化",这是能力质变。同基座、同参数、同架构,仅靠后训练硬拉出5倍提升——这就是后训练Scaling的威力 [2]。
二、"同基座、不同性能"意味着什么
要理解GLM-5.3的意义,需要先理解大模型的两个阶段。
预训练 vs 后训练:发动机与驾驶员
| 维度 | 预训练(Pre-training) | 后训练(Post-training) |
|---|---|---|
| 类比 | 造发动机 | 训练驾驶员 |
| 数据 | 万亿级互联网文本 | 百万级精选指令+反馈 |
| 目标 | 学会语言和知识 | 学会遵循指令、推理、对齐人类偏好 |
| 成本 | 极高(GPU集群数月) | 中等(可在更小规模集群训练) |
| 决定什么 | 模型的知识上限 | 模型的实际能力发挥 |
| GLM-5.3的角色 | 与5.2完全相同 | 全部性能提升的来源 |
GLM-5.3证明的核心判断:
预训练给模型装了"知识库",但后训练才决定模型能不能"把知识用好"。基座的智能上限远未开发完全——同样的基座,后训练做得越好,模型越强 [1]。
后训练Scaling:AI的第二条增长曲线
过去业界认为"模型变强=堆参数+堆数据(预训练Scaling)"。GLM-5.3展示了第二条路:
预训练Scaling(传统路线):
参数量 355B → 744B → ??? 成本指数增长,收益递减
后训练Scaling(GLM-5.3路线):
基座不变,后训练规模 ×10
→ 编程 +50%,安全 +100%
成本线性增长,收益仍在爬升
💡 行业影响:如果"同基座+后训练"能持续拉出大幅提升,意味着预训练一次、后训练多次迭代将成为主流路线。对中小团队尤其友好——不用造基座,用好后训练就能出好模型。
三、后训练是什么:从"会说话"到"会做事"
一句话定义
后训练是预训练之后的所有训练阶段,目标是把一个"会说话"的语言模型,变成一个"会做事"的可用产品 [4]。
为什么需要后训练
预训练模型(基座模型)有三个致命问题:
| 问题 | 通俗解释 | 后训练的解法 |
|---|---|---|
| 不会遵循指令 | 你说"写一首诗",它输出维基百科的诗歌词条 | SFT教会指令遵循 |
| 不对齐人类偏好 | 它可能输出有害、不准确或风格不佳的内容 | 偏好优化对齐价值观 |
| 不会深度推理 | 复杂数学、编程、多步推理能力弱 | RL+可验证奖励训练推理 |
后训练的发展脉络
2022年 RLHF(ChatGPT路线)
预训练 → SFT → RLHF(PPO + 人类标注偏好)
问题:成本高,需要独立的Value Model和Reward Model
2024年 DPO / SimPO / KTO
预训练 → SFT → 偏好优化(无需RL)
突破:跳过强化学习,直接从偏好对学习
2025年 GRPO / DAPO / RLVR(DeepSeek-R1路线)
预训练 → SFT → 偏好优化 → RL(可验证奖励)
突破:去掉Value Model,用可验证奖励替代人类标注
2026年 后训练Scaling(GLM-5.3路线)
基座不变 → 极致后训练规模(10×任务环境)
突破:证明后训练Scaling仍有巨大空间
⚠️ 关键认知更新:RLHF并没有"死掉",而是被拆解成了更高效的模块化组合。2026年的标准配方是:SFT(学格式)→ 偏好优化(学价值观)→ RL+RLVR(学推理) [3]。
四、后训练三阶段管线
现代后训练分三个阶段,顺序不能乱:
阶段一:SFT(监督微调)——学会"怎么回答"
| 项目 | 说明 |
|---|---|
| 目标 | 教会模型遵循指令、按格式输出 |
| 数据量 | 1-10M条精选指令-回复对 |
| 技术 | 标准微调或LoRA/QLoRA(参数高效微调) |
| 类比 | 新员工学公司文档格式和基本规范 |
# SFT微调示例(使用TRL库)
from trl import SFTTrainer, SFTConfig
# 配置:用LoRA降低显存需求
config = SFTConfig(
output_dir="./glm-sft",
num_train_epochs=3,
per_device_train_batch_size=4,
learning_rate=2e-5,
# 预期输出:模型学会按指令格式输出
)
trainer = SFTTrainer(
model="base_model_path",
train_dataset=sft_dataset, # {"instruction": "...", "output": "..."}
args=config,
)
trainer.train()
# 预期:loss从~2.0降到~0.5,模型学会遵循指令格式
💡 实践要点:SFT数据质量比数量重要。10万条高质量标注 > 100万条低质量数据。NVIDIA Nemotron 3 Super的SFT从4000万条语料中精选了700万条 [3]。
阶段二:偏好优化——学会"什么更好"
SFT后的模型会回答了,但回答可能不够好、不够安全、不够对齐人类偏好。偏好优化解决"哪个回答更好"的问题。
| 算法 | 核心思路 | 优势 | 适用场景 |
|---|---|---|---|
| DPO | 从偏好对直接学习,跳过RL | 简单稳定 | 通用对齐 |
| SimPO | 用平均对数概率做隐式奖励,去掉参考模型 | 省一半显存 | 资源受限 |
| KTO | 只需"赞/踩"二元反馈,不需成对数据 | 数据采集便宜 | 生产系统 |
| ORPO | 把SFT和偏好优化合并为一步 | 训练时间减半 | 快速迭代 |
# DPO偏好优化示例
from trl import DPOTrainer, DPOConfig
config = DPOConfig(
output_dir="./glm-dpo",
beta=0.1, # KL散度约束强度
learning_rate=5e-7,
# 预期:模型学会偏好chosen回复,回避rejected回复
)
trainer = DPOTrainer(
model="./glm-sft", # 从SFT检查点继续
ref_model="./glm-sft", # 参考模型(SimPO可省略)
train_dataset=preference_dataset,
# 数据格式:{"prompt": "...", "chosen": "好回复", "rejected": "差回复"}
args=config,
)
trainer.train()
⚠️ 常见坑:DPO的
beta参数很敏感。beta=0.1是通用推荐值;beta太大模型不敢偏离参考模型,太小容易"跑偏"。SimPO无需参考模型,显存减半,适合单卡训练 [3]。
阶段三:RL+RLVR——学会"深度推理"
这是GLM-5.3后训练的核心阶段,也是2025-2026年最重要的技术变革。
RLVR(可验证奖励的强化学习)的核心洞察:数学题可以自动判对错、代码可以跑单元测试、推理可以用证明器验证——不需要人类标注偏好,机器自己就能给奖励信号 [3]。
| 算法 | 核心创新 | 解决了什么问题 | 代表模型 |
|---|---|---|---|
| PPO | 经典RL算法 | 奠基之作 | GPT-3.5/4 |
| GRPO | 去掉Value Model,用组内相对排名 | 显存减半,训练成本大降 | DeepSeek-R1, GLM-5.3 |
| DAPO | 长程序列稳定训练 | 解决长CoT梯度消失 | Qwen2.5-32B |
GRPO的工作原理(GLM-5.3后训练的基础算法):
对每个问题:
1. 采样 G 个回答(如 G=8)
2. 用验证器给每个回答打分(如:代码能否通过测试)
3. 计算组内相对优势:advantage_i = (reward_i - mean) / std
4. 高于均值的回答 → 被强化
5. 低于均值的回答 → 被弱化
不需要:
✗ Value Model(PPO需要,GRPO不需要)
✗ 人工标注偏好对
✗ 参考模型
只需要:
✓ 能自动验证对错的任务(数学、代码、逻辑推理)
💡 GLM-5.3的关键升级:不仅用GRPO,更是把训练任务从"孤立编程题"扩展到"发现问题→分析方案→实施→验证→交付"的完整工程流程。部分训练任务的工作量相当于资深工程师连续数天的工作,模型需使用真实的计算集群、存储系统、内部文档与代码库完成任务 [2]。
三阶段对比速查卡
| 维度 | SFT | 偏好优化 | RL+RLVR |
|---|---|---|---|
| 学会什么 | 指令遵循、格式 | 人类偏好、安全 | 深度推理、自主决策 |
| 数据 | 指令-回复对 | 偏好对(好/差) | 可验证任务(数学/代码) |
| 奖励来源 | 人工标注 | 人工偏好标注 | 自动验证器 |
| 突破上限 | 受限于标注质量 | 受限于偏好对质量 | 可超越训练数据 |
| 计算成本 | 低 | 中 | 高 |
| 在GLM-5.3中 | 基础指令能力 | 安全与风格对齐 | 核心性能来源 |
五、GLM-5.3的后训练到底做了什么
GLM-5.3的后训练不只是"多跑了几轮GRPO",而是系统性地扩大了训练规模和环境复杂度。
三个关键维度
| 维度 | 传统后训练 | GLM-5.3后训练 | 效果 |
|---|---|---|---|
| 任务环境规模 | 静态编程题数据集 | 数十倍规模的长程任务环境 | 能处理数万行代码、上百文件 |
| 任务复杂度 | 单轮代码生成 | 端到端工程流程(发现→分析→实施→验证→交付) | 从"写函数"到"交付项目" |
| 训练周期 | 有限轮次 | 超长后训练周期 | 基座智能持续被激发 |
训练基础设施
GLM-5.3的后训练基于智谱自研的三件套:
| 组件 | 作用 | 技术特点 |
|---|---|---|
| Slime | 异步RL训练框架 | 提升训练吞吐量和效率,支持更细粒度的后训练迭代 |
| IndexShare | 稀疏注意力优化 | 同一索引器复用于每4层稀疏注意力,1M上下文FLOPs降2.9× |
| SAO | 稀疏注意力机制 | 降低长上下文部署成本,保持长上下文能力 |
网络安全能力的"意外涌现"
GLM-5.3最令人意外的发现:随着后训练规模扩大,网络安全能力以超出预期的速度涌现 [1]。
| 安全能力 | GLM-5.2 | GLM-5.3 | 说明 |
|---|---|---|---|
| CyberGym(漏洞发现) | 77.2% | 84.5% | 超过GPT-5.6(83.6%) |
| ExploitBench(漏洞利用) | 24.4% | 54.4% | 翻倍增长 |
| 真实漏洞挖掘 | — | 2436个 | 269个项目,中高危1097个 |
智谱的表述:当前优势集中在漏洞利用链前端(发现+分析),更深入的漏洞利用与完整攻防仍有提升空间。这说明后训练Scaling不仅提升已知能力,还能涌现未预料的新能力 [1]。
六、后训练技术栈:从训练到部署的工具链
如果你想在实践中做后训练,以下是目前主流的工具栈。
训练工具
| 工具 | 定位 | 核心能力 | 适合谁 |
|---|---|---|---|
| LLaMA Factory | 零代码微调 | 100+模型支持,WebGUI操作,SFT/DPO/GRPO全流程 | 不想写代码的工程师 |
| Axolotl | YAML配置式 | 支持GRPO、MoE、量化训练,灵活度高 | 熟悉配置的研究者 |
| TRL + PEFT | HuggingFace原生 | SFTTrainer/DPOTrainer/GRPOTrainer,与HF生态无缝 | 自定义训练管线 |
| Unsloth | 单GPU极速 | 1张卡跑微调,速度最快 | 资源受限的团队 |
| Slime | 智谱自研RL框架 | 异步RL训练,大规模后训练 | 大规模工业级训练 |
# LLaMA Factory 快速启动SFT(零代码方式)
llamafactory-cli train \
--model_name_or_path base_model_path \
--dataset alpaca_gpt4_zh \
--template glm \
--finetuning_type lora \
--lora_rank 8 \
--output_dir ./glm-sft-lora
# 预期输出:生成LoRA适配器权重,可直接加载到基座模型
# Axolotl 启动GRPO训练(YAML配置方式)
# config.yml 关键配置:
# base_model: ./glm-sft
# rl: grpo
# grpo_group_size: 8 # 每个问题采样8个回答
# grpo_beta: 0.04 # KL约束
# reward_fn: code_verifier # 用代码测试做奖励信号
axolotl train config.yml
# 预期输出:模型学会通过单元测试的代码生成策略
⚠️ 环境要求:以上工具需要Python 3.10+、PyTorch 2.1+、CUDA 12.1+。GRPO训练至少需要1张80GB GPU(如A100/H100)。完整RL环境训练(如GLM-5.3级别)需要多节点GPU集群。
推理与部署
| 工具 | 用途 | 特点 |
|---|---|---|
| vLLM | 高吞吐推理 | PagedAttention,支持连续批处理 |
| TensorRT-LLM | 极致推理性能 | NVIDIA官方,延迟最低 |
| MLC-LLM | 跨平台部署 | GPU/CPU/浏览器/移动端全覆盖 |
监控与评估
| 工具 | 用途 |
|---|---|
| Langfuse | 开源LLM可观测平台,追踪训练和推理 |
| LangSmith | LangChain生态,实验追踪+评估 |
| OpenCompass | 开源评测框架,覆盖百余benchmark |
七、实战路线:不同场景怎么选
基于2026年业界实践,不同场景的后训练路线选择 [3]:
| 路线 | 适用场景 | 技术栈 | 数据需求 | 成本 |
|---|---|---|---|---|
| A:通用对话 | 客服、问答 | SFT(LoRA) → DPO(β=0.1) | 1-10万指令对 + 偏好对 | 低 |
| B:推理型 | 数学、代码 | SFT(LoRA) → GRPO(G=8~16) + RLVR | 可验证任务集 | 中 |
| C:Agent型 | 工具调用、多步任务 | SFT → DPO → RL(环境交互) | 多轮工具调用轨迹 | 高 |
| D:极致性能 | 对标GLM-5.3 | SFT → 偏好优化 → 大规模RL+长程环境 | 十万级环境任务 | 极高 |
路线A:通用对话(性价比最高)
# 最小可行配置:1张GPU
# 工具:Unsloth + TRL
# 流程:SFT(LoRA) → DPO(β=0.1)
# Step 1: SFT
unsloth train --model base_model --dataset alpaca --method lora
# Step 2: DPO
trl dpo --model ./sft_output --dataset preferences --beta 0.1
# 预期:3小时内完成,模型学会指令遵循+基本偏好对齐
路线B:推理型(数学/代码)
# 工具:Axolotl + GRPO
# 流程:SFT(LoRA) → GRPO(G=8) + RLVR
# Step 1: SFT(学会代码格式)
axolotl train sft_config.yml
# Step 2: GRPO + RLVR(学会通过测试的代码)
axolotl train grpo_config.yml \
--grpo_group_size 8 \
--reward_fn "python -m pytest {output_file}"
# 预期:模型学会写能通过单元测试的代码
# 关键:奖励信号来自pytest结果,无需人工标注
💡 RLVR的精髓:把"人类判断代码好不好"变成"pytest能不能通过"。机器自动打分,成本趋近于零,且信号比人类标注更一致 [3]。
路线C:Agent型(工具调用)
# 工具:NeMo Gym / RLFactory
# 流程:SFT → DPO → RL(多轮环境交互)
# 使用RLFactory进行多轮工具调用RL训练
python -m rlfactory.train \
--model ./sft_dpo_model \
--env configs/tool_use_env.yml \
--reward "tool_verification" \
--num_rollouts 100000
# 预期:模型学会在多轮对话中合理调用工具
# 关键:需要构建交互式工具环境,成本较高
八、后训练的核心趋势与展望
四大趋势
| 趋势 | 说明 | 代表性进展 |
|---|---|---|
| 从人工标注到自动验证 | RLVR用代码测试/数学验证器替代人类偏好标注 | DeepSeek-R1, GLM-5.3 |
| 从静态数据到交互环境 | 训练数据从"题库"变为"沙盒环境" | NeMo Gym, RLFactory |
| 从单模型到自我博弈 | 模型自己生成训练数据,自我提升 | SPIN, SPICE |
| 从三阶段到统一管线 | SFT+偏好优化+RL融合为单目标训练 | ORPO |
GLM-5.3带来的三个启示
-
基座的智能上限远未被充分开发——同基座后训练就能拉出50%提升,说明现有基座还有巨大潜力
-
后训练Scaling是可行路线——不一定要堆参数,把后训练做深做透也能大幅提升
-
能力可以"涌现"——网络安全能力在训练中意外爆发,说明大规模RL可能催生预料之外的新能力
⚠️ 理性看待:GLM-5.3的benchmark为智谱官方口径,需第三方复测验证。后训练Scaling不是万能的——如果基座本身能力不足,后训练也无法无中生有。后训练放大基座能力,但不能创造基座不具备的能力。
九、总结
预训练决定下限,后训练决定上限。GLM-5.3用7430亿同基座+50%提升证明了:后训练不是"锦上添花",而是大模型的"第二次进化"。
六句话带走:
- 后训练 = SFT(学格式)→ 偏好优化(学价值观)→ RL+RLVR(学推理),顺序不能乱
- GRPO去掉了PPO的Value Model,显存减半,是2026年RL训练的主流选择
- RLVR用自动验证器(代码测试/数学证明)替代人工标注,成本趋近于零
- GLM-5.3证明"基座不变+后训练Scaling"路线可行,为中小团队指明方向
- 后训练不仅提升已知能力,还能涌现意外能力(如GLM-5.3的网络安全能力翻倍)
- 实战起步:通用对话用SFT+DPO,推理型用SFT+GRPO+RLVR,Agent型需构建交互环境
版本说明:本文基于GLM-5.3官方发布数据(2026-08-14)撰写。后训练技术栈持续演进,Slime、NeMo Gym、RLFactory等框架功能迭代频繁,具体API和配置请查阅各项目最新文档。
参考来源:1.GLM-5.3官方页面 | 2.掘金技术测评 | 3.Post-Training in 2026 | 4.RL Tutorial
更多推荐


所有评论(0)