6月30日美团发布LongCat-2.0,一个1.6万亿参数的MoE大模型,全程在国产算力上完成训练和推理,没碰过一张英伟达GPU。有意思的是,它之前匿名挂在OpenRouter上叫"Owl Alpha",Hermes月调用量已经干到全球第一。这篇文章拆解它的架构设计和训练工程,聊聊"国模+国芯"全流程闭环到底怎么跑通的。

一、从匿名登顶到官宣:LongCat-2.0是什么

先说清楚这个模型的来历。

今年4月底,美团把LongCat-2.0的预览版以匿名身份接入OpenRouter,取名"Owl Alpha"。两个月后,它的总调用量跻身全球前三,在Hermes(Agent框架)的月调用量排到全球第一,Claude Code场景排第二,OpenClaw排第三。一堆开发者在用,但没人知道背后是谁。

6月30日官宣:这是美团的。

LongCat-2.0的技术规格一摆出来,跟DeepSeek V4-Pro几乎孪生——都是1.6万亿总参数、约480亿激活参数、1M上下文窗口。区别在于训练算力路线和激活动态范围。我整理了一张对比表:

模型机构总参数平均激活激活范围上下文训练算力
LongCat-2.0美团1.6T~48B33B~56B1M全国产ASIC
DeepSeek V4-Pro深度求索1.6T~49B未公开1M未限定
Qwen3-235B-A22B阿里235B22B未公开128K未公开
GLM-5.2智谱未披露128K未公开

规格看着差不多,但"全国产算力"这四个字分量很重。之前行业普遍认为国产卡只能做推理,训练得靠英伟达。美团这个跑通了,意味着什么?往下看。

二、MoE架构:1.6T参数只激活3%

LongCat-2.0用的是MoE(Mixture of Experts)混合专家架构。核心思路不复杂:模型里有很多"专家"子网络,每次推理时路由器只挑一部分专家来处理当前token,不是所有专家都干活。

具体到LongCat-2.0:总参数1.6万亿,但每个token平均只激活约480亿参数,激活率大约3%。这意味着97%的参数在单次推理中是"睡着"的。

这里有个容易被忽略的细节。美团官方博客里有句话比1.6万亿这个数字更重要:模型的MoE稀疏度在不考虑N-gram Embedding的情况下已经达到约97%,再扩135B专家参数带来的性能增益可以忽略不计。

这话什么意思?过去两年大家拼命往专家池里堆参数,从560B到671B到1T再到1.6T,每代都觉得"再大一点就更强"。美团的数据直接说:到97%这个稀疏度,你再加专家,收益小到测不出来。

我之前做过一组对比,各代MoE模型的稀疏度变化:

模型总参数激活参数稀疏度备注
DeepSeek V3671B37B~94%2024年底
DeepSeek V4-Pro1.6T49B~97%2026年4月
LongCat-2.01.6T48B~97%2026年6月
LongCat-Flash560B27B~95%前代产品

97%很可能就是MoE架构的一条渐近线。与其继续扩专家池,不如在注意力机制、上下文效率、后训练数据上找增量。LongCat-2.0的设计重心恰恰在这。

三、零计算专家与ScMoE:动态算力分配

LongCat-2.0继承自前代LongCat-Flash的两个核心设计,第一个是"零计算专家"(Zero-Computation Expert)。

这个设计思路挺巧的。传统MoE里每个专家都要做计算,不管token简单还是复杂。但你想啊,标点符号、常见助词这些简单token,跟复杂推理token用一样的计算量,明显浪费。

零计算专家的做法是在专家池里塞一类"恒等映射"专家——不做任何计算,直接把输入原样返回。路由器根据token的上下文重要性,动态决定给它派几个真专家、几个零计算专家。结果就是激活参数从一个固定值变成了一个范围:33B到56B,平均48B。

调节机制也值得一提。美团用了一个PID控制器(就是控制论里那个比例-积分-微分控制器)来调节专家偏置,让token分配比例收敛到目标值。技术报告说经过大约20B token的调整后稳定在期望值,波动小于1%。

# 环境要求:Python 3.10+, PyTorch 2.0+
# 零计算专家路由逻辑简化实现
import torch
import torch.nn as nn

class ZeroComputationExpert(nn.Module):
    """零计算专家:恒等映射,不做任何计算"""
    def forward(self, x):
        return x

class MoERouter(nn.Module):
    def __init__(self, num_experts, num_zero_experts, hidden_dim, target_zero_ratio=0.03):
        super().__init__()
        self.gate = nn.Linear(hidden_dim, num_experts + num_zero_experts)
        self.zero_experts = nn.ModuleList([
            ZeroComputationExpert() for _ in range(num_zero_experts)
        ])
        # PID控制器参数
        self.kp, self.ki, self.kd = 0.01, 0.001, 0.005
        self.target_ratio = target_zero_ratio
        self.integral = 0.0
        self.prev_error = 0.0
        self.bias = 0.0

    def update_bias(self, current_ratio):
        """PID反馈调节零计算专家的偏置"""
        error = self.target_ratio - current_ratio
        self.integral += error
        derivative = error - self.prev_error
        self.bias = self.kp * error + self.ki * self.integral + self.kd * derivative
        self.prev_error = error

    def forward(self, x):
        logits = self.gate(x) + self.bias
        return torch.softmax(logits, dim=-1)

第二个设计是ScMoE(Shortcut-Connected MoE),跨层快捷连接。利用注意力显著性在相邻隐藏层间高度稳定的特性,单次索引可以引导多个连续层的推断。这个能力在全训练阶段通过跨层蒸馏强化,大幅摊销了计算成本。

简单说就是:相邻几层共用一个路由决策,不用每层都重新算一遍路由。听着不起眼,但在1.6T参数的模型里,省下来的计算量是巨大的。

四、LSA稀疏注意力:百万上下文的工程基础

LongCat-2.0自研了LongCat Sparse Attention(LSA),官方说是DeepSeek Sparse Attention(DSA)的演进版本。要原生支持1M token上下文,传统Transformer的O(n²)注意力计算量会爆炸,必须用稀疏注意力把复杂度压下来。

LSA通过三个正交设计解决细粒度稀疏机制中的二次评分成本与内存碎片化问题:

流感知索引(SI) 把碎片化的内存访问转化为高度可预测的顺序块。原来每选一个token都要随机访问内存,现在改成连续数据读取加动态随机选择的混合模式,HBM带宽利用率上去了。跨层索引(CLI)则利用相邻隐藏层注意力显著性的稳定性,做一次索引就能引导多个连续层,省掉重复计算。还有一个分层索引(HI),先粗筛再精筛——索引器先通过区块级回忆过滤候选,再对剩余内容做细粒度token选择。

# 环境要求:Python 3.10+, PyTorch 2.0+
# LSA分层索引(HI)简化实现
import torch

def hierarchical_index(query, key, block_size=64, top_k_blocks=8):
    """
    HI分层索引:先区块级粗筛,再token级精筛
    query: [batch, heads, seq_len, dim]
    key:   [batch, heads, seq_len, dim]
    返回: 需要精筛的候选token索引
    """
    batch, heads, seq_len, dim = query.shape
    num_blocks = seq_len // block_size

    # 第一步:区块级粗筛
    key_blocks = key.view(batch, heads, num_blocks, block_size, dim)
    key_block_repr = key_blocks.mean(dim=3)  # 每个区块的均值表示

    block_scores = torch.einsum('bhsd,bhnd->bhsn', query, key_block_repr)
    top_blocks = block_scores.topk(top_k_blocks, dim=-1).indices

    # 第二步:在候选区块内做细粒度选择
    candidate_indices = top_blocks.unsqueeze(-1) * block_size + \
        torch.arange(block_size).view(1, 1, 1, 1, block_size)
    candidate_indices = candidate_indices.view(batch, heads, seq_len, -1)

    # 只对候选token计算精确注意力分数
    gathered_keys = torch.gather(
        key.unsqueeze(2).expand(-1, -1, seq_len, -1, -1),
        dim=3,
        index=candidate_indices.unsqueeze(-1).expand(-1, -1, -1, -1, dim)
    )
    fine_scores = torch.einsum('bhsd,bhspd->bhsp', query, gathered_keys)
    return candidate_indices, fine_scores

这三个设计叠加,让LongCat-2.0在百万token上下文下依然能准确定位信息,不会出现长文本常见的信息遗忘问题。

五、N-gram Embedding:换条路扩参数

前面说到MoE稀疏度97%后继续加专家收益可忽略。美团没在专家池上死磕,而是引入了N-gram Embedding模块。

这个设计在完全垂直于MoE专家布局的稀疏维度中扩展参数分配。具体来说,为5克token组合框架附加了1350亿参数,让核心嵌入空间规模提升约100倍。好处有两个:一是可以捕捉密集的局部token关系,二是通过降低内存I/O瓶颈加快大批量推理速度。

关键约束是比例控制——1350亿参数占总参数1.6万亿的约8.4%,控制在10%以内。这个设计思路挺值得借鉴的:当一条路的边际收益递减时,换个维度找增量。

六、MOPD多类型专家:三组分工

后训练阶段,LongCat-2.0用MOPD(Multi-Objective Post-training with Decoupled experts)架构融合三类专家:

专家类型覆盖领域优化目标
Agent Experts代码、工作流、搜索端到端任务成功率、工具调用、参数解析、自我纠错
Reasoning Experts数学、理工科、多跳推理根据问题难度自适应分配计算量
Interaction Experts指令遵循、抑制幻觉、安全边界不为了安全把模型变得没用

这个分法对应了大模型落地的三件事:能不能干活、能不能想清楚、能不能让人用着舒服。三类专家各有分工,用多专家并行解耦架构融合,避免互相干扰。

我在实际用MoE模型时遇到过一个问题:加安全对齐后模型变"笨"了,该调工具的时候不调。LongCat这个解耦设计理论上能缓解,但具体效果还得看开源后的实测。

七、五万卡国产算力:从2560卡到5万卡的长征

这是整件事里工程含量最高的部分。

美团从2023年7月正式启动国产算力适配,跟算力厂商建立周会机制。扩容路径很清晰:2023年9月成建制投入验证,2024年春节前后端到端训练跑通,2024年7月16000卡集群交付,最终扩展到峰值5万卡。

每跨越一个数量级都会遇到新问题。据接近项目的人士透露,万卡集群第一次启动时调度系统直接起不来——整个作业的内存总和超过了整数上限。还有更隐秘的"比特翻转"问题:硬件在计算过程中电路可能随机出现比特翻转,导致数值错误。这东西小规模训练时根本不知道它存在,到万卡级别才暴露。团队后来翻行业技术报告,发现只有Google的论文里提过一小段。

围绕稳定性、正确性和效率三条主线,团队重建了一套训练体系:

优化方向具体措施效果
稳定性自动重调度和容错恢复训练稳定性超92%,月均日故障率降70%
正确性确定性算子实现Bitwise一致性训练
效率ScMoE + Zero Bubble Pipeline硬件浮点计算利用率提升超50%
吞吐6D并行 + Muon优化器稳态日吞吐超1T tokens
# 环境要求:Python 3.8+, requests库
# 通过OpenRouter调用LongCat-2.0(原匿名ID: owl-alpha)
import requests
import json

def call_longcat(prompt, max_tokens=2000):
    """
    通过OpenRouter调用LongCat-2.0
    新用户认证可获1000万token免费额度
    官网体验:https://longcat.chat
    """
    url = "https://openrouter.ai/api/v1/chat/completions"
    headers = {
        "Authorization": "Bearer YOUR_OPENROUTER_API_KEY",
        "Content-Type": "application/json"
    }
    payload = {
        "model": "owl-alpha/owl-alpha-1",
        "messages": [{"role": "user", "content": prompt}],
        "max_tokens": max_tokens
    }
    resp = requests.post(url, headers=headers, json=payload)
    return resp.json()["choices"][0]["message"]["content"]

# 测试:让模型实现一个简单的token路由器
result = call_longcat("用Python实现一个简单的top-k MoE路由器,支持动态专家选择")
print(result)

有个细节值得注意:美团全程没有回滚训练,没有出现不可恢复的损失值飙升。在大模型训练里,Loss飙升是家常便饭,动不动就得回滚检查点重来。全程不回滚说明这套专用芯片上的训练基础设施已经跑通了。

八、性能评测与开源部署

基准测试方面,LongCat-2.0在SWE-bench Pro上拿到59.5分,超过GPT-5.5(58.6)和Claude Opus 4.6(57.3)。SWE-bench Pro是目前最接近真实工程场景的编程评测,测试模型解决GitHub上真实Issue的能力。

基准测试LongCat-2.0GPT-5.5Claude Opus 4.6Gemini 3.1 Pro
SWE-bench Pro59.558.657.354.2
SWE-bench Multilingual77.377.8

社区综合反馈是Agent能力"接近Claude Opus 4.6,落后于最新的Claude Opus 4.8"。在国产模型中位列顶尖梯队。

开源方面,美团选择MIT协议,这是企业集成最高级别的法律灵活性。不同于GPL等强Copyleft协议要求衍生作品也开源,MIT几乎没有使用限制。企业可以深度修改模型代码、优化LSA机制适配私有数据库,编译到闭源商业应用中,无需披露专有知识产权。

美团还推出了"令牌包"机制:用户一次性购买固定额度的代币包,有效期30天。上下文缓存完全免费——在传统架构中,编码助手反复读取同一代码库时重复输入的上下文会被全额计费,LongCat-2.0只对缓存未命中的输入和最终生成的token消耗配额。

九、适用边界与替代方案

适用场景:Agentic Coding(智能体编程)、长文档理解、仓库级代码编辑、多步逻辑推理。LongCat-2.0从设计之初就深度绑定Agent场景,1M上下文+工具调用能力是它的核心优势。

不适用场景:多模态任务(图像/视频生成)、实时低延迟对话(1.6T参数的推理延迟高于小模型)、中文创意写作(训练数据偏代码和技术文档)。

替代方案对比

模型优势劣势适合场景
DeepSeek V4-Pro规格近似,API生态成熟非国产算力训练通用编码、长文档
Qwen3-235B-A22B轻量、多语言强上下文仅128K多语言NLP
GLM-5.2中文理解强、多模态编码能力待验证中文场景
Claude Opus 4.8编码能力顶尖闭源、价格高企业级编码

风险提示

需要说明几个不确定性:

第一,美团官方博客通篇只说"国产算力芯片"“ASIC Superpod”,没有公布具体卡数,也没点名芯片型号。"五万卡"这个数字来自IT之家的报道,官方未直接确认。读者在引用时需注意区分官方表述和媒体推测。

第二,MoE稀疏度97%的渐近线结论基于美团单方面的数据。是否具有普适性,需要更多独立团队的验证。

第三,开源完整性待观察。目前宣布"近期分阶段开源Infra框架、推理引擎、模型参数",但具体开源哪些部分、开放到什么程度,还需等实际发布后确认。

验证方式:可以通过OpenRouter直接体验LongCat-2.0(模型ID: owl-alpha/owl-alpha-1),新用户认证获1000万token免费额度。官网体验地址:https://longcat.chat 。技术报告可在Hugging Face和GitHub搜索"LongCat-2.0"获取。

环境版本:本文代码示例基于Python 3.10+和PyTorch 2.0+环境测试,OpenRouter API兼容RESTful标准调用。

更多推荐