Anthropic也要自己造芯片:为什么大模型公司最后都在走向硬件?

做大模型的公司,为什么最后都开始研究芯片?

最近,Anthropic确认正在组建自己的芯片设计团队,希望针对Claude进行软硬件协同设计。

这件事值得关注。

因为Anthropic原本是一家典型的大模型公司,它最核心的产品是Claude,而不是CPU、GPU或者AI加速器。

但今天,大模型公司似乎越来越难只做“模型”。

从Google TPU,到云厂商自研AI芯片,再到Anthropic开始组建芯片团队,一个越来越明显的趋势正在出现:

AI竞争正在从“谁的模型更强”,走向“谁能控制整个计算栈”。


一、为什么大模型公司越来越离不开芯片?

原因其实很简单:

大模型太吃算力了。

训练一个大型模型,需要大量GPU。

模型上线以后,每个用户提出问题,同样需要推理算力。

当用户规模不断扩大以后,计算资源就会从一个技术问题,变成一个成本问题。

可以把大模型公司想象成一家超级工厂。

模型是产品设计。

GPU则是生产设备。

如果一家公司的核心产品越来越依赖某一种生产设备,那么设备的:

  • 价格;
  • 供应;
  • 性能;
  • 功耗;
  • 交付周期;

都会直接影响公司的竞争力。

因此,芯片自然开始成为大模型公司的核心基础设施。


二、有英伟达GPU,为什么还要自己做芯片?

这里有一个非常重要的区别:

通用AI芯片和定制AI芯片。

GPU最大的优势之一,是通用性非常强。

今天可以训练Claude,明天也可以训练图像模型、视频模型或者其他AI模型。

但通用意味着:

它必须考虑很多不同类型的任务。

如果一家企业拥有非常大规模、非常稳定的AI工作负载,就会开始考虑一个问题:

能不能针对自己的模型,把芯片设计得更合适?

例如某些模型可能特别重视:

  • 矩阵计算;
  • Transformer推理;
  • KV Cache;
  • 内存带宽;
  • 芯片互连;
  • 能耗。

如果针对这些任务重新优化芯片,在足够大的部署规模下,就可能获得更好的性能和成本效率。


三、自研芯片不等于“抛弃GPU”

这也是很容易出现的误解。

Anthropic目前强调的实际上仍然是:

多芯片策略。

也就是说:

不同任务使用不同硬件。

目前大型AI公司越来越可能同时使用:

NVIDIA GPU
+
AMD GPU
+
云厂商AI加速器
+
自研芯片

为什么?

因为训练和推理本身就不是一种任务。

模型训练通常更看重:

  • 极高算力;
  • 高速互联;
  • 大规模GPU集群;
  • 高带宽存储。

而推理则更加关注:

  • 成本;
  • 功耗;
  • 延迟;
  • 每Token成本。

所以未来AI基础设施很可能不是“一颗芯片统治所有任务”,而是不同芯片承担不同工作。


四、为什么Anthropic同时又在大量采购AMD GPU?

这恰恰说明:

AI算力需求增长得太快了。

2026年7月,AMD与Anthropic宣布扩大合作,Anthropic计划部署最高2GW规模的AMD Instinct MI450系列GPU,首个GW级部署预计从2027年上半年开始。

这里最值得关注的并不是某一个具体GPU型号。

而是“GW”。

过去讨论计算机,我们很少用电力规模来描述计算能力。

今天建设AI基础设施,却越来越像建设大型能源基础设施。

数据中心需要的不只是GPU。

还包括:

  • CPU;
  • HBM;
  • DDR;
  • SSD;
  • 网络;
  • 光模块;
  • 电源;
  • 液冷;
  • 数据中心。

因此AI竞争正在迅速从“芯片竞争”,扩展成“系统竞争”。


五、大模型公司为什么必须做软硬件协同?

假设模型设计人员完全不考虑芯片。

模型可能理论性能非常强,但运行效率并不高。

反过来,如果芯片团队不知道模型未来需要什么,也很难设计出真正高效的硬件。

于是现在越来越强调一个概念:

Co-design,协同设计。

简单理解就是:

模型设计时考虑硬件。

硬件设计时也考虑模型。

比如:

模型能否使用更低精度计算?

模型架构能否减少内存访问?

哪些算子使用频率最高?

KV Cache应该如何处理?

芯片需要多少HBM?

不同GPU之间如何交换数据?

这些问题其实已经很难单独归类为“软件问题”或者“硬件问题”。


六、为什么存储会越来越重要?

很多人看到大模型公司造芯片,第一反应是:

GPU竞争更激烈了。

但实际上还有另一条隐藏主线:

存储。

AI处理器越来越快以后,需要不断读取:

  • 模型参数;
  • KV Cache;
  • 训练数据;
  • 中间结果。

如果数据供应速度跟不上,计算单元就会等待。

因此未来AI芯片竞争,除了看算力,还会越来越看:

计算 + 内存 + 互连。

这也是为什么HBM这几年突然成为AI产业的重要关键词。


写在最后

Anthropic开始组建芯片团队,看似是一家AI公司的业务扩张。

但背后反映的其实是整个AI产业正在发生的变化。

过去竞争的是:

模型。

后来竞争的是:

模型 + 算力。

现在正在进一步变成:

模型 + 芯片 + 存储 + 网络 + 数据中心。

AI越往深处发展,软件和硬件之间的边界反而越模糊。

下一阶段,大模型公司真正争夺的,可能不只是谁拥有最聪明的模型。

还包括:

谁能够以更低的成本,把模型真正跑起来。

这也是AI芯片竞争越来越值得关注的原因。

更多推荐