Anthropic也要自己造芯片:为什么大模型公司最后都在走向硬件?
Anthropic也要自己造芯片:为什么大模型公司最后都在走向硬件?
做大模型的公司,为什么最后都开始研究芯片?
最近,Anthropic确认正在组建自己的芯片设计团队,希望针对Claude进行软硬件协同设计。
这件事值得关注。
因为Anthropic原本是一家典型的大模型公司,它最核心的产品是Claude,而不是CPU、GPU或者AI加速器。
但今天,大模型公司似乎越来越难只做“模型”。
从Google TPU,到云厂商自研AI芯片,再到Anthropic开始组建芯片团队,一个越来越明显的趋势正在出现:
AI竞争正在从“谁的模型更强”,走向“谁能控制整个计算栈”。
一、为什么大模型公司越来越离不开芯片?
原因其实很简单:
大模型太吃算力了。
训练一个大型模型,需要大量GPU。
模型上线以后,每个用户提出问题,同样需要推理算力。
当用户规模不断扩大以后,计算资源就会从一个技术问题,变成一个成本问题。
可以把大模型公司想象成一家超级工厂。
模型是产品设计。
GPU则是生产设备。
如果一家公司的核心产品越来越依赖某一种生产设备,那么设备的:
- 价格;
- 供应;
- 性能;
- 功耗;
- 交付周期;
都会直接影响公司的竞争力。
因此,芯片自然开始成为大模型公司的核心基础设施。
二、有英伟达GPU,为什么还要自己做芯片?
这里有一个非常重要的区别:
通用AI芯片和定制AI芯片。
GPU最大的优势之一,是通用性非常强。
今天可以训练Claude,明天也可以训练图像模型、视频模型或者其他AI模型。
但通用意味着:
它必须考虑很多不同类型的任务。
如果一家企业拥有非常大规模、非常稳定的AI工作负载,就会开始考虑一个问题:
能不能针对自己的模型,把芯片设计得更合适?
例如某些模型可能特别重视:
- 矩阵计算;
- Transformer推理;
- KV Cache;
- 内存带宽;
- 芯片互连;
- 能耗。
如果针对这些任务重新优化芯片,在足够大的部署规模下,就可能获得更好的性能和成本效率。
三、自研芯片不等于“抛弃GPU”
这也是很容易出现的误解。
Anthropic目前强调的实际上仍然是:
多芯片策略。
也就是说:
不同任务使用不同硬件。
目前大型AI公司越来越可能同时使用:
NVIDIA GPU
+
AMD GPU
+
云厂商AI加速器
+
自研芯片
为什么?
因为训练和推理本身就不是一种任务。
模型训练通常更看重:
- 极高算力;
- 高速互联;
- 大规模GPU集群;
- 高带宽存储。
而推理则更加关注:
- 成本;
- 功耗;
- 延迟;
- 每Token成本。
所以未来AI基础设施很可能不是“一颗芯片统治所有任务”,而是不同芯片承担不同工作。
四、为什么Anthropic同时又在大量采购AMD GPU?
这恰恰说明:
AI算力需求增长得太快了。
2026年7月,AMD与Anthropic宣布扩大合作,Anthropic计划部署最高2GW规模的AMD Instinct MI450系列GPU,首个GW级部署预计从2027年上半年开始。
这里最值得关注的并不是某一个具体GPU型号。
而是“GW”。
过去讨论计算机,我们很少用电力规模来描述计算能力。
今天建设AI基础设施,却越来越像建设大型能源基础设施。
数据中心需要的不只是GPU。
还包括:
- CPU;
- HBM;
- DDR;
- SSD;
- 网络;
- 光模块;
- 电源;
- 液冷;
- 数据中心。
因此AI竞争正在迅速从“芯片竞争”,扩展成“系统竞争”。
五、大模型公司为什么必须做软硬件协同?
假设模型设计人员完全不考虑芯片。
模型可能理论性能非常强,但运行效率并不高。
反过来,如果芯片团队不知道模型未来需要什么,也很难设计出真正高效的硬件。
于是现在越来越强调一个概念:
Co-design,协同设计。
简单理解就是:
模型设计时考虑硬件。
硬件设计时也考虑模型。
比如:
模型能否使用更低精度计算?
模型架构能否减少内存访问?
哪些算子使用频率最高?
KV Cache应该如何处理?
芯片需要多少HBM?
不同GPU之间如何交换数据?
这些问题其实已经很难单独归类为“软件问题”或者“硬件问题”。
六、为什么存储会越来越重要?
很多人看到大模型公司造芯片,第一反应是:
GPU竞争更激烈了。
但实际上还有另一条隐藏主线:
存储。
AI处理器越来越快以后,需要不断读取:
- 模型参数;
- KV Cache;
- 训练数据;
- 中间结果。
如果数据供应速度跟不上,计算单元就会等待。
因此未来AI芯片竞争,除了看算力,还会越来越看:
计算 + 内存 + 互连。
这也是为什么HBM这几年突然成为AI产业的重要关键词。
写在最后
Anthropic开始组建芯片团队,看似是一家AI公司的业务扩张。
但背后反映的其实是整个AI产业正在发生的变化。
过去竞争的是:
模型。
后来竞争的是:
模型 + 算力。
现在正在进一步变成:
模型 + 芯片 + 存储 + 网络 + 数据中心。
AI越往深处发展,软件和硬件之间的边界反而越模糊。
下一阶段,大模型公司真正争夺的,可能不只是谁拥有最聪明的模型。
还包括:
谁能够以更低的成本,把模型真正跑起来。
这也是AI芯片竞争越来越值得关注的原因。
更多推荐
所有评论(0)