Grok-1:xAI 开源的 314B 大模型,能跑就算赢
Grok-1:xAI 开源的 314B 大模型,能跑就算赢
xAI 是马斯克搞的 AI 公司,去年他们把 Grok-1 的权重完整开源了,5万多 Star。我看了下,这是目前公开的最大开源模型之一,314B 参数,直接用的 Apache 2.0 协议。

314B 参数是什么概念
先说模型规格。Grok-1 用了 MoE(混合专家)架构,总共 8 个专家,每个 token 走 2 个。64 层,query 有 48 个注意力头,key/value 有 8 个。embedding 维度 6144,上下文长度 8192 tokens。
这个架构的好处是,虽然总参数量到了 314B,但每次推理只激活一部分专家,实际计算量比同参数量的稠密模型小很多。当然,"小很多"是相对的,该吃的显存一点没少。
能用,但得有硬件
仓库里给的是 JAX 示例代码,装好依赖跑 python run.py 就行。但说实话,这模型不是普通人能跑的。314B 参数,就算用 8-bit 量化,你至少也得有几张 A100 才能塞进去。
仓库自己也说了,MoE 层的实现没有做性能优化,纯粹是为了验证模型正确性。所以如果你指望拿它做生产推理,得自己改代码或者用第三方框架。

怎么下载权重
两种方式。一是用 BT 种子,仓库给了 magnet link,直接用迅雷或 qBittorrent 下就行。二是从 HuggingFace 下载,一行命令搞定,不过文件很大,得有耐心。
值不值得关注
对大多数人来说,Grok-1 的实际用途有限。模型太大,跑起来门槛高,生态也不如 LLaMA 系列成熟。
但它开源这件事本身有价值。314B 这个体量的模型,愿意完整放出权重的公司不多。对研究者来说,这是一份很好的 MoE 架构参考实现。对开发者来说,至少证明了这个量级的开源模型是可行的。
如果你有硬件条件,想试试最大的开源模型,Grok-1 值得看看。如果只是想找个能用的大模型,LLaMA 或者 Qwen 可能更实际。
是想找个能用的大模型,LLaMA 或者 Qwen 可能更实际。
更多推荐



所有评论(0)