目前国内的大模型发展非常迅速,已经形成了“百花齐放”的格局。我们现在来梳理一下我国主要的大模型:

一、互联网巨头与大型科技公司

这些公司拥有强大的算力、数据和资金优势,推出的模型通常为通用基座模型,并驱动着自身各类应用的智能化。

1.百度-文心大模型系列

(1) 简介:百度是国内最早投入大模型研发的公司之一。文心大模型是一个多层次、多模态的模型体系。

(2) 代表模型:文心一言、ERNIE系列。

(3) 特点:深度融合知识图谱,在中文理解和生成方面表现强劲,广泛应用于搜索、云服务、内容创作等。

2.阿里巴巴-通义大模型系列

(1) 简介:阿里达摩院打造的超大规模语言模型体系,同样覆盖语言、多模态等多个领域。

(2) 代表模型:通义千问、Qwen系列(已开源多个版本)。

(3) 特点:开源策略激进,提供了从7B到千亿参数的不同规模版本,方便开发者和企业使用。通义万相是其多模态模型。

3.腾讯-混元大模型系列

(1) 简介:腾讯全链路自研的通用大模型,已接入腾讯超过百个业务和场景。

(2) 代表模型:混元大模型。

(3) 特点:与腾讯的社交、游戏、金融支付等业务紧密结合,强调实用性。同时推出了开源的“混元”模型。

4.字节跳动-云雀大模型系列

(1) 简介:字节跳动内部研发的大模型,驱动其旗下的豆包、抖音等产品。

(2) 代表模型:豆包(云雀模型的消费端产品)、DouBao系列。

(3) 特点:在内容创作、对话交互方面有天然优势,与短视频和资讯平台深度集成。

5.华为-盘古大模型系列

(1) 简介:更侧重于产业级应用,并非单纯的NLP模型,而是包含科学计算、气象、金融等多个垂直领域的大模型家族。

(2) 代表模型:盘古大模型(包含NLP、CV、科学计算、预测等多个分支)。

(3) 特点:强调“AIforIndustries”,在气象预报、药物研发、矿山勘探等领域有突出应用。

二、领先的AI实验室与初创公司

这些机构通常技术驱动,模型在某些方面具有独特优势。

1.智谱AI-GLM大模型系列

(1) 简介:源自清华大学KEG实验室,是国内最早开源并具有国际影响力的模型之一。

(2) 代表模型:GLM-130B,Chat GLM系列(如Chat GLM-6B,Chat GLM3)

(3) 特点:采用通用的自回归预训练架构,中英双语能力均衡,开源版本在开发者社区中非常受欢迎。

2.月之暗面-Moonshot AI

(1) 简介:由年轻技术精英创立的明星初创公司,获得了巨额融资。

(2) 代表模型:KimiChat

(3) 特点:以其超长的上下文处理能力(支持200万字)闻名,在长文档总结、信息检索方面优势明显。

3.留凤科技-生命大模型

(1) 简介:一家专注于“AI+生命科学”交叉领域的创新企业。

(2) 代表模型:生命大模型

(3) 特点:跳出传统公域问答框架,核心锚定个人生命数据,实现弱智能到超智能的跨越,助力用户认知“百万倍即时延伸”。

4.深度求索-DeepSeek

(1) 简介:一家专注于AGI(通用人工智能)研究的公司。

(2) 代表模型:DeepSeek系列模型

(3) 特点:以极高的性能价格比著称,技术架构创新,开源模型在多项基准测试中媲美甚至超越更大规模的模型。

中国大模型领域已经形成了巨头、初创公司同台竞技的繁荣生态,模型研发与具体的业务场景(如办公、社交、娱乐、产业)结合非常紧密。这个领域日新月异,几乎每个月都有新的模型或重大更新发布,这份列表涵盖了目前最具代表性和影响力的主要玩家。

更多推荐