现在人人都在谈人工智能(AI),尤其是最近两年人工智能已经慢慢地走进我们每个人的生活。你是否好奇它是如何产生和发展的,它又是如何工作的?今天我们就一起来讲一讲人工智能。

part 01

人工智能的定义

1950年,图灵测试

其实,让机器具备智慧像人一样思考是人们长久以来的梦想,这个梦想与现代计算机的发展同步,理论上也是起始于几位数学家的构想与研究。1900年大卫·希尔伯特提出23个未解数学难题后,哥德尔的不完备性定理、冯·诺依曼的数字计算机构形、图灵的图灵机等等,都推动着计算技术的蓬勃发展。

1950年10月,艾伦·麦席森·图灵(Alan Mathison Turing)发表了一篇题为《计算机器与智能》的论文,首次提出机器具备思维的可能性。论文的开篇是一条明确的声明:“我准备探讨‘机器能思考吗’这个问题。”

图片

在论文中图灵设计了一个游戏来解释这个问题的含义:一位询问者将自己的问题写下来,发给处于另外一个房间中的一个人和一台机器,然后根据他们给出的答案确定哪个是真人。如果无法判断或者混淆了被考察的机器和人,则可认为被测试的机器具有某种程度的智慧。

这就是有名的“图灵测试”,图灵测试为人工智能给出了一个完全可操作的定义:如果一台机器输出的内容和人类大脑一致,那么我们就有理由相信这台机器具有“思考”的能力。换句话说,如果人无法区分是在跟人还是机器聊天,那么这个机器就实现了人的智能。

智能,本质上就是针对不同情景给出针对性的输出反应,说白了就是看情况做事。人工智能,就是搭建起一个根据不同的环境信息给出针对性的输出和回应的系统,这个输出可以是动作、语言,也可以是判断和预测。

part 02

达特茅斯会议

1956年:The Dartmouth Summer Research Project on Artificial Intelligence

1955 年初,约翰·麦卡锡(John MacCarthy)联系洛克菲勒基金会,请求资助在达特茅斯举办约10 名参与者的夏季研讨会。六月,他和当时在贝尔实验室的信息论创始人克劳德·艾尔伍德·香农(Claude Elwood Shannon)一起会见了生物和医学研究主任罗伯特·莫里森,讨论了这个想法和可能的资助。

1955年9月2日,麦卡锡、明马文·明斯基(Marvin Minsky)、纳撒尼尔·罗切斯特(Nathaniel _Rochester)_和香农正式提出该会议的计划,在计划中第一次使用了”人工智能(Artificial Intelligence)”一词。

  • 人工智能的第一次会议

1956年6月18日,一群数学家和计算机科学家汇聚到达特茅斯学院数学系所在大楼的顶层。在两个月左右的时间里,他们进行了一次长时间的头脑风暴会议。

有11 名数学家和计算机科学家参加了此次研讨会,他们当中有多人以后因为在人工智能领域的突出贡献被授予了图灵奖。

约翰·麦卡锡(John MacCarthy)

马文·明斯基(Marvin Minsky)

克劳德·艾尔伍德·香农(Claude Elwood Shannon)

纳撒尼尔·罗切斯特(NathanielRochester)

艾伦·纽厄尔(Allen Newell)

赫伯特·亚历山大·西蒙(Herbert Alexander Simon)

朱利安·毕格罗(Julian Bigelow)

奥利弗·塞尔弗里奇(Oliver Gordon Selfridge)

雷·所罗门诺夫(Ray Solomonoff)

亚瑟·李·塞谬尔(Arthur Lee Samuel)

彼得.米尔纳(Peter Milner)

图片

加上其他感兴趣的人士,据说与会人员共有47位左右,其中就包括研究博弈论并提出“纳什均衡”的诺贝尔经济奖得主约翰·纳什(John Nash Jr.)

研讨会涵盖了许多主题,包括计算机、自然语言处理、神经网络、计算理论、抽象和创造力等问题。研讨会发起了几个重要研究方向,包括符号方法、早期专家系统,以及演绎系统与归纳系统等。

通过8周左右的讨论,与会者们大致勾勒出了我们今天所知的人工智能图景。

part 03

人工智能的早期发展

1956年~2012年

  • 符号主义

早在50年代初期,美国计算机科学家和认知心理学家艾伦·纽厄尔(Allen Newell)和赫伯特·亚历山大·西蒙(Herbert Alexander Simon)共同提出“物理符号系统假说”(PSSH),主张智能系统通过物理符号操作来实现,成为人工智能符号主义学派的核心理论。

1955年末,他们开发了一个名为逻辑理论(LOGIC THEORIST)的程序,可以算是第一个AI程序。它将每个问题表示成一个“树”模型,选出最可能得到正确结论的那一个分枝,然后逐次求解问题。1956年,他们在达特茅斯会议上展示这个程序,首次自动生成数学定理证明,被视为人工智能诞生的标志之一。艾伦·纽厄尔和赫伯特·亚历山大·西蒙一同被授予了1975年度的图灵奖。

达特茅斯会议催生了AI的第一个研究者阵营:符号主义者(symbolists)。基于符号主义的专家系统在20世纪80年代达到了顶峰。符号主义者主张智能可以用符号的逻辑推理来模拟,企图用数学公式来描述人工智能。

比如:A表示阴天,B表示湿度>70%,T表示将要下雨;知识是一条逻辑规则:如果A和B是真的,则T就是真的。所谓智能,就是看到“阴天”和“湿度很大”,知道A和B是真的,那么利用这条知识规则推出T是真的,从而预测到可能将要下雨。

这些人类的推理和思考,都可以从这些符合和规则当中像算术一样计算出来。因此,符号主义相信,智能就是一套像这样处理符号和规则的计算系统。它把人类的知识和逻辑用“如果A那么B“这样的规则存储下来,然后不断进行符号推演就可以实现接近人类的智能。

这一理论在计算机代数、自然语言处理、语音识别等领域中得到广泛应用。

  • 专家系统

符号主义的思路最成功的典范就是曾经的“专家系统”。比如它咨询医学专家,什么样的病可能有什么用的症状,接着把这些规则全部记录下来,只要利用这些规则,就可以根据已有的信息给出诊断。这套系统一度在疾病诊断和金融咨询领域获得了很大的成功。

  • 机器学习

随着时间推移,专家系统逐渐暴露出一些致命的缺陷。首先,很多时候现实世界没有那么清晰的规则。比如即使询问人类专家,出现某个症状是不是得了某个病?或者股票走势长成这样应该是买还是卖?他们给出的回答往往也并不一致,而专家系统只能选择一个。

更要命的是,这套系统完全复制人类的经验,所以它的能力上限就是专家的水平,无法做到比人更好。而且从人类设计完成这套系统开始,它就永远是静态不变的水平,很难像人一样随着经验和时间的增长,水平不断提升。

从上世纪70年代开始,另一个人工智能的流派开始发扬光大。它不追求一开始就有一个完美的智能系统,但允许这个系统不断变化,通过不断的引导和学习,让它在某一个任务上表现得越来越好。这个流派的名称就叫“机器学习”

就像训狗,通过给机器以奖励或者惩罚的方式,让机器自主调整,不断学习,从而学会解决某一种任务的智能。这个任务可能是识别人脸,也可能是下围棋,或者是与人对话等等。

机器学习的强大之处在于,它不需要任何专家的专业知识来人为搭建内部的结构。它只需要两样东西:一个强大且有学习能力的黑箱,以及足够多的数据。

假设你想要一个能够识别车牌的智能系统,只需要准备一个具有“学习能力”的机器,然后收集很多车牌的照片,人工标注出每张照片里的车牌号码是什么,接下来只需要像训练狗一样,把一张张照片展示在机器面前,让它识别里面的车牌号是什么,如果识别对了就给它“奖励”,错了就给它“惩罚”,让机器不断地自我调整。当它见过的车牌照片越来越多之后,就能够神奇地做到正确识别照片中的车牌了。

  • 计算机视觉

1957年,康奈尔大学的罗森布拉特(Rosenblatt)造出了人类第一台有实际应用价值的感知机,这台感知机将图片的像素作为输入,通过算法调整参数,不断学习,最终能够做到判断出一张图片里是男人还是女人,或者是左箭头还是右箭头。虽然在今天看来这可能没什么,但在当时是非常了不起的成就。

对于人来说算两个非常大的数字的乘积非常困难,但对于计算机来说却是非常简单。但是对于理解图片的内容,计算机就远没有人类厉害。对于计算机来说,图片本质上就是一堆像素的数值,所以识别图片中的内容对计算机和数学本质上就是给你一大堆数字组成的矩阵,然后让它判断画面是什么。

对于人脸识别来说,人的长相千姿百态,各种五官光影角度的细微变化都会呈现出不同的图片,导致像素的具体数值出现剧烈的变化,而计算机需要通过纯粹的计算,算出来图片里是一个人,是男人还是女人,甚至是某一个特定的人,难度就可想而知。这个领域就叫做计算机视觉,

这么来看,人类的视觉和大脑是多么的不可思议!

在罗森布拉特发明感知机之后,纽约时报记者对感知机的先进性赞不绝口,报道说“这是一种可以走路、聊天、看、写、自我复制、有自我意识的电子计算机的雏形”,把它称为“电子大脑”。“电脑”这个名字最早也是从这个时候来的。文章当时非常乐观地估计 “再花上10万美金,一年之后就可以实现上述构想。那时感知机将能够认出不同的人,叫出他们的名字,并可以即时地将演讲翻译成另一种语言记录下来”。现在我们知道,这些事情直到最近几年才真正实现。

人类对于自己不了解的东西,很容易对于未来过分乐观。历史上,每当人工智能取得一点点微小的进步,人类就会开始赋予它无限能力的想象。从来如此。

  • 联结主义(connectionism)

前面讲到的车牌识别系统和罗森布拉特发明的感知机都具有机器学习能力。那么,怎么搭建有“学习能力”的机器呢?又该如何“奖励”和“惩罚”它呢?机器又是怎么像狗一样建立条件反射的呢?这三个问题分别对应机器学习的模型结构、损失函数和训练过程。

另一派实现人工智能的流派认为大自然已经给出了实现智能的标准答案,就是人类精妙的大脑。只需要通过仿生的方式模拟单个神经元的复杂功能以及神经元之间复杂的联结,就可以搭建出一个人工神经网络。这一派思想被称作联结主义。

比如,人类对于水果的认识,是根据它的外表属性来判断的。如果说一个水果“直径大约10cm,外皮是红色的,形状是个球形,气味香甜”,根据这些属性我们大概推测这是一个苹果。

我们人类对于苹果的认识,是依赖于它的概念属性组合而来的。在每个不同的概念属性上,不同的水果会有各自不同的特征。比如大小方面,西瓜是大的,而其它的水果是小的。所以在“尺寸大”这个特征上西瓜符合,其它的水果不符合,在计算机的世界里,我们用“1”表示符合,“0”表示不符合。这样就可以列出各种水果与不同属性之间的一张关系对应表。

图片

当某个水果的特征都和苹果的属性吻合时,机器就倾向于判断这是一个苹果。如此,我们就拥有了一个简单的识别水果的智能。

这是一种最简单的搭建黑盒的方式。比如我们要识别水果是不是苹果,那就将这个水果的所有特征,比如大小、颜色、气味等作为输入,分别考虑它的每个特征是否像一个苹果。具体来说,就是乘以一个系数,比如尺寸不大,颜色是红色,味道很甜,这些表明都符合苹果的特征,因此它们对于是苹果这个判断起到正向的促进作用,系统会给它乘以一个正数。而尺寸很大,味道酸等这些特征都表明它不大可能是苹果,系统会给它乘以一个负数。最后,将所有这些特征各自乘以它们对应的系数,加在一起,就可以得到一个水果的得分,这个得分越高越像苹果。我们再设置一个得分的阈值b,如果最后的得分高于b,就输出“是一个苹果”的判断,否则输出“不是一个苹果”。这个机器就具备了识别苹果的功能。

w1x1 + w2x2 + w3x3 + … + wnxn - b > 0 ?

图片

这种从输入数据中识别不同特征的模式,理解不同概念的过程,就叫模式识别。

通过调整这些联结的系数w1,w2,w3,…,wn,就可以表示不同的概念,就可以用来识别其它的水果。感知机就是这个原理,专业的说法都叫模型结构。

模型结构本身确定了它输出的函数形式,但与此同时它又没有完全确定整个函数,依然有一系列可以调节和设定的参数,比如这里的每个wi和b。我们只需要在设计模型的时候让它足够强大,任何你想要它实现的功能,本质上可以通过设定模套参数实现。

只要让这个模型根据训练数据不断调整自己的参数,不断向着越来越有用、符合人们需要的输出的模式变化,就可以让它最终拥有强大的智能。这就是联结主义的信念。

  • 人工智能的寒冬

大家通常以为,神经网络代表的联结主义从一开始就和符号主义水火不容。但其实像模式识别这种最早期的神经网络,它的设计在很大程度上是借鉴甚至是脱胎于符号主义的逻辑推理,其思路同样是组合不同的特征条件来进行推理,这里的每个神经元就像符号逻辑中的一个命题和字母一样。只不过它是用数值计算的方式来模拟逻辑的,而数值计算本身不局限于有限且明确的符号推理,因为在更广泛的领域,比如控制、环境感知、图像识别等领域具有更强大的潜力。

实际上这个数学模型的提出,比人工智能还要早。早在1943年的二战期间,Pitts和Mcculloch在生物物理学通报上共同发表了《神经活动中内在思想的逻辑演算》,提出了这套神经元的数学模型。

图片

联结主义刚开始提出的时候野心勃勃,而且实现了感知机这样了不起的成就。但联结主义也一度陷入寒冬。

最一开始的时候就有很多学者反对联结主义,认为这只是机械地模拟了生物的构造,而且神经元建模的也太过于简单。他们觉得联结主义是期待在一通乱联之后发生魔法。

1969年,马文·明斯基写了一本《感知机》的书,明斯基在书中指出感知机无法实现最简单的“异或”逻辑运算。明斯基在书里毫不客气地说“罗森布拉特的论文和感知机没有科学价值”。加上明斯基在当年获得了图灵奖,所以这本书的出版相当于将联结主义打入冷宫。

在当时图灵奖得主的带头唱衰下,“神经网络”的研究一度陷入了极度的寒冬,研究者纷纷转行。人工智能发展也因此陷入了长达二十年的寒冬。

图片

图片

人类又是这么容易悲观,一个小小的反例就能让很多人自暴自弃,放弃了充满潜力的研究方向。

  • 深度学习

当然,这期间依然有一批研究者在坚持,他们后来成为深度学习的奠基人。深度学习是机器学习的一种,而机器学习是实现人工智能的必经之路。深度学习的概念源于人工神经网络的研究。图灵机和诺贝尔奖双料得主辛顿在接受采访时说:“我最骄傲的是我当年坚持了神经网络的研究,尽管当时的人们都说这是垃圾,而且是整整坚持了40年。”

研究者通过嵌套感知机的方法解决了“异或”运算的难题,就是大名鼎鼎的多层感知机MLP。

图片

这些神经元层层叠叠就构成了人工神经网络,中间的每一个联结标志着两个神经元之间的联结强度,是一个可以调节的参数系数。科学家证明,只要这个神经网络的深度和宽度都足够大,那么理论上它可以拟合任何一种函数,表达任何一种智能所需要的输入到输出的对应关系。

辛顿说他坚持神经网络和深度学习的研究长达40年,并不是这个研究领域的研究没有进展,而是当时受到技术的限制,理论成果很难得到验证和应用。深度学习的人工神经网络在等待一个合适的时机…

深度学习需要满足三个要素:

01

算法

人工神经网络深度学习算法其实早在多年之前已经相当成熟。比如杰弗里·辛顿(Jeoffrey Hinton)与合作者早在1986年发表的两篇具有里程碑意义的论文推广了被称为“反向传播”的算法。此后的多年因为受限于计算能力和训练模型的数据,人工智能的算法研究一直处于一个不温不火的状态。过去的几十年,人工智能一直在等待一个合适的时机,直到GPU和ImageNet的出现。

02

算力硬件

人工神经网络无论是训练模型还是实际应用阶段都是需要大量的计算的。以常用的ChatGPT为例,ChatGPT是应用“统计型语言模型”实现的,它恢复的每一句话的每一个字都是根据之前的文字和具体的场景实时计算出来的。

基于GPT-3的ChatGPT每生成一个字的回复,大约需要1x1015次运算。如果使用笔记本来跑GPT,每生成一个字需要大半个小时的时间。GPT-5的参数超过18万亿,是GPT-3的1000倍,意味着会需要更多的计算量。据说ChatGPT的后台模型GPT-4单次训练的算力成本超过1亿美元,GPT-5会更贵。

03

大数据

人工智能模型的深度学习是基于海量数据的,没有足够的数据,机器学习无从谈起。我们还以ChatGPT为例,它的训练数据是TB级别的。我们熟悉的三国演义如果以纯文本存储下来大概也就不到2MB,TB级别的训练数据就相当于上亿本三国演义。对于图片和视频模型,需要的数据量就更大了。

深度学习之所以能够在最近几年取得巨大突破,除了诸如Hinton、Schmihuber、HopField等科学家们在算法方面的不断创新,还离不开以GPU为代表的计算硬件和以ImageNet为代表的大数据的发展。

part 04

GPU + CUDA

黄仁勋的NVIDIA(英伟达)

我们大家都知道CPU和GPU分别代表中央处理器和图形处理器。其实,最开始是没有GPU的,计算机所有的计算任务全部由CPU完成。但是当电脑屏幕里的画面越来越精美复杂,各种高清电影和逼真的游戏场景,CPU就开始忙不过来了。电脑画面是由成千上万个像素点构成的,而画面瞬息万变,每一个像素点在每一个瞬间应该呈现什么样的颜色和亮度,这些信息都需要实时计算出来,所以只要电脑画面稍微复杂一点,CPU光处理画面就干不了别的事情了,电脑就会开始卡。

1993年,华裔美国人黄仁勋跟两个朋友一起创办了NVIDIA英伟达公司,设计出一种叫GPU的芯片,把GPU芯片焊在一块板子上,配上高速内存和散热风扇和各种接口,一个图形加速器也就是我们说的显卡就造出来了。插在电脑上,GPU就可以接管图形计算,把CPU解放出来去干别的事情。

有人可能会问了,同样的活给CPU干就手忙脚乱,给GPT就可以,感觉GPU的计算能力一定比CPU更厉害。其实不然,CPU通常只有几个核,就好比几位大学教授,而GPU芯片里通常由成千上万个核,就好比一万名小学生。哪边的计算能力更强呢?这要看具体问题是什么,如果是一个复杂的逻辑推理问题,大学教授肯定更强,1万个名小学生根本算不出来。但如果是1万道小数算术题,肯定是1万名小学生算得更快,一人分一道题,一下就解决了。

图形计算就非常像是一万道小学算术题,虽然整个画面很复杂,但是每一个点都可以交给一个“小学生”负责“上色”(计算),最后拼起来就是一个完整的画面。英伟达增加在一次发布会上通俗解释过GPU的工作原理。

不光是图形计算,任何的计算任务,但凡是能拆解成很多个独立的小任务,这活就非常适合交给GPU来干。而且总的计算量越大,拆的越细,GPU的优势就越明显。

2004年,斯坦福大学的一个博士生Ian Buck研究出一个方法,用C语言编程命令GPU里的1万个计算核心按照自己的要求来干活。黄仁勋知道以后将这名学生找到英伟达,用了3年的时间在2007年做出来一个叫CUDA的平台。用这个CUDA平台,程序员就可以很简单地编程来让英伟达的GPU干一些比图形加速更通用的任务。CUDA平台还提供了很多算法库和工具可以协助程序员用GPU做各种各样的任务。

有了CUDA平台,英伟达公司一下就从一个显卡公司变成了一个做通用加速计算的公司,因为世界上能拆解的计算问题太多了。比如天气预报、药物筛选、加密货币领域的挖矿、自动驾驶的图形识别等等这些都非常适合GPU来处理,这促使英伟达公司迅速成长,技术更新也更加迅速。

当然很多人已经想到了,人工智能模型的处理任务更适合交给GPU来做,而这次则直接把英伟达推向市值第一。

反过来说,人工智能尤其是深度学习的人工神经网络之所以能在近几年得到迅速发展,也离不开英伟达GPU所提供的超强算力。

part 05

ImageNet

“AI教母”李飞飞

最近换一次引爆人工智能的是一位华裔女科学家李飞飞。李飞飞16岁时跟着家人从成都移民美国,在普林斯顿主修物理,对生物和计算机很感兴趣。2000年去加州理工学院深造,研究认知神经性和计算机视觉。李飞飞所在的加州理工学院的实验室有一个优良传统就是收集数据,实验室做过很多的数据集。

李飞飞毕业后回到普林斯顿,一次偶然的机会接触了语言学家Christiane Fellbaum,从Christiane那里她第一次听说了普林斯顿的WordNet数据集,并且知道Christiane正准备做一个ImageNet,给WordNet的每一个词找一张配图。李飞飞从Christiane那里获得了灵感并向她要到了ImageNet这个名称,开始建立自己的图片数据集。

李飞飞筹集资金并找了几个学生开始创建ImageNet。当时的李飞飞抱有这样的信念:“不知道ImageNet有啥用,但肯定有用”。她创建ImageNet,并在等待一个时机…

随后李飞飞的团队在flicker和Google上累计收集到了数十亿张图片,需要逐张人工标注。一开始他们花钱雇普林斯顿的学生来标注,但这么做太慢了,算下来以这个速度标注所有的图片需要19年的时间。

2007年初,又一次偶然的机会李飞飞得知亚马逊的Amazon Mechanical Turk(AMT)这个众包平台,可以面向全世界发布佣金任务。随后她借助AMT平台招募了167个国家的大约5万人,仅用了2年半的时间就标注了5200多物体的320万张图片。图片标注工作一直持续到2011年,ImageNet的规模最后达到了21000多类别、1400多万张图片,成为了当之无愧的巨无霸。

图片

尽管整个团队耗费了很大的财力和心血建立起了这么大的数据集,但是起初并没有引起太多的关注,即便他们想出了各种方法去做宣传。

又一次偶然的机会,和李飞飞一同参会的学者Alexander Berg问李飞飞听过VOC挑战赛吗,为啥不办一个类似的ImageNet挑战赛呢?李飞飞当即联系了VOC。从2010年开始,ImageNet挑战赛成为了VOC挑战赛的一部分,全称为“ImageNet大规模视觉识别挑战赛”。

2010年的首届比赛中,冠军的识别错误率是28.2%。

2011年冠军的错误率仅降低了2.4个点,为25.8%。

2012年的比赛,来自加拿大多伦多大学的队伍是杰弗里·辛顿(Jeoffrey Hinton)和他的学生Alex Krizhevsky和Ilya Sutskever。他们没有使用当时主流的特征提取加分类的方法,而是使用了深度学习算法(AlexNet),一举将错误率降低了9.4个点,以16.4%的错误率夺得冠军。最关键的是,他们仅用了2块英伟达GPU显卡却打败了Google用16,000个CPU训练的模型。

图片

比赛结果宣布后,Google、微软和百度争相邀请这三位加入,为此还展开了一场竞拍,最终Google以4400万美元胜出。2015年,Alex Krizhevsky加入OpenAI,以首席科学家的身份借用英伟达显卡做出来世界上第一个千亿参数的大模型GPT-3,才有了后面的ChatGPT。

因为这次比赛,ImageNet的知名度也大大提升,后面的几届比赛几乎全部团队都使用了深度学习算法。到了2017年,识别错误率已经降到2.3%,远远低于人类5%的水平,比赛也就没有再继续办下去了。但直到今天,ImageNet依然是视觉识别领域最常用的评测基准。

ImageNet和ImageNet挑战赛,助推了人工智能、尤其是人工神经网络深度学习算法的研究和推广,接下来的几年人工智能以前所未有的速度快速发展,同时也间接助推了英伟达GPU的再一次火爆。

part 06

AlphaGo/GPT/Deepseek

人工智能的爆发式发展

  • AlphaGo

AlphaGo是Google旗下DeepMind公司戴密斯·哈萨比斯领衔的团队开发的一款围棋人工智能程序,用到了多层神经网络的深度学习算法。

2016年3月,AlphaGo与围棋世界冠军、职业九段棋手李世石进行围棋人机大战,以4比1的总比分获胜;2016年末2017年初,该程序在中国棋类网站上以“大师”(Master)为注册账号与中日韩数十位围棋高手进行快棋对决,连续60局无一败绩;2017年5月,在中国乌镇围棋峰会上,它与排名世界第一的世界围棋冠军柯洁对战,以3比0的总比分获胜。围棋界公认AlphaGo的棋力已经超过人类职业围棋顶尖水平。

2017年5月27日,在柯洁与AlphaGo的人机大战之后,AlphaGo团队宣布将不再参加围棋比赛。2017年10月18日,DeepMind团队公布了最强版AlphaGo,代号AlphaGo Zero。

AlphaGo的初始版本结合了数百万人类围棋专家的棋谱,以及强化学习进行了自我训练。AlphaGo Zero的能力在此基础上有了质的提升,使用了新的强化学习方法,让自己变成了老师,它不再需要人类数据,从一开始就没有接触人类棋谱,研发团队只是让它随意地在棋盘上下棋,然后进行自我博弈。

AlphaGo的人机大战,很好地宣传了人工智能,大大促进了人工智能研究的热潮。它的出现象征着计算机技术已进入人工智能的新信息技术时代,其特征就是大数据、大计算、大决策,三位一体。

  • GPT

GPT(Generative Pre-trained Transformer)是一种先进的人工智能语言模型,它通过深度学习技术,特别是Transformer架构理解和生成自然语言文本。GPT通过在大量文本数据上的预训练,学习语言的模式和结构,使其能够预测和生成连贯、有意义的文本内容。GPT模型可以广泛应用于文本生成、对话系统、自动摘要等多种自然语言处理任务。

GPT模型的技术起源与自然语言处理和深度学习领域的进步紧密相关。2017年,Google推出的Transformer模型,通过自注意力机制和并行处理能力,为序列数据处理提供了新的解决方案,为GPT的诞生奠定了基础。

GPT大事件

2018年,OpenAI发布了GPT-1,这是第一个基于Transformer的无监督预训练语言模型。

2019年,GPT-2的发布将模型参数扩大到15亿,它在多任务学习方面取得了突破。

2020年,GPT-3的发布是GPT系列的一个重要里程碑,它拥有1750亿参数,是当时全球最大的NLP模型。

2023年3月,GPT-4的发布进一步扩展了模型的输入模态,从单一文本扩展到图文双模态,提升了模型在复杂任务中的处理能力。

2023年9月,GPT-4V发布,增强了模型的视觉能力,允许模型理解与分析图像输入。

2023年11月,GPT-4 Turbo发布,它在GPT-4的基础上进行了优化,提升了性能和效率。

2024年5月,GPT-4o发布,这是一个多模态大模型,支持文本、音频和图像的任意组合输入,并能生成文本、音频和图像的任意组合输出,展现了实时推理的能

2025年8月8日,GPT-5发布,在数学、编程、视觉感知和健康领域表现均大幅超越前代模型,展现了顶尖的性能。

  • ChatGPT

ChatGPT是OpenAI公司基于GPT系统大模型构建的一款聊天机器人程序,能够基于在预训练阶段所见的模式和统计规律生成回答,还能根据聊天的上下文进行互动,真正像人类一样来聊天交流。

ChatGPT大事件

2022年11月30日发布能够对话的GPT-3.5版本。

2022年11月30日发布能够对话的GPT-3.5版本。

2023年3月14日,OpenAI推出GPT-4;2023年5月、7月、8月、11月,2024年1月、5月、12月,OpenAI先后推出iOS版、安卓版、企业版、自定义版本、团队版、教育版ChatGPT应用。

2025年2月27日,OpenAI推出GPT-4.5。 3月,ChatGPT图像生成功能获得升级。4月,ChatGPT新增购物功能。6月,升级并免费开放ChatGPT记忆功能。6月28日消息,OpenAI已开始租用谷歌的张量处理单元(TPU),用于支持ChatGPT等项目的运行。

2025年8月8日,OpenAI推出更强大的GPT-5模型,适用于编码和写作。10月6日,宣布ChatGPT开始内置第三方应用程序,周活跃用户数已达8亿。

ChatGPT强大的自然语言处理能力和多模态转化能力使之可用于多个场景和领域。它可用来开发聊天机器人,编写和调试计算机程序,撰写邮件,进行媒体、文学相关领域的创作。ChatGPT还可以用作自动客服、语音识别、机器翻译、情感分析、信息检索等。

  • DeepSeek

DeepSeek成立于2023年7月17日,由知名量化资管巨头幻方量化创立,是一家创新型科技公司。长久以来该公司专注于开发先进的大语言模型(LLM)和相关技术,作为大厂外唯一一家储备万张A100芯片的公司,幻方量化为DeepSeek的技术研发提供了强大的硬件支持。

2024年1月5日,发布DeepSeek LLM,这是深度求索的第一个大模型。DeepSeek LLM包含670亿参数,从零开始在一个包含2万亿token的数据集上进行了训练,数据集涵盖中英文。

全部开源DeepSeek LLM 7B/67B Base和DeepSeek LLM 7B/67B Chat,供研究社区使用。DeepSeek LLM 67B Base在推理、编码、数学和中文理解等方面超越了Llama2 70B Base。DeepSeek LLM 67B Chat在编码和数学方面表现出色。

当然,DeepSeek精通中文,DeepSeek LLM 67B Chat在中文表现上超越了GPT-3.5。


如何学习AI大模型?

作为一名热心肠的互联网老兵,我决定把宝贵的AI知识分享给大家。 至于能学习到多少就看你的学习毅力和能力了 。我已将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

一、全套AGI大模型学习路线

AI大模型时代的学习之旅:从基础到前沿,掌握人工智能的核心技能!

img

二、640套AI大模型报告合集

这套包含640份报告的合集,涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师,还是对AI大模型感兴趣的爱好者,这套报告合集都将为您提供宝贵的信息和启示。

img

三、AI大模型经典PDF籍

随着人工智能技术的飞速发展,AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型,如GPT-3、BERT、XLNet等,以其强大的语言理解和生成能力,正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。

img

四、AI大模型商业化落地方案

img

作为普通人,入局大模型时代需要持续学习和实践,不断提高自己的技能和认知水平,同时也需要有责任感和伦理意识,为人工智能的健康发展贡献力量。

更多推荐