十年十篇 • 数启新程:《大数据与计算模型》
编者按:十年深耕,十篇精粹。数据已成为核心生产要素,《大数据》见证技术突破与政策赋能的双向奔赴。本次甄选十篇文章,涵盖高被引理论成果、政策落地研究与社会前沿热点,既是学科发展的缩影,更是产业实践的指南。即日起逐篇推送,邀您回溯十年积淀,共探数据要素市场化、数智融合的未来新篇!敬请关注。
大数据与计算模型
摘 要 当前,人工智能持续升温,大语言模型吸引了众多人士的关注,并在全球范围内掀起了一股热潮。人工智能的成功本质上不是大算力“出奇迹”,而是改变了计算模型。首先,肯定了数据对于人工智能的基础性作用,指出合成数据将是未来数据的主要来源。然后,回顾了计算模型的发展历程,重点介绍了神经网络模型与图灵模型的历史性竞争;指出了大模型的重要标志是机器涌现智能,强调大模型的本质是“压缩”;分析了大模型产生“幻觉”的原因。最后,呼吁科技界在智能化科研中要重视大科学模型。
关键词 人工智能; 大数据; 计算模型; 神经网络模型; 合成数据; 涌现

引用格式:
李国杰. 大数据与计算模型[J]. 大数据, 2024, 10(1): 9-16.
Li G J. Big data and computing models[J]. Big Data Research, 2024, 10(1): 9-16.
0
引言
大数据热度下降,大模型和AI for Science发展迅速,科技界对AI技术路线存在争议。主要争议点包括:数据与模型的中心地位、大语言模型的通用性、模拟人类智能与机器智能的发展、连接主义与符号主义AI的结合、机器理解能力、神经元与图灵计算模型的差异。人工智能仍处于早期阶段,面临未知和挑战。现有技术路径有局限性,应避免过早锁定技术路线,鼓励多元化发展。本文旨在探讨大数据和计算模型相关争议话题,引发讨论。
1
数据的基础作用和发展趋势
数据在科学和工程实践中扮演着基础角色,通过大量具有代表性的样本可以找到接近真实情况的模型。人工智能的突破依赖于大数据、大模型和大算力,其中数据和算力是大模型发挥作用的前提。当前,算力受到重视,但数据在实际应用中更为关键。数据智能是人工智能的主流,没有数据就没有智能。提高算力并非万能,对于复杂问题的求解规模扩大没有实际意义。客观世界具有不确定性,数据是消除不确定性的关键。例如,华为的盘古和DeepMind的Graph Cast通过理解海量气候数据进行预测,超过传统数值天气预报的精度和速度。在人工智能发展中,数据和模型的重要性一直存在争议。吴恩达认为未来十年将转向以数据为中心,而杨立昆则认为需要学习具备常识推理与预测能力的世界模型。技术发展方向的选择不仅是学术判断,也代表了信仰。大语言模型的发展引发了对通用人工智能的讨论,但大模型可能只是阶段性成果,并非实现通用人工智能的最佳道路。合成数据将成为未来数据的主要来源,尤其在自动驾驶等领域,合成数据可以弥补真实数据的不足。合成数据依赖真实数据创建,不会完全取代初始数据,但可以验证或扩展已知规律。算力网的发展应考虑合成数据的地理分布合理性和任务分配,减轻数据传送压力。
2
关于计算模型的历史回顾和思考
人工智能的突破源于计算模型的改变。计算模型具有多样性,包括图灵机、卷积神经网络等,它们在可计算性和计算复杂性分析中发挥着基础作用。通用计算模型在理论上具有等价性,但在特定问题上的效率差异显著,如量子计算在大数分解上的优势。机器学习模型,作为数据驱动的递归计算,与图灵计算模型在递归形式上有所不同,其迭代结果随输入数据变化。
人工智能发展中符号主义与连接主义之间存在竞争关系,即图灵机模型与神经网络模型之间的历史性竞争。图灵机模型自1936年提出以来一直是计算机和人工智能发展的基础,而神经网络模型则在可计算性上与之等价。冯·诺伊曼在其报告中提到了神经网络模型的重要性,而图灵也提出了不同于图灵机的“无组织机器”模型,预示了现代人工智能的基本原理。
大模型的重要标志是机器涌现智能,特别是在AlphaFold2和GPT-4中展现的智能“涌现”。尽管学术界对大模型是否具有涌现和理解能力尚无共识,但大模型已经展现出一定的理解和创造能力。冯·诺伊曼提出的复杂度阈值概念,以及大模型可能接近这一阈值的观点,为理解大模型的智能提供了新的视角。
大模型的本质是“压缩”,即数据压缩。大模型通过压缩输入数据的知识,以权重矩阵形式存储,实现了高效的数据压缩,在搜索空间中发挥关键作用。此外,大模型的“幻觉”问题,指出LLM的主要功能是预测而非搜索正确答案,其生成的内容具有不确定性,这是复杂系统本质特征的体现。LLM的泛化能力和“幻觉”是共存的,我们需要在这种环境下发展人工智能。
3
基于大科学模型的智能化科研
“大模型”在国内流行,但国外更倾向于使用大语言模型(LLM)。DeepMind团队采用LLM和强化学习方法,机器本身也产生数据。作者建议发展大科学模型(LSM),科研领域需模型正确性和精度,以及识别能力不足的“自知之明”。神经网络模型基于经验主义,存在或然性,难以保证高精度。中科院计算所发明二进制推测图(BSD)模型,保证精度并具有“涌现”功能。智能化科研(AI4R)涉及AI for science(AI4S)和AI for technology(AI4T),采用统计学方法处理大数据。传统科研求解函数y=f(x),智能化科研多解决“反问题”。大模型作为通用智能应用程序,虽有时失败,但足以处理现实世界中的复杂问题。
作者简介

李国杰,男,中国工程院院士,第三世界科学院院士,中国科学院计算技术研究所首席科学家,中国计算机学会名誉理事长。主要从事计算机体系结构、并行算法、人工智能、大数据,计算机网络、信息技术发展战略等方面的研究,发表科学论文150多篇,出版了三本《创新求索录》文集,长期致力于发展曙光高性能计算机产业和CPU等核心技术的自主可控。


戳“阅读原文”,了解更多
相
关
阅
读
十年十篇 • 数启新程:《基于多模态大模型的具身智能体研究进展与展望》
联系我们:
Tel:010-53859533
010-53879208
E-mail:bdr@bjxintong.com.cn
http://www.j-bigdataresearch.com.cn/
转载、合作:010-53879255
大数据期刊
《大数据(Big Data Research,BDR)》双月刊是由中华人民共和国工业和信息化部主管,人民邮电出版社主办,中国计算机学会大数据专家委员会学术指导,北京信通传媒有限责任公司出版的期刊,已成功入选中国科技核心期刊、中国计算机学会会刊、中国计算机学会推荐中文科技期刊,以及信息通信领域高质量科技期刊分级目录、计算领域高质量科技期刊分级目录,并多次被评为国家哲学社会科学文献中心学术期刊数据库“综合性人文社会科学”学科最受欢迎期刊。

关注《大数据》期刊微信公众号,获取更多内容
更多推荐
所有评论(0)