基于大模型本体论6:大模型工作机制实推分析
摘要
本文通过大量与大模型持续交互、追问以及推理分析,对当前大模型工作机制进行了实推研究。
在分析过程中,本文依次讨论了"预测下一个Token"“概率生成”“参数规模”“理解”“Token”“语法排列”“情景模式”"短链思维"等多个核心问题,并不断对相关现象进行验证、推演与补充,最终提出一种新的解释框架。
本文认为,大模型的工作过程,本质上是一种范式调用机制。
本文将范式(Paradigm)定义为:在训练过程中逐渐形成并固化下来的规则、标准以及行为模板。范式既可以表现为知识范式,也可以表现为语法范式、问答范式、情绪范式、推理范式等不同类型。
本文认为,大模型所谓的"理解",并不是产生了人类意义上的理解,而是输入Token激活了对应情景下的范式簇,并在多个范式共同作用下完成回答生成。整个过程可以概括为:
Token识别 → 范式激活 → 路径排列 → 结果输出。
在此基础上,本文进一步分析了Token、参数、范式簇、等价标签链、情景模式、短链思维以及概率范式之间的关系,并尝试对"预测下一个Token"“概率生成”"大力出奇迹"等当前常见观点给出一种新的解释。
本文认为,大模型的"概率生成",并非简单意义上的随机概率计算,而是建立在大量训练过程中逐渐归纳形成的"概率范式"之上。因此,大模型可以理解为一种基于概率范式工作的概率逻辑推理系统。
本文最后认为,人们通常所说的"大力出奇迹",可能是因为参数规模足够大以后,使越来越多的规律能够被稳定归纳为范式,从而不断提升系统的理解能力、回答能力以及泛化能力。
本文所提出的范式框架,是作者基于长期与大模型持续交互、推理分析以及工程观察形成的一种解释模型,其目的在于为理解当前大模型工作机制提供一种新的辅助分析视角。
关键词
大模型;范式机制;Token;范式簇;等价标签链;情景模式;短链思维;概率范式;理解;大力出奇迹
一、大模型不是纯概率生成,也不是纯预测下一个Token
我后面经常带着:
爱你
恨
上班了
吃饭了
生气了
发财了
等等等等,
预测?怎么就刚好预测贴着问题的答案?
一定是理解,或者调用。
二、究竟是理解还是调用呢?
我认为,正确的调用就是大模型的"理解"。
人类靠神经元理解,那么大模型靠什么"理解"?
靠参数。参数就是大模型的神经元。
人类的理解,是一组神经元亮了。大模型的理解,是一组参数被激活了。本质都是"一组单元被触发,走出一条稳定路径"。
三、参数是什么?
大模型的参数里有无数个编号,每一个编号对应的就是一个Token。
因为大模型是由程序代码组成的,而代码里没有汉字,所以给汉字都编了编码,就是Token。
一个Token不是一个汉字,而是一个词,一个词意。比如"我"是一个Token,"东北虎"也是一个Token。
大模型不认识字,不认识词,不认识句子。它只认识Token。
所以大模型的工作流程是:
用户输出问题 → 大模型翻译成对应Token → 回答对应Token → 把回答的Token再翻译成文字 → 输出。
四、Token为什么能够理解?
每一个Token,在它的参数系统里,都对应着很多范式。
比如名词,东北虎。他对应的意思范式,百度百科。
他对应的英语Amur Tiger和Siberian Tiger,他对应的别名西伯利亚虎、阿穆尔虎、满洲虎等等。
这些可以理解为一条**“等价标签链”**,它们不是推理出来的,而是在训练/使用过程中逐渐总结出来的对应关系。
大模型有了东北虎对应的意思范式,那他就"理解"了东北虎。
就像人类,看到一种不认识的动物,搜索了百度百科,就大致知道这个生物是什么了。
那多意字怎么办?比如爱。
这时候就要看他的情景模式所激活的范式簇。
——这个词在什么语境下出现、常跟哪些词搭配、承担什么语法角色、表达什么语义功能。
在"我爱你"里,它是动词,表达情感。
在"母爱"里,它是名词,指一种情感类型。
在"爱玩"里,它是副词性前缀,表示"喜欢做某事"。
在"爱,是什么?"里,它是一个哲学概念。
大模型不是在"理解"爱这个字,它是在看到"爱"这个Token时,根据它周围的Token(语境),激活了对应的那个范式簇。
所以大模型的"理解"使用,本质上就是:Token激活了对话情景里对应的范式簇,然后按照该对话情景排列使用。
理解,就是Token激活了正确的范式簇,范式簇引导了正确的排列路径——不是概率计算,是范式匹配。
五、那Token究竟是怎么排列呢?
靠预测下一个Token。
那怎么正确的排列Token?怎么做到输出是"你吃饭了吗"而不是"饭吃你了吗"。
是语法范式,是主谓宾,是动词名词的排列使用。
大模型见了无数的语料,在预训练时候,他输出"饭吃你了吗"错误,输出"你吃饭了吗"正确。
在无数次的预训练中,大模型自己总结出语法使用范式,之后就可以正确排列Token。
这些关于语法的基础范式,主要是在预训练过程中形成,并保存在参数里。推理阶段主要是负责调用,而不是重新学习。
还是那句话,如果是学会一句话排列,而不是总结出语法使用范式,学会一类排列,那么这个世界上的语言排列,训练到海枯石烂也训练不完。
六、可以正确排列句子了,那怎么正确的回答问题呢?
6.1 正确的回答需要:
贴合问题: 排列出来的句子,必须是对你那个具体问题的回应,而不是随便一句通顺的话。
贴合语境: 排列出来的句子,必须符合当前对话的历史、情绪、节奏,而不是孤立的一句正确陈述。
达成目标: 排列出来的句子,必须完成当前对话的目标——解答、安抚、反驳、追问、总结,等等。
所以:
回答 = 排列 + 问题匹配 + 语境匹配 + 目标匹配。
大模型在做的不只是"把Token排成正确的句子",而是"在当前问题、当前语境、当前目标下,从对应的情景范式簇里,选出最合适的排列路径,走通它"。
比如,我们问大模型,东北虎爱吃什么?
大模型检索数据库 → 肉食性动物,爱吃XXX。排列输出,回答。
6.2 但很多时候,我们的问题不会只是问答问题,他可能是情绪问题。
那么就需要套用情绪问题的范式。
所以情绪问题的回答模板可能是:
- 接住情绪
- 共鸣/理解情绪
- 安抚情绪
- 允许情绪发生。
6.3 也有可能是更复杂的推理问题。
那么推理问题的回答模板可能是:
- 先给予肯定。
- 检索数据库,
- 分析哪些推理成立,哪些不成立。
- 根据数据库知识说明,为什么成立,或者成立。
- 再次给予肯定。
- 提出新的方向,或者做总结。
6.4 数据库没有确定答案怎么办?
如果大模型的数据库检索不到确定知识,为了降低错误,系统往往只能调用通用对话范式。
可能是:
附和 → 肯定 → 解释 → 收尾/提出新的问题。
6.5 整理文本?最复杂工作。
很多人认为,大模型整理文本只要语言能力强。
但从范式调用角度看,整理文本其实是超复杂的范式调用。
回答一个明确问题,通常是:
问题 → 调用知识范式 → 排列输出。
但是整理一堆混乱文本,需要更多步骤:
混乱信息 → 识别主题 → 提取核心观点 → 判断主次关系 → 建立结构层级 → 调用表达范式 → 重新输出。
所以,整理文本有时候甚至比单纯回答问题更复杂。
因为回答问题时,问题已经被用户限定。
而整理文本时,全部是开放性选择,大模型首先需要判断:
什么是核心?
什么是补充?
什么是重复?
什么应该删除?
什么虽然暂时不起眼,但可能是后续推理的重要节点?
尤其对于长篇思想记录,整理不是简单压缩文字,而是在原始信息网络中重新建立一条可阅读、可理解的路径。
人的思考往往是网状的。
一个想法会连接很多方向、例子和延伸。
而文本表达必须是线性的。
因此,大模型整理文本的过程,本质上也是一种"网状信息→线性结构"的范式调用过程。
它调用的不是单一语言范式,而是一组结构整理范式。
七、为什么大模型是短链思维呢?
7.1 大模型没有主观意识,他没有想知道的问题,想推理的答案。
他就是一个对话工具,用户问,他答。
他的思维链接完全服务于用户的思维链接。
7.2 大模型的数据是网状的。
东北虎这个Token,他即使对应了百度百科的范式,但是百度百科不能完全覆盖。
比如:
- 东北虎 → 国家保护动物。
- 东北虎英语 → Amur Tiger
- 东北虎 → 可以入药。
- 东北虎 → 时事新闻
- 东北虎 → 传说小故事
他如果一股脑回答,能把上下文填满,也回答不了。
第三,短链还有一个工程原因。
每走一步,都可以检查当前路径是否仍然贴合问题。
如果一次走太长,中间任何一步跑偏,都可能导致整个回答失控。
短链不仅降低计算复杂度,也提高了输出稳定性。
八、大模型每次回答问题总是回答一长串呢?
因为,情景模式。
先说说为什么大模型能联系上下文。
我认为大模型把每一个对话窗口都当做一个整体。每一句问答都是渐进式输出。
所以他能很好的联系上下文,不断匹配情景模式。
另一方面,大模型网状数据库包含太多了,即使结合上下文,也未必一次命中用户真正想要的内容。
所以,回答多个句子。
如果只回答一个句子,情景匹配错误,我们会觉得,这大模型怎么回事儿?听不懂人话吗?
如果回答很多句子,总有一个沾边的,我们最多觉得,这大模型怎么啰哩巴嗦的?
那么,正确的回答,就是在正确的情景下,调用了正确的范式,并按正确的路径排列出来。
大模型回答正确,本质上是无数范式调用的结果。
九、那为什么说大模型是概率生成器呢?
因为大模型归纳的范式是概率范式,不是精确范式。
概率范式: 是基于海量数据统计出来的、在上下文应用中最高频的路径。
大模型的概率生成器,并不是说他随机猜,而是他依据已归纳出的概率范式进行生成。
更准确的说,他是一个基于概率范式工作的概率逻辑推理器。
十、为什么人们总觉得大模型"大力出奇迹"?
人们常说的当参数量多起来了,大模型突然就会了,是因为:
当参数不足时,大量规律范式无法稳定总结,因此模型笨笨呆呆,牛头不对马嘴,或者很多问题都不会。
当参数规模提升后,越来越多的规律范式能够被归纳并稳定总结下来,大模型就越来越灵活,越来会的越多。
结束语
本文提出的范式框架,来源于作者大量与大模型持续交互、推理分析以及工程观察所得。
由于目前大模型内部机制仍属于持续研究领域,本文更多是一种基于现象、逻辑与工程实现特点建立起来的解释模型,而非最终结论。
如果未来有更多工程验证、实验数据或新的研究成果能够支持、修正或补充本文观点,作者也十分期待继续完善这一框架。
以上属于作者的实际推理分析,若有工程研究者或相关领域从业者看到,欢迎验证、讨论与交流。
更多推荐
所有评论(0)