logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

<六>ChatGPT到底叫什么?——语言模型

前几篇一直叫它"函数"、"文字接龙",它到底有没有正经名字?这篇正式引入"语言模型"。先从生活里的"模型"说起——天气预报、导航地图都是用简化数学描述复杂现实,语言模型也一样,只不过它描述的是"下一个词出现的概率"P(w|C)。接着学了概率分布如何编码三种语言规律:语法约束、语义连贯、上下文相关。还有个冷知识——香农在 1948 年就提出了语言模型的思想,比 ChatGPT 早了 75 年。然后探

文章图片
#语言模型#人工智能#AI
<六>ChatGPT到底叫什么?——语言模型

前几篇一直叫它"函数"、"文字接龙",它到底有没有正经名字?这篇正式引入"语言模型"。先从生活里的"模型"说起——天气预报、导航地图都是用简化数学描述复杂现实,语言模型也一样,只不过它描述的是"下一个词出现的概率"P(w|C)。接着学了概率分布如何编码三种语言规律:语法约束、语义连贯、上下文相关。还有个冷知识——香农在 1948 年就提出了语言模型的思想,比 ChatGPT 早了 75 年。然后探

文章图片
#语言模型#人工智能#AI
<六>ChatGPT到底叫什么?——语言模型

前几篇一直叫它"函数"、"文字接龙",它到底有没有正经名字?这篇正式引入"语言模型"。先从生活里的"模型"说起——天气预报、导航地图都是用简化数学描述复杂现实,语言模型也一样,只不过它描述的是"下一个词出现的概率"P(w|C)。接着学了概率分布如何编码三种语言规律:语法约束、语义连贯、上下文相关。还有个冷知识——香农在 1948 年就提出了语言模型的思想,比 ChatGPT 早了 75 年。然后探

文章图片
#语言模型#人工智能#AI
<六>ChatGPT到底叫什么?——语言模型

前几篇一直叫它"函数"、"文字接龙",它到底有没有正经名字?这篇正式引入"语言模型"。先从生活里的"模型"说起——天气预报、导航地图都是用简化数学描述复杂现实,语言模型也一样,只不过它描述的是"下一个词出现的概率"P(w|C)。接着学了概率分布如何编码三种语言规律:语法约束、语义连贯、上下文相关。还有个冷知识——香农在 1948 年就提出了语言模型的思想,比 ChatGPT 早了 75 年。然后探

文章图片
#语言模型#人工智能#AI
Token与幻觉——为什么ChatGPT聊着聊着就飘了

为什么 ChatGPT 聊着聊着就"飘"了?这篇从"预测下一个词"这个看似简单的任务说起——多义词、指代歧义、隐藏逻辑、话里有话,这四个场景说明模型为了猜准下一个词,被迫学会了语法、语义、常识、逻辑等几乎所有语言能力。接着学了自回归机制(一个词一个词往外蹦,像滚雪球),以及它天生的毛病——误差累积,一步偏了后面全歪。然后从日常 API 账单上常见的 token 切入,搞清楚了 token 不是"词

文章图片
#AI
Token与幻觉——为什么ChatGPT聊着聊着就飘了

为什么 ChatGPT 聊着聊着就"飘"了?这篇从"预测下一个词"这个看似简单的任务说起——多义词、指代歧义、隐藏逻辑、话里有话,这四个场景说明模型为了猜准下一个词,被迫学会了语法、语义、常识、逻辑等几乎所有语言能力。接着学了自回归机制(一个词一个词往外蹦,像滚雪球),以及它天生的毛病——误差累积,一步偏了后面全歪。然后从日常 API 账单上常见的 token 切入,搞清楚了 token 不是"词

文章图片
#AI
拆开来看——ChatGPT是一个字一个字往外蹦的

ChatGPT生成回答的核心机制是自回归预测:它并非一次性构思完整回答,而是像人类聊天般逐字生成。每次预测时,模型会将当前问题与已生成文本作为整体上下文,通过96层Transformer网络处理,从约20万个候选词中计算概率分布(类似输入法联想但规模更大),通常选择概率最高的词接续。整个过程经历文本向量化、深度语义分析、候选词打分和概率归一化四个步骤。这种机制使其具备灵活应对能力,但也可能导致回答

文章图片
#AI
拆开来看——ChatGPT是一个字一个字往外蹦的

ChatGPT生成回答的核心机制是自回归预测:它并非一次性构思完整回答,而是像人类聊天般逐字生成。每次预测时,模型会将当前问题与已生成文本作为整体上下文,通过96层Transformer网络处理,从约20万个候选词中计算概率分布(类似输入法联想但规模更大),通常选择概率最高的词接续。整个过程经历文本向量化、深度语义分析、候选词打分和概率归一化四个步骤。这种机制使其具备灵活应对能力,但也可能导致回答

文章图片
#AI
参数的演化与黑箱之谜——大模型到底学会了什么

摘要:ChatGPT的核心在于1750亿参数的函数通过海量训练数据学习语言规律而非死记硬背。训练过程中参数逐渐调整,最终形成抽象的知识关联(如动物与食物的关系),使模型具备泛化能力。然而这些知识分散存储于参数组合中,单个参数功能不可解释,形成"黑箱"效应。模型训练完成后参数即固定,使用时不会继续学习。参数量并非越大越好,需平衡成本与性能。当前AI可解释性研究面临挑战,与人脑类似

文章图片
#人工智能#DeepSeek#AI
参数的演化与黑箱之谜——大模型到底学会了什么

摘要:ChatGPT的核心在于1750亿参数的函数通过海量训练数据学习语言规律而非死记硬背。训练过程中参数逐渐调整,最终形成抽象的知识关联(如动物与食物的关系),使模型具备泛化能力。然而这些知识分散存储于参数组合中,单个参数功能不可解释,形成"黑箱"效应。模型训练完成后参数即固定,使用时不会继续学习。参数量并非越大越好,需平衡成本与性能。当前AI可解释性研究面临挑战,与人脑类似

文章图片
#人工智能#DeepSeek#AI
    共 86 条
  • 1
  • 2
  • 3
  • 9
  • 请选择