
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
前几篇一直叫它"函数"、"文字接龙",它到底有没有正经名字?这篇正式引入"语言模型"。先从生活里的"模型"说起——天气预报、导航地图都是用简化数学描述复杂现实,语言模型也一样,只不过它描述的是"下一个词出现的概率"P(w|C)。接着学了概率分布如何编码三种语言规律:语法约束、语义连贯、上下文相关。还有个冷知识——香农在 1948 年就提出了语言模型的思想,比 ChatGPT 早了 75 年。然后探

前几篇一直叫它"函数"、"文字接龙",它到底有没有正经名字?这篇正式引入"语言模型"。先从生活里的"模型"说起——天气预报、导航地图都是用简化数学描述复杂现实,语言模型也一样,只不过它描述的是"下一个词出现的概率"P(w|C)。接着学了概率分布如何编码三种语言规律:语法约束、语义连贯、上下文相关。还有个冷知识——香农在 1948 年就提出了语言模型的思想,比 ChatGPT 早了 75 年。然后探

前几篇一直叫它"函数"、"文字接龙",它到底有没有正经名字?这篇正式引入"语言模型"。先从生活里的"模型"说起——天气预报、导航地图都是用简化数学描述复杂现实,语言模型也一样,只不过它描述的是"下一个词出现的概率"P(w|C)。接着学了概率分布如何编码三种语言规律:语法约束、语义连贯、上下文相关。还有个冷知识——香农在 1948 年就提出了语言模型的思想,比 ChatGPT 早了 75 年。然后探

前几篇一直叫它"函数"、"文字接龙",它到底有没有正经名字?这篇正式引入"语言模型"。先从生活里的"模型"说起——天气预报、导航地图都是用简化数学描述复杂现实,语言模型也一样,只不过它描述的是"下一个词出现的概率"P(w|C)。接着学了概率分布如何编码三种语言规律:语法约束、语义连贯、上下文相关。还有个冷知识——香农在 1948 年就提出了语言模型的思想,比 ChatGPT 早了 75 年。然后探

为什么 ChatGPT 聊着聊着就"飘"了?这篇从"预测下一个词"这个看似简单的任务说起——多义词、指代歧义、隐藏逻辑、话里有话,这四个场景说明模型为了猜准下一个词,被迫学会了语法、语义、常识、逻辑等几乎所有语言能力。接着学了自回归机制(一个词一个词往外蹦,像滚雪球),以及它天生的毛病——误差累积,一步偏了后面全歪。然后从日常 API 账单上常见的 token 切入,搞清楚了 token 不是"词

为什么 ChatGPT 聊着聊着就"飘"了?这篇从"预测下一个词"这个看似简单的任务说起——多义词、指代歧义、隐藏逻辑、话里有话,这四个场景说明模型为了猜准下一个词,被迫学会了语法、语义、常识、逻辑等几乎所有语言能力。接着学了自回归机制(一个词一个词往外蹦,像滚雪球),以及它天生的毛病——误差累积,一步偏了后面全歪。然后从日常 API 账单上常见的 token 切入,搞清楚了 token 不是"词

ChatGPT生成回答的核心机制是自回归预测:它并非一次性构思完整回答,而是像人类聊天般逐字生成。每次预测时,模型会将当前问题与已生成文本作为整体上下文,通过96层Transformer网络处理,从约20万个候选词中计算概率分布(类似输入法联想但规模更大),通常选择概率最高的词接续。整个过程经历文本向量化、深度语义分析、候选词打分和概率归一化四个步骤。这种机制使其具备灵活应对能力,但也可能导致回答

ChatGPT生成回答的核心机制是自回归预测:它并非一次性构思完整回答,而是像人类聊天般逐字生成。每次预测时,模型会将当前问题与已生成文本作为整体上下文,通过96层Transformer网络处理,从约20万个候选词中计算概率分布(类似输入法联想但规模更大),通常选择概率最高的词接续。整个过程经历文本向量化、深度语义分析、候选词打分和概率归一化四个步骤。这种机制使其具备灵活应对能力,但也可能导致回答

摘要:ChatGPT的核心在于1750亿参数的函数通过海量训练数据学习语言规律而非死记硬背。训练过程中参数逐渐调整,最终形成抽象的知识关联(如动物与食物的关系),使模型具备泛化能力。然而这些知识分散存储于参数组合中,单个参数功能不可解释,形成"黑箱"效应。模型训练完成后参数即固定,使用时不会继续学习。参数量并非越大越好,需平衡成本与性能。当前AI可解释性研究面临挑战,与人脑类似

摘要:ChatGPT的核心在于1750亿参数的函数通过海量训练数据学习语言规律而非死记硬背。训练过程中参数逐渐调整,最终形成抽象的知识关联(如动物与食物的关系),使模型具备泛化能力。然而这些知识分散存储于参数组合中,单个参数功能不可解释,形成"黑箱"效应。模型训练完成后参数即固定,使用时不会继续学习。参数量并非越大越好,需平衡成本与性能。当前AI可解释性研究面临挑战,与人脑类似








