这些大模型基础概念,你真的懂了吗
什么是LLM
LLM 是 Large Language Model 的缩写,中文通常译为大语言模型,是人工智能领域中基于深度学习、专门处理和生成人类语言的一类基础模型,也是当前生成式人工智能(AIGC)的核心技术底座之一。
一、核心定义与本质
大语言模型通过在海量的文本数据(书籍、网页、文章、对话等)上进行训练,学习人类语言的语法、语义、逻辑、知识关联以及语言的使用习惯,能够理解输入的语言内容,并生成符合人类语言习惯的输出。它本质上是一种自回归模型(主流架构如 Transformer),核心能力是对语言序列进行建模和预测。
二、关键特征
-
1.
规模庞大区别于传统小语言模型,LLM 拥有海量的参数(从数亿到数千亿甚至上万亿参数级别),同时训练数据的规模和多样性也极大,这是其具备强大通用能力的基础。
-
2.
通用能力强不局限于单一任务,经过预训练和微调后,可适配多种自然语言处理(NLP)任务,比如文本生成、翻译、摘要、问答、对话、代码编写、情感分析等。
-
3.
上下文理解能力能够处理长文本上下文,理解上下文之间的逻辑关系,从而生成更连贯、更贴合语境的内容。
-
4.
生成式特性不仅能理解语言,还能自主生成自然流畅、逻辑通顺的文本,这是其区别于传统分类、提取式 NLP 模型的核心特点。
三、典型架构与技术基础
目前主流的 LLM 均以Transformer架构(2017 年提出)为核心,结合自监督学习、预训练 - 微调(Pre-train & Fine-tune)范式构建。训练过程分为两个阶段:
-
1.
预训练阶段:在海量无标注文本上训练,学习通用的语言知识和世界知识;
-
2.
微调 / 对齐阶段:在特定任务数据或人类反馈数据上优化,提升模型的实用性、安全性和对齐性(如 RLHF,基于人类反馈的强化学习)。
四、代表性模型
-
1.
闭源模型:OpenAI 的 GPT 系列(GPT-3、GPT-4 等)、Google 的 PaLM/Gemini 系列、Anthropic 的 Claude 系列等;
-
2.
开源模型:Meta 的 LLaMA 系列、百度的文心一言(ERNIE)、阿里的通义千问、清华大学 / 智源研究院的 GLM 系列、百川智能的 Baichuan 系列等。
五、典型应用场景
-
1.
生成式 AI 应用:智能对话机器人、写作辅助、文案创作、代码生成与解释;
-
2.
信息处理:文本摘要、多语言翻译、文档检索与问答;
-
3.
行业落地:教育(智能辅导、作业批改)、客服(智能问答机器人)、金融(研报分析、风险识别)、医疗(病历整理、医学问答)等。
六、核心局限
-
1.
幻觉问题:可能生成不符合事实的虚假信息,缺乏对知识真实性的绝对保证;
-
2.
上下文长度限制:虽然不断突破,但处理超长文本时仍存在性能衰减;
-
3.
偏见与安全风险:训练数据中的偏见会被模型继承,存在生成有害内容的风险;
-
4.
推理能力有限:复杂逻辑推理、数学计算等任务仍易出错,需要结合工具或专门优化。
在大语言模型(LLM)的语境中,Prompt(中文常译为提示词、指令)是指用户向模型输入的文本内容,是引导模型生成符合预期结果的核心媒介。简单来说,你对LLM说的每一句话、提出的每一个问题、给出的每一个要求,都是Prompt。
什么是Prompt
一、核心作用
Prompt是用户与LLM交互的桥梁,模型会根据Prompt的内容、格式、意图,结合自身训练的知识和能力,生成对应的响应。它决定了模型的输出方向、风格、内容范围,甚至是任务的执行方式。
二、Prompt的基本类型
-
1.
基础指令型 最简洁的Prompt,直接提出需求或问题,适用于简单任务。 示例:
帮我写一段介绍杭州西湖的文案 -
2.
上下文型 包含背景信息、场景描述的Prompt,适合需要特定语境的任务。 示例:
我是一名小学老师,需要给三年级学生写一段关于春天的简短科普文案,语言要生动易懂 -
3.
角色设定型 为模型指定角色,让输出符合该角色的风格和认知,是对话类应用的常用形式。 示例:
你是一位资深的美食博主,现在推荐3道适合家庭聚餐的家常菜,并说明做法 -
4.
格式要求型 明确指定输出的格式(列表、表格、段落、代码等),规范输出形式。 示例:
用表格形式对比Python和Java两种编程语言的核心特点,包含适用场景、学习难度、执行效率三个维度
三、优秀Prompt的设计原则
-
1.
清晰明确 避免模糊、歧义的表述,让模型能精准理解你的需求。例如不说“写一篇好文章”,而说“写一篇800字的职场工作总结,突出业绩成果”。
-
2.
信息完整 提供必要的背景、约束条件(字数、受众、风格、用途等),减少模型的猜测空间。
-
3.
结构清晰 对于复杂任务,可拆分指令、分点说明,提升模型的理解效率和输出质量。
-
4.
引导性强 可以通过示例、关键词引导模型的输出方向,比如“用幽默的语气”“采用学术化风格”。
四、进阶技巧:Prompt Engineering(提示词工程)
这是专门研究如何设计、优化Prompt以提升LLM输出效果的领域,也是当前AI应用开发的重要技能。常见的进阶Prompt设计方法包括:
-
•
少样本学习(Few-shot Learning):在Prompt中提供1-几个示例,让模型模仿示例的格式和风格生成内容。 示例:
请模仿以下例子写一句话:例子1:阳光是温暖的画笔,描绘着大地的生机。例子2:清风是温柔的信使,传递着春天的问候。仿写: -
•
思维链(Chain-of-Thought, CoT):对于复杂推理任务,要求模型分步思考、逐步推导,提升推理准确性。 示例:
请一步步计算:一个商店进了100个苹果,卖出30个后又进货50个,现在有多少个苹果? -
•
指令微调与对齐:结合RLHF等技术,优化Prompt与模型的对齐效果,让输出更符合人类预期。
五、常见应用场景
-
1.
日常交互:聊天对话、问题解答、创意写作(文案、诗歌、故事);
-
2.
专业创作:代码编写、论文大纲、演讲稿、商业计划书;
-
3.
信息处理:文本翻译、摘要总结、情感分析、信息提取;
-
4.
辅助学习:知识点讲解、习题解答、语言学习练习;
-
5.
工具调用:结合插件/工具,让模型根据Prompt执行搜索、计算、数据分析等操作。
什么是上下文
结合大语言模型(LLM)和提示词(Prompt)的场景,上下文(Context) 指的是模型在处理当前请求时,能够参考和利用的历史对话内容、背景信息、前置条件等文本信息。简单来说,就是模型理解当前指令所依赖的“语境”和“背景”。
一、核心作用
上下文是LLM实现连贯交互、精准理解需求的关键:
-
1.
维持对话连贯性:在多轮对话中,模型通过上下文记住之前的对话内容,不会孤立地理解当前问题。例如你先问“什么是大语言模型”,再问“它的局限性有哪些”,模型会结合第一个问题的上下文,精准理解你指的是大语言模型的局限。
-
2.
补充背景信息:用户可以在Prompt中主动提供上下文(如任务背景、特定规则、参考资料),让模型的输出更贴合需求。例如写文案时,指定目标人群、使用场景,这些都属于上下文。
-
3.
约束输出范围:上下文可以明确限定模型的回答边界,避免生成无关内容。
二、上下文的两种核心形式
1. 对话上下文(多轮交互场景)
指历史对话记录,是LLM在聊天机器人、对话助手等场景中自动获取的上下文。
-
•
示例: 你:推荐3本适合新手的编程书 模型:推荐了《Python编程:从入门到实践》等3本书 你:帮我总结其中一本的核心知识点 模型:会结合上一轮的上下文,针对你提到的某本书总结知识点,而非泛泛而谈。
2. 自定义上下文(单轮/多轮交互场景)
用户在当前Prompt中主动输入的背景信息、参考资料、约束条件等,是人为构建的上下文,常用于提升任务精准度。
-
•
示例: 上下文:我是一名电商运营,产品是无线蓝牙耳机,主打长续航、高性价比,面向学生群体。 指令:帮我写一段适合小红书的产品推广文案,风格活泼。 模型会基于你提供的产品、人群、平台等上下文,生成符合要求的文案。
三、上下文的关键限制:上下文窗口(Context Window)
LLM的上下文能力受限于上下文窗口大小,这是模型能够处理的最大文本长度(包含输入的Prompt和历史上下文)。
-
1.
不同模型的窗口大小差异极大:从几千个token(GPT-3.5)到几十万甚至上百万个token(如GPT-4 Turbo、Claude 3 Opus)。
-
2.
超出窗口限制的内容会被截断,模型无法参考,可能导致输出偏离预期。
-
3.
token是文本的基本单位(1个中文汉字≈1个token,1个英文单词≈1-2个token)。
四、上下文的应用场景
-
1.
多轮对话:客服机器人、智能助手需要记住用户的历史问题和需求;
-
2.
长文本处理:让模型总结、分析长篇文档(论文、报告),文档内容就是上下文;
-
3.
定制化任务:通过提供行业规则、产品信息、个人偏好等上下文,让模型输出个性化内容;
-
4.
代码开发:提供代码片段、项目需求作为上下文,让模型辅助编写、修改代码。
五、补充:上下文与提示词的关系
提示词(Prompt)是用户的核心指令,而上下文是指令的重要组成部分。一个优秀的Prompt通常会结合清晰的指令+完整的上下文,二者结合才能让LLM生成高质量的输出。例如: ❌ 模糊Prompt:写一篇推广文案 ✅ 优质Prompt:【上下文】面向大学生的平价防晒霜,主打清爽不油腻、高防晒指数;【指令】写一段300字的朋友圈推广文案,语气亲切自然。
什么是TOKEN
在大语言模型(LLM)的语境中,Token(中文常译作令牌、词元)是模型处理文本的基本单位,也是衡量模型输入输出长度、计算成本和上下文窗口的核心指标。简单来说,模型不会直接把一个完整的句子、单词当作处理单元,而是将文本拆分成一个个token后再进行计算。
一、Token的拆分规则
Token的拆分没有固定的“一个单词=一个token”,而是基于子词、字符、符号等粒度进行拆分,不同模型(如GPT、Claude、LLaMA)有各自的分词算法(主流为BPE、SentencePiece等),核心原则是平衡效率与语义完整性:
-
1.
常见英文场景:短单词通常是一个token(如
cat、run);长单词会被拆分(如unhappiness可能拆分为un+happiness);标点、空格也会作为独立token。 -
2.
中文场景:中文没有明确的单词分隔符,分词粒度更细,通常一个汉字、一个常用词组、一个标点都可能对应一个token,整体来看,中文文本的token数量会比英文(同等语义)更多。
-
3.
特殊场景:代码、数字、特殊符号(如
#、@)会被单独拆分或组合为token。
举个例子: 英文句子I love learning about LLMs! 会被拆分为:I、 love、 learning、 about、 LL、Ms、!(共7个token,空格会被整合进token); 中文句子大语言模型很强大 会被拆分为:大、语言、模型、很、强大(约5个token,具体依分词算法而定)。
二、Token与上下文窗口、成本的关系
这是token最核心的应用场景,直接决定了模型的使用限制和计费规则:
-
1.
上下文窗口(Context Window) 模型能处理的总token数量(输入的Prompt + 输出的回答 + 历史上下文)有上限,这个上限就是上下文窗口。比如GPT-3.5的上下文窗口约4k(4096个token),GPT-4 Turbo可达128k,Claude 3 Opus支持200k+。超出上限的内容会被截断,模型无法处理。
-
2.
计费标准 绝大多数商用LLM(如OpenAI的API)会按token计费,输入token和输出token的单价不同。例如,输入1000个token和输出500个token,会分别按对应单价计算费用。
-
3.
长度计算 我们无法直接通过字符数精准计算token数,只能估算:1个英文单词≈1.3个token,1000个英文token≈750个英文单词;中文场景下,100个中文汉字≈150个左右token(具体因文本复杂度而异)。
三、Token的核心作用
-
1.
量化文本长度:统一衡量输入输出的规模,是模型处理能力的核心指标;
-
2.
控制成本与资源消耗:token越多,模型计算量越大,时间成本和经济成本越高;
-
3.
限制上下文容量:上下文窗口的token上限,决定了模型能记住的对话历史、能处理的文档长度;
-
4.
模型训练与推理基础:模型的所有语言建模、预测任务,本质上都是对token序列的概率计算。
四、补充:Token计数工具
如果你需要精准统计文本的token数量,各大模型服务商都提供了官方tokenizer工具,也有第三方的在线token计数器(适配GPT、LLaMA等主流模型),这是实际使用LLM时的常用工具。
更多推荐


所有评论(0)