什么是LLM

LLM 是 Large Language Model 的缩写,中文通常译为大语言模型,是人工智能领域中基于深度学习、专门处理和生成人类语言的一类基础模型,也是当前生成式人工智能(AIGC)的核心技术底座之一。

一、核心定义与本质

大语言模型通过在海量的文本数据(书籍、网页、文章、对话等)上进行训练,学习人类语言的语法、语义、逻辑、知识关联以及语言的使用习惯,能够理解输入的语言内容,并生成符合人类语言习惯的输出。它本质上是一种自回归模型(主流架构如 Transformer),核心能力是对语言序列进行建模和预测。

二、关键特征

  1. 1.

    规模庞大区别于传统小语言模型,LLM 拥有海量的参数(从数亿到数千亿甚至上万亿参数级别),同时训练数据的规模和多样性也极大,这是其具备强大通用能力的基础。

  2. 2.

    通用能力强不局限于单一任务,经过预训练和微调后,可适配多种自然语言处理(NLP)任务,比如文本生成、翻译、摘要、问答、对话、代码编写、情感分析等。

  3. 3.

    上下文理解能力能够处理长文本上下文,理解上下文之间的逻辑关系,从而生成更连贯、更贴合语境的内容。

  4. 4.

    生成式特性不仅能理解语言,还能自主生成自然流畅、逻辑通顺的文本,这是其区别于传统分类、提取式 NLP 模型的核心特点。

三、典型架构与技术基础

目前主流的 LLM 均以Transformer架构(2017 年提出)为核心,结合自监督学习、预训练 - 微调(Pre-train & Fine-tune)范式构建。训练过程分为两个阶段:

  1. 1.

    预训练阶段:在海量无标注文本上训练,学习通用的语言知识和世界知识;

  2. 2.

    微调 / 对齐阶段:在特定任务数据或人类反馈数据上优化,提升模型的实用性、安全性和对齐性(如 RLHF,基于人类反馈的强化学习)。

四、代表性模型

  1. 1.

    闭源模型:OpenAI 的 GPT 系列(GPT-3、GPT-4 等)、Google 的 PaLM/Gemini 系列、Anthropic 的 Claude 系列等;

  2. 2.

    开源模型:Meta 的 LLaMA 系列、百度的文心一言(ERNIE)、阿里的通义千问、清华大学 / 智源研究院的 GLM 系列、百川智能的 Baichuan 系列等。

五、典型应用场景

  1. 1.

    生成式 AI 应用:智能对话机器人、写作辅助、文案创作、代码生成与解释;

  2. 2.

    信息处理:文本摘要、多语言翻译、文档检索与问答;

  3. 3.

    行业落地:教育(智能辅导、作业批改)、客服(智能问答机器人)、金融(研报分析、风险识别)、医疗(病历整理、医学问答)等。

六、核心局限

  1. 1.

    幻觉问题:可能生成不符合事实的虚假信息,缺乏对知识真实性的绝对保证;

  2. 2.

    上下文长度限制:虽然不断突破,但处理超长文本时仍存在性能衰减;

  3. 3.

    偏见与安全风险:训练数据中的偏见会被模型继承,存在生成有害内容的风险;

  4. 4.

    推理能力有限:复杂逻辑推理、数学计算等任务仍易出错,需要结合工具或专门优化。

在大语言模型(LLM)的语境中,Prompt(中文常译为提示词指令)是指用户向模型输入的文本内容,是引导模型生成符合预期结果的核心媒介。简单来说,你对LLM说的每一句话、提出的每一个问题、给出的每一个要求,都是Prompt。

什么是Prompt

一、核心作用

Prompt是用户与LLM交互的桥梁,模型会根据Prompt的内容、格式、意图,结合自身训练的知识和能力,生成对应的响应。它决定了模型的输出方向、风格、内容范围,甚至是任务的执行方式。

二、Prompt的基本类型

  1. 1.

    基础指令型 最简洁的Prompt,直接提出需求或问题,适用于简单任务。 示例:帮我写一段介绍杭州西湖的文案

  2. 2.

    上下文型 包含背景信息、场景描述的Prompt,适合需要特定语境的任务。 示例:我是一名小学老师,需要给三年级学生写一段关于春天的简短科普文案,语言要生动易懂

  3. 3.

    角色设定型 为模型指定角色,让输出符合该角色的风格和认知,是对话类应用的常用形式。 示例:你是一位资深的美食博主,现在推荐3道适合家庭聚餐的家常菜,并说明做法

  4. 4.

    格式要求型 明确指定输出的格式(列表、表格、段落、代码等),规范输出形式。 示例:用表格形式对比Python和Java两种编程语言的核心特点,包含适用场景、学习难度、执行效率三个维度

三、优秀Prompt的设计原则

  1. 1.

    清晰明确 避免模糊、歧义的表述,让模型能精准理解你的需求。例如不说“写一篇好文章”,而说“写一篇800字的职场工作总结,突出业绩成果”。

  2. 2.

    信息完整 提供必要的背景、约束条件(字数、受众、风格、用途等),减少模型的猜测空间。

  3. 3.

    结构清晰 对于复杂任务,可拆分指令、分点说明,提升模型的理解效率和输出质量。

  4. 4.

    引导性强 可以通过示例、关键词引导模型的输出方向,比如“用幽默的语气”“采用学术化风格”。

四、进阶技巧:Prompt Engineering(提示词工程)

这是专门研究如何设计、优化Prompt以提升LLM输出效果的领域,也是当前AI应用开发的重要技能。常见的进阶Prompt设计方法包括:

  • 少样本学习(Few-shot Learning):在Prompt中提供1-几个示例,让模型模仿示例的格式和风格生成内容。 示例:请模仿以下例子写一句话:例子1:阳光是温暖的画笔,描绘着大地的生机。例子2:清风是温柔的信使,传递着春天的问候。仿写:

  • 思维链(Chain-of-Thought, CoT):对于复杂推理任务,要求模型分步思考、逐步推导,提升推理准确性。 示例:请一步步计算:一个商店进了100个苹果,卖出30个后又进货50个,现在有多少个苹果?

  • 指令微调与对齐:结合RLHF等技术,优化Prompt与模型的对齐效果,让输出更符合人类预期。

五、常见应用场景

  1. 1.

    日常交互:聊天对话、问题解答、创意写作(文案、诗歌、故事);

  2. 2.

    专业创作:代码编写、论文大纲、演讲稿、商业计划书;

  3. 3.

    信息处理:文本翻译、摘要总结、情感分析、信息提取;

  4. 4.

    辅助学习:知识点讲解、习题解答、语言学习练习;

  5. 5.

    工具调用:结合插件/工具,让模型根据Prompt执行搜索、计算、数据分析等操作。

什么是上下文

结合大语言模型(LLM)和提示词(Prompt)的场景,上下文(Context) 指的是模型在处理当前请求时,能够参考和利用的历史对话内容、背景信息、前置条件等文本信息。简单来说,就是模型理解当前指令所依赖的“语境”和“背景”。


一、核心作用

上下文是LLM实现连贯交互、精准理解需求的关键:

  1. 1.

    维持对话连贯性:在多轮对话中,模型通过上下文记住之前的对话内容,不会孤立地理解当前问题。例如你先问“什么是大语言模型”,再问“它的局限性有哪些”,模型会结合第一个问题的上下文,精准理解你指的是大语言模型的局限。

  2. 2.

    补充背景信息:用户可以在Prompt中主动提供上下文(如任务背景、特定规则、参考资料),让模型的输出更贴合需求。例如写文案时,指定目标人群、使用场景,这些都属于上下文。

  3. 3.

    约束输出范围:上下文可以明确限定模型的回答边界,避免生成无关内容。


二、上下文的两种核心形式

1. 对话上下文(多轮交互场景)

历史对话记录,是LLM在聊天机器人、对话助手等场景中自动获取的上下文。

  • 示例: 你:推荐3本适合新手的编程书 模型:推荐了《Python编程:从入门到实践》等3本书 你:帮我总结其中一本的核心知识点 模型:会结合上一轮的上下文,针对你提到的某本书总结知识点,而非泛泛而谈。

2. 自定义上下文(单轮/多轮交互场景)

用户在当前Prompt中主动输入的背景信息、参考资料、约束条件等,是人为构建的上下文,常用于提升任务精准度。

  • 示例: 上下文:我是一名电商运营,产品是无线蓝牙耳机,主打长续航、高性价比,面向学生群体。 指令:帮我写一段适合小红书的产品推广文案,风格活泼。 模型会基于你提供的产品、人群、平台等上下文,生成符合要求的文案。


三、上下文的关键限制:上下文窗口(Context Window)

LLM的上下文能力受限于上下文窗口大小,这是模型能够处理的最大文本长度(包含输入的Prompt和历史上下文)。

  1. 1.

    不同模型的窗口大小差异极大:从几千个token(GPT-3.5)到几十万甚至上百万个token(如GPT-4 Turbo、Claude 3 Opus)。

  2. 2.

    超出窗口限制的内容会被截断,模型无法参考,可能导致输出偏离预期。

  3. 3.

    token是文本的基本单位(1个中文汉字≈1个token,1个英文单词≈1-2个token)。


四、上下文的应用场景

  1. 1.

    多轮对话:客服机器人、智能助手需要记住用户的历史问题和需求;

  2. 2.

    长文本处理:让模型总结、分析长篇文档(论文、报告),文档内容就是上下文;

  3. 3.

    定制化任务:通过提供行业规则、产品信息、个人偏好等上下文,让模型输出个性化内容;

  4. 4.

    代码开发:提供代码片段、项目需求作为上下文,让模型辅助编写、修改代码。


五、补充:上下文与提示词的关系

提示词(Prompt)是用户的核心指令,而上下文是指令的重要组成部分。一个优秀的Prompt通常会结合清晰的指令+完整的上下文,二者结合才能让LLM生成高质量的输出。例如: ❌ 模糊Prompt:写一篇推广文案 ✅ 优质Prompt:【上下文】面向大学生的平价防晒霜,主打清爽不油腻、高防晒指数;【指令】写一段300字的朋友圈推广文案,语气亲切自然。

什么是TOKEN

在大语言模型(LLM)的语境中,Token(中文常译作令牌词元)是模型处理文本的基本单位,也是衡量模型输入输出长度、计算成本和上下文窗口的核心指标。简单来说,模型不会直接把一个完整的句子、单词当作处理单元,而是将文本拆分成一个个token后再进行计算。

一、Token的拆分规则

Token的拆分没有固定的“一个单词=一个token”,而是基于子词、字符、符号等粒度进行拆分,不同模型(如GPT、Claude、LLaMA)有各自的分词算法(主流为BPE、SentencePiece等),核心原则是平衡效率与语义完整性:

  1. 1.

    常见英文场景:短单词通常是一个token(如catrun);长单词会被拆分(如unhappiness可能拆分为un+happiness);标点、空格也会作为独立token。

  2. 2.

    中文场景:中文没有明确的单词分隔符,分词粒度更细,通常一个汉字、一个常用词组、一个标点都可能对应一个token,整体来看,中文文本的token数量会比英文(同等语义)更多。

  3. 3.

    特殊场景:代码、数字、特殊符号(如#@)会被单独拆分或组合为token。

举个例子: 英文句子I love learning about LLMs! 会被拆分为:I love learning about LLMs!(共7个token,空格会被整合进token); 中文句子大语言模型很强大 会被拆分为:语言模型强大(约5个token,具体依分词算法而定)。

二、Token与上下文窗口、成本的关系

这是token最核心的应用场景,直接决定了模型的使用限制和计费规则:

  1. 1.

    上下文窗口(Context Window) 模型能处理的总token数量(输入的Prompt + 输出的回答 + 历史上下文)有上限,这个上限就是上下文窗口。比如GPT-3.5的上下文窗口约4k(4096个token),GPT-4 Turbo可达128k,Claude 3 Opus支持200k+。超出上限的内容会被截断,模型无法处理。

  2. 2.

    计费标准 绝大多数商用LLM(如OpenAI的API)会按token计费,输入token和输出token的单价不同。例如,输入1000个token和输出500个token,会分别按对应单价计算费用。

  3. 3.

    长度计算 我们无法直接通过字符数精准计算token数,只能估算:1个英文单词≈1.3个token,1000个英文token≈750个英文单词;中文场景下,100个中文汉字≈150个左右token(具体因文本复杂度而异)。

三、Token的核心作用

  1. 1.

    量化文本长度:统一衡量输入输出的规模,是模型处理能力的核心指标;

  2. 2.

    控制成本与资源消耗:token越多,模型计算量越大,时间成本和经济成本越高;

  3. 3.

    限制上下文容量:上下文窗口的token上限,决定了模型能记住的对话历史、能处理的文档长度;

  4. 4.

    模型训练与推理基础:模型的所有语言建模、预测任务,本质上都是对token序列的概率计算。

四、补充:Token计数工具

如果你需要精准统计文本的token数量,各大模型服务商都提供了官方tokenizer工具,也有第三方的在线token计数器(适配GPT、LLaMA等主流模型),这是实际使用LLM时的常用工具。

更多推荐