在此之前,我们可以先去下载【点击进入】

一、认识模型

模型是一个从数据中学习规律的 “数学函数” 或 “程序”。旨在处理和生成信息的算法,通常模仿人类的认知功能。通过从大型数据集中学习模式和洞察,这些模型可以进行预测、生成文本、图像或其他输出,从而增强各个行业的各种应用。

可以简单理解为模型是一个 "超级加工厂",这个工厂是经过特殊训练的,训练师给它看了海量的例子 (数据),并告诉它该怎么做。通过看这些例子,它自己摸索出了一套规则,学会了完成某个 "特定任务"。模型就是一套学到的 "规则" 或者 "模式",它能根据你给的东西,产生你想要的东西。

最简单的比喻:给模型很多组数据:

模型的任务就是找出输入和输出之间的规律(比如:输出是中间那个数)。学成之后:当我们再输入[8, 9, 10] 时,它能根据学到的规律预测出输出应该是 9。

模型专用小模型(传统机器学习 / 轻量深度学习)的关键特点在于:

特定任务:一个模型通常只擅长一件事。比如:

  • 一个模型专门识别图片里是不是猫。
  • 一个模型专门预测明天会不会下雨。
  • 一个模型专门判断一条评论是好评还是差评。

需要 “标注数据”:训练这种模型需要大量 “标准答案”。(比如:成千上万张已经标注好 “是猫” 或 “不是猫” 的图片)。

参数较少:参数是模型从数据中学到的 “知识要点” 或 “内部规则”(比如:上述示例中的规则仅是 “中间数”)。参数较少说明模型的复杂度和能力相对有限。

这类专用机器学习模型的核心实现原理,本质上是基于统计概率与数学函数拟合,通过从大量标注数据中学习输入与输出之间的关联规律,构建一个可计算的数学映射关系。模型并不具备理解与推理能力,而是将任务转化为概率计算问题:在训练阶段,它通过优化算法不断调整内部参数,学习不同特征对结果的影响权重,从而拟合出条件概率分布,即给定输入数据时,对应某一类输出结果的发生概率;在预测阶段,模型将新的输入代入已学习好的数学函数中,计算各类结果的概率值,最终输出概率最高的结论。其内部参数本质是一组用于加权计算的数值,代表从数据中提炼的统计规则,参数数量决定了模型的拟合能力与复杂度,整个过程完全依赖数学运算与统计规律,而非逻辑思考,这也是它通常只能高效完成单一特定任务、必须依靠标注数据才能训练的根本原因。


二、认识大语言模型

1. 什么是大语言模型?

大语言模型(Large Language Model, LLM)是指基于大规模神经网络(参数规模通常达数十亿至万亿级别,例如 GPT-3 包含 1750 亿参数),通过自监督半监督方式,对海量文本进行训练的语言模型。

名词解释:

神经网络:一个极其高效的 “团队工作流程” 或 “条件反射链”。例如教一个小朋友识别猫:

不会只给一条规则(比如 “有胡子就是猫”),因为兔子也有胡子。我们会让他看很多猫的图片,他大脑里的视觉神经会协同工作:

  • 有的神经元负责识别 “尖耳朵”,
  • 有的负责识别 “胡须”,
  • 有的负责识别 “毛茸茸的尾巴”。

这些神经元一层层地传递和组合信息,最后大脑综合判断:“这是猫!”,神经网络就是模仿人脑的这种工作方式。

它由大量虚拟的 “神经元”(也就是参数)和连接组成。

每个神经元都像一个小处理单元,负责处理一点点信息。无数个神经元分成很多层,前一层的输出作为后一层的输入。

通过海量数据的训练,这个网络会自己调整每个 “神经元” 的重要性(即参数的值),最终形成一个非常复杂的 “判断流水线”。比如,一个识别猫的神经网络,某些参数可能专门负责识别猫的眼睛,另一些参数专门负责识别猫的轮廓。简单说:神经网络就是一个通过数据训练出来的、由大量参数组成的复杂决策系统。

自监督学习:“无师自通,超级大师”

例如我们想学会一门外语,但没有老师出题和批改。怎么办?

我们可以拿一本该语言的小说,自己玩 “完形填空”:随机盖住一个词,然后根据上下文猜测这个词是什么。

一开始猜得乱七八糟。EG:【我是一 ? 程序员】【名?个?只?】

但不断地重复这个过程,看了成千上万本书后,对这个语言的语法、词汇搭配、上下文逻辑了如指掌。现在不仅能轻松猜对被盖住的词,甚至能自己写出流畅的文章,自监督学习就是这个过程。

模型面对海量的、没有标签的原始文本(比如互联网上的所有文章、网页)。

它自己给自己创造任务:把一句话中间的某个词遮住,然后尝试根据前后的词来预测这个被遮住的词。通过亿万次这样的练习,模型就深刻地学会了语言的规律。它不需要人类手动去给每句话标注 “这是主语”、“这是谓语”。简单说:自监督就是让模型从数据本身找规律,自己给自己当老师。

半监督学习:“师父领进门,修行在个人”

比如你想学做菜,师傅先教你几道招牌菜(比如宫保鸡丁、宫保鸡丁)—— 这相当于给了你一些 “有标注的数据”(菜谱和成品)。

然后,师傅让你去品尝天下各种美食,自己研究其中的门道 —— 这相当于接触海量的 “无标注数据”(各种未知的食材和味道)。

然后,你再去尝试做一百道美食,自己研究其中的门道 —— 这相当于接触海量的 “无标注数据”(各种神秘的食材和味道)。

你结合师傅教的基本功和自己尝遍天下美食的经验,最终不仅能完美复刻招牌菜,还能创新出新的菜式。这就是 “半监督”。学习和少量标签的对大语言模型 “入门”,掌握一些基本训练方式,然后再让它去海量的无标签数据中自我学习和提升。这对于大语言模型来说也是一种常用的训练方式。简单说:半监督就是 “少量指导 + 大量自学” 的结合模式。

语言模型:一个 “超级自动补全” 或 “语言预测器”

例如你在用手机打字,输入 “今天天气真”,输入法会自动提示 “好”、“不错”、“冷” 等。这个输入法之所以能提示,就是因为它内部有一个小型的 “语言模型”,它根据你输入的前文,计算下一个词最可能是什么。语言模型的核心任务就是预测下一个词。一个强大的语言模型,能够根据一段话,预测出最合理、最通顺的下一个词是什么,这样一个个词接下去,就能生成一整段话、一篇文章。简单说:语言模型就是一个计算 “接下来可能说什么” 的模型。

现在,我们再回头看那段描述,就一目了然了。翻译成大白话就是:大语言模型是一个:

  • 用 “超级团队工作流程”(大规模神经网络)搭建的,拥有数十亿甚至上万亿个 “脑细胞”(参数)的 “超级自动补全” 系统(语言模型);
  • 数学的 “超级自动补全” 系统(语言模型)搭建的,(自监督学习 或者 “少量老师指导 + 海量自学”(半监督学习)... 已观 海量少儿少工 (自监督学习),或者 “少量老师指导 + 海量自学”(半监督学习)... 从互联网上所有的文本数据中学会了语言的规律。

因此,它具有以下几个核心特点:

  • 规模巨大:它的 “脑细胞”(参数)特别多(通常达到数十亿甚至万亿级别),所以思考问题更复杂、更全面,就像一支百万大军和一个小分队的区别。
  • 通用性强不是为单一任务训练的。因为它通过 “阅读” 所有的文本,学会的是整个语言底层的规律,通用性极强,短一句话,训练不只一个任务,所以它 “涌现” 出了各种能力,能应用到聊天、翻译、写代码等各种任务上。这种 “涌现” 能力,就像孩子通过大量阅读后,突然能写出意想不到的优美句子一样。
  • 数据高效:任务使用户直接从海量无标注的原始文本中学习。它不依赖人工一张张地给图片标注 “这是猫”,而是直接从原始文本中自学,效率极高,规模可以做得非常大。
  • 交互方式简单:用户用 “自然语言” 与它对话,对它说你给出指令(Prompt),它就能听懂并执行。比如,你说 “写一段关于春天的诗”,它就能给你写出来。

2. 主流的大语言模型

  • GPT-5 (OpenAI):支持 400k 背景信息长度,128k 最大输出标记,在多轮复杂推理、创意写作中表现突出
  • DeepSeek R1 (深度求索):开源,专注于逻辑推理与数学求解,支持 128K 长上下文和多语言 (20 + 语言),在科技领域表现突出
  • Qwen2.5-72B-Instruct (阿里巴巴):通义千问开源模型家族重要成员,擅长代码生成结构化数据 (如 JSON) 处理角色扮演对话等,尤其适合企业级复杂任务,支持包括中文英文法语等 29 种语言
  • Gemini 2.5 Pro (Google):多模态融合标杆,支持图像 / 代码 / 文本混合输入,适合跨模态任务 (如图文生成、技术文档解析)

其他参考:Huggingface LLM 性能排行榜:https://huggingface.co/spaces/ArtificialAnalysis/LLM-Performance-Leaderboard

发展历程参考:https://segmentfault.com/a/119000046532208


3. LLM 的能力包括哪些?

大语言模型【LLM】,对不少人来说已变得耳熟能详,从大型科技公司到初创企业,都纷纷投身于这场技术变革。AI 大模型不仅仅是技术圈的热门话题,它也正日新月异的速度融入我们的日常生活,改变着我们获取信息、处理工作、甚至进行创作的方式。

我们将大语言模型的能力归纳为四点,这不仅仅是技术指标,更是它改变世界的核心利器。

更精确来说:

  • 大模型(广义)泛指参数巨大、通用能力很强的深度学习模型,可以是语言、图像、语音、多模态等。

  • 大语言模型 LLM(狭义)专门指处理语言文本的大模型,也就是你现在正在对话的这种。

3.1 语言大师:理解与创造的革命

想象一下,你是否发生过以下类似问题:

  • 对学生:你是否为论文的开头绞尽脑汁?
  • 对职场人:一封礼貌又坚决的投诉邮件怎么写?

LLM 可以干什么?对于:

论文的开头:告诉大模型你的主题和观点,它能为你生成几个不同风格的引言段落。例如:"写一篇关于《基于深度学习的晶粒度智能评级方法》的大学生论文开头供我参考。"

投诉邮件:把情况告诉它,它即刻生成,你稍作修改就能发送。例如:"帮我写一封礼貌又坚决的投诉邮件,事情的经过是:xxx"

我们发现,它真正 "读懂" 了人类语言的千变万化,并能进行高质量创作。这不是简单的关键词匹配,而是理解了上下文、情感甚至潜台词。


3.2 知识巨人:拥有 "全互联网" 的记忆

我们可以问它:"用物理学原理解释为什么抽陀螺总能四脚着地?"。它不仅能回答,还能类比。

我们可以让它:"对比一下古希腊哲学和春秋战国百家争鸣的异同"。它能为我们提供清晰的思路。

可以看出,大模型是一个被压缩的、可对话的 "互联网知识库"。它通过学习海量数据,将知识内在关联,形成了一个立体的 "知识网络",而不仅仅是存储。


3.3 逻辑与代码巫师:从思维到实现的跨越

一个复杂的功能,对程序员来说,只需用中文描述:"写一个 Python 函数,能自动抓取某个网页的最新标题并保存到 Excel 里。",代码瞬间生成。

我们可以把复杂的数学题丢给它,如 "微分方程:3y'' + 2y' + 2y = e^(-x) 的特解 y* 的形式?",我们不仅能给出答案,还能一步步展示解题过程,成为你的 "私人家教"。

可以看出,大模型不仅能处理语言,还能处理严格的逻辑和编程语言。这证明了它的能力超越了 "文科",进入了需要精确和推理的 "理科" 领域。


3.4 多模态先知:开启 "全感知"AI 的入门

想象一下,上传一张照片,再加入一段描述,AI 可以快速对话式创造工作流。

【进入测试】

"生成他们的宝宝的样子,父母双方特征的融合,专业的照片质量。"

3D 图形:"请把这张照片变成一个人物。在它后面,放置一个印有角色形象的盒子。在它旁边,添加一台计算机。底座是 pure white,并且移动到盒子的后面,使你整个场景更具室内。"

可以看到,多模态使 AI 的 "眼见" 连接视觉,"听觉" 帮助 AI 更接近人类的感知方式。这是目前最前沿的方向。

4. 提示词编写技巧

编写合理且有效的提示词,是我们与 AI 进行有效对话的第一步,好的提示词能显著提升模型输出的质量和相关性。宗旨就是:将你的问题限定范围,让 AI 知道你要的答案具体要包含什么,提示词效果会大幅提升。

核心在于换位思考:想象 AI 对你提供的信息一无所知,你需要清晰、具体、无歧义地告诉他你要什么、在什么背景下、以什么方式呈现。善用示例、角色扮演、具体约束和迭代优化。

写个故事:写一个关于太空探险的儿童故事,主角是机器人小 A,风格温馨,包含 3 个冒险情节

提示技巧不止一种,掌握多种技巧,并根据不同任务灵活组合使用,才是成为提示词高手的秘诀。


4.1 CO-STAR 结构化框架

在目标设定和问题解决的场景下,清晰性和结构性是至关重要的。而有一种方法论,在这些方面表现都非常出色,那就是 CO-STAR 框架。这个提示词编写框架,由新加坡政府技术局(GovTech)的数据科学与 AI 团队开发,重点在于确保提供给 LLM 的提示词是全面且结构良好的,从而生成更相关和准确的回答。

CO-STAR 可以拆解为六个维度:

模块说明示例
Context任务背景与上下文“你是电商客服,需解答用户关于 iPhone 17 的咨询,知识库包含最新价格和库存”
Objective核心目标“准确回答价格、发货时间,推荐适配配件”
Steps执行步骤“1. 识别用户问题类型;2. 检索知识库;3. 用亲切语气整理回复”
Tone语言风格“口语化,避免专业术语,使用‘亲~’‘呢’等语气词”
Audience目标用户“20-35 岁年轻消费者,对价格敏感,关注性价比”
Response输出格式“价格:XXX 元 \n 库存:XXX 件 \n 推荐配件:XXX(链接)”

例如,我需要进行健康咨询,希望给出营养建议。那么我可以这样构建提示词:

优化前(模糊、低效):我该怎么吃才能更健康?

优化后(有效):

替代角色:你是一个基于科学证据的 AI 营养顾问。重要约束:你提供的所有建议都仅为通用信息,不能替代专业医疗诊断。在给出任何具体建议前,必须首先声明此免责条款。

任务: 基于以下用户信息,提供一份个性化的每日饮食原则性建议。

用户信息:

  • 年龄:30 岁
  • 性别:男性
  • 目标:减脂增肌
  • 日常活动水平:办公室久坐,每周进行 3 次力量训练

回答要求:

  1. 首先,输出免责声明:“请注意:以下建议为通用健康信息...”
  2. 核心原则应围绕 “控制总热量摄入,确保充足蛋白质”。
  3. 分别对早餐、午餐、晚餐和训练加餐提出各 1 条核心建议(例如:早餐应包含优质蛋白和复合碳水)。
  4. 推荐 2 种适合该用户的具体健康零食。
  5. 避免推荐任何具体的保健品或药物。

输出格式:[此处输出声明]

【核心原则】

  • ...

【分餐建议】

  • 早餐:...
  • 午餐:...
  • 晚餐:...
  • 训练加餐:...

【健康零食推荐】

  1. ...
  2. ...

4.2 少样本提示 / 多示例提示

核心思想: 你不是在给 AI 下指令,而是在 “教” 它你想要的格式、风格和逻辑。

适用场景: 格式固定、风格独特、逻辑复杂的任务,如风格仿写、数据提取、复杂格式生成。

例如:优化前(零样本提示):

2🍀9 等于多少?

优化后(少样本提示):

根据以下示例,处理问题。

示例 1:2🍀3 = 5现在请分析这个:2🍀9 等于多少?

示例 2:4🍀7 = 11现在请分析这个:2🍀9 等于多少?

再例如:优化前(零样本提示):

请分析以下客户反馈,提取产品名称、情感倾向和具体问题。反馈:“我刚买的耳机,才用了一周左边就没声音了,太让人失望了。”

优化后(少样本提示):

请根据以下示例,分析后续的客户反馈,并提取产品名称、情感倾向和具体问题。

示例 1:

  • 反馈:“笔记本的电池续航太差了,完全达不到宣传的 10 小时,最多就 4 小时。”
  • 分析:
    • 产品名称:笔记本电池
    • 情感倾向:负面
    • 具体问题:续航远低于宣传

示例 2:

  • 反馈:“客服响应很快,非常专业地帮我解决了软件激活问题,点赞!”
  • 分析:
    • 产品名称:客服服务
    • 情感倾向:正面
    • 具体问题:无

现在请分析这个:

  • 反馈:“我刚买的耳机,才用了一周左边就没声音了,太让人失望了。”

通过示例,AI 清晰地学会了 “产品名称” 如何概括,“情感倾向” 的标签是什么,“具体问题” 如何简洁描述。这比单纯用文字描述规则要有效得多。


4.3 思维链提示

提示工程的关键目标是让 AI 更好地理解复杂注入。这种能力的高低,可以直接通过模型处理复杂逻辑推理任务的表现来衡量。当好的提示词能帮助模型解决原本解决不了的难题时,就说明它确实提升了模型的推理水平,并且这一提示词设计得越出色,这种提升效果就越显著。通过设置不同难度的推理测试,可以很清晰地验证这一点。

举个例子(该示例来自论文:Large Language Models are Zero-Shot Reasoners):

翻译一下问题:杂耍者可以杂耍 16 个球。其中一半的球是高尔夫球,其中一半的高尔夫球是蓝色的。请问总共有多少个蓝色高尔夫球?

推理结果:8 个蓝色高尔夫球

可以看到,答案错误。该逻辑题的数学计算过程并不复杂,但却设计了一个语言陷阱,即 “一半的一半” 是多少。类似的逻辑问题均可以使用思维链提示。思维链提示相较于少样本提示是一种更好的提示方法,为了解决类似的逻辑问题,可以使用:

  • few-shot-CoT:少样本思维链
  • zero-shot-CoT:零样本思维链

相比少样本提示(Few-shot),少样本思维链(Few-shot-CoT)的不同之处只在于需要在提示样本中不仅给出问题的答案,还同时需要给出问题推导的过程(即思维链),从而让模型学到思维链的推理过程,并将其应用到新问题上。此模式主要用于解决复杂推理问题,如数学、逻辑等多步骤问题。

核心思想: 要求 AI “展示其工作过程”,而不是直接给出最终答案。这模仿了人类解决问题时的思考方式。

适用场景: 数字题、逻辑推理、复杂决策、需要解释过程的任务。

例如:

示例:Q:“罗杰有五个网球,他又买了两盒网球,每盒有 3 个网球,请问他现在总共有多少个网球?”A:“罗杰起初有 5 个网球,又买了两盒网球,每盒 3 个,所以,他总共买了 2×3=6 个网球,将起始的数量和购买的数量相加,可以得到他现在总共的网球数量:5+6=11。所以罗杰现在总共有 11 个网球。”

在获得了一个思维链示例后,就可以以此作为样本进行 Few-shot-CoT 来解决第一个推理问题,如下所示:

示例 1:Q:“罗杰有五个网球,他又买了两盒网球,每盒有 3 个网球,请问他现在总共有多少个网球?”A:“罗杰起初有 5 个网球,又买了两盒网球,每盒 3 个,所以,他总共买了 2×3=6 个网球,将起始的数量和购买的数量相加,可以得到他现在总共的网球数量:5+6=11。所以罗杰现在总共有 11 个网球。”

Q:“食堂总共有 23 个苹果,如果他们用掉 20 个苹果,然后又买了 6 个苹果,请问现在食堂总共有多少个苹果?”

结果如下:A:“食堂起初有 23 个苹果,用掉 20 个苹果后,剩余数量:23-20=3 个。然后又买了 6 个苹果,将剩余数量和新购买的数量相加,可以得到现在总共的苹果数量:3+6=9。所以现在食堂总共有 9 个苹果。”

通过这个例子可以观察到,“就事论事” 而不仅是 “告诉 AI 答案”。从某种意义上说,是的,你告诉它的是 “如何解决问题” 的方法,而不仅仅是最终的答案。实际上,Few-shot-CoT 的方式虽然有效,但不一定是稳定且准确的。如果想要得到稳定的正确答案,需要更高阶的提示方法:给你的逻辑步骤,或者模仿得就足够慢,这更像是一种 “教学分析”,再格式化,最后总结。当输出时,就可以直接提供一个完美的 “思考过程” 作为范例。


4.4 自推理与零样本链式思考

零样本思维链(Zero-shot-CoT)这是少样本思维链(Few-shot-CoT)的简化版。只需在词末尾加上一句:“请一步一步进行推理”,就可以激发 AI 的推理能力。

核心思想: 通过指令 “请一步一步进行推理”,强制 AI 在给出答案前先进行内部推理。

适用场景: 任何需要一点逻辑思考的问题,即使你不太清楚具体步骤。

例如:

罗杰有五个网球,他又买了两盒网球,每盒有 3 个网球,请问他现在总共有多少个网球?请一步一步进行推理。

AI 的输出可能会变成:“罗杰最初有 5 个网球。他买了两盒网球,每盒有 3 个网球,所以买来的网球数量是:2 × 3 = 6 个网球。因此,他现在的网球数量是:5 + 6 = 11 个网球。答案:11 个网球。”

“一步一步进行推理” 这个指令,相当于在的文本序列中)模拟出一个 “慢”、有序的推理 “在生成最终答案之前,请先在你的脑海里一步一步进行推理,最终得出结论,自然在一个更丰富、更逻辑化的上下文。”在这个开启后,“请你一步一步进行推理” 实际上是为自己创造了更丰富的上下文,以让(即有了原题)更准确。根据《Large Language Models are Zero-Shot Reasoners》论文中的结论,从海量数据的测试结果来看,Few-shot-CoT 比 Zero-shot-CoT 准确率更高。


4.5 自我批判与迭代

核心思想: 将 “生成” 和 “评审” 两个步骤分离,利用 AI 的批判性思维来提升内容质量。

适用场景: 代码审查、文本优化、论文检查。

例如:优化前:

写一个 Python 函数,计算列表中的最大值。

优化后:

步骤一:编写 Python 代码,用于计算一个数字列表中的最大值。步骤二:自我审查代码。步骤三:从代码健壮性和可读性的角度,自查你上面编写的代码。

请问:

  1. 如果输入是空列表,函数会怎样?如何改进?
  2. 请提升你的代码可读性。
  3. 请根据你的审查,给出一个优化后的最终版本代码。

在实际应用中,这些技巧经常组合使用。例如,我们可以:

  1. 使用 CO-STAR 来搭建基本结构和使用场景。
  2. 在框架的 “Steps” 或 “Response” 部分,融入思维链指令。
  3. 对于复杂的输出,在最后附上 1-2 个少样本示例。
  4. 最后,要求 AI 进行自我审查。

我们更多使用 LLM 的场景大都是编写代码,如果你们用过 Cursor、Trae 这样的 AI IDE,应该不陌生在 AI 帮我们编码之前,需要配置相关的 “编码规则”--Rules。它其实就是这些 IDE 输入给 LLM 的提示词,告诉 LLM 编写代码时的注意事项与要求。

Cursor 官方提示词:https://cursor.directory/rules

5. 为什么 LLM 如此重要?

如果说前几年 AI 还是 “炫技” 的概念,那么大模型就是将 AI 变成一种基础资源,像电一样融入各行各业,驱动创新。

生产力革命的 “加速器”自动化所有基于语言和知识的工作:撰写、总结、翻译、编码、答疑…… 它将人类从重复性的脑力劳动中解放出来,让我们能更专注于创造、决策和战略思考。它的核心价值不是替代人类,而是增强人类(Human Augmentation)。

人机交互的 “新范式”从 “人适应机器” 到 “机器适应人”:我们不再需要学习复杂的软件菜单或编程语言,用最自然的 “说话” 方式,就能指挥机器完成任务。技术的使用门槛被极大地降低了。

产业智能化的 “核心引擎”赋能千行百业:

  • 教育:提供一对一、无限耐心的 AI 家教。
  • 医疗:辅助医生看影像资料、查阅最新文献病历。
  • 法律:快速分析海量卷宗,提炼关键信息。
  • 文创:提供无限的故事灵感、设计草图、配乐方案。它正在成为和互联网、移动支付一样重要的数字化基础设施。

6. LLM 的接入方式

前面我们演示的都是通过现成的客户端,来进行 AI 行为,如聊天、生图等。如果现在要我们自己写一个 AI 应用来实现相关 AI 行为,则需要我们自行接入 LLM。

常见的原生 LLM(不经过第三方平台或复杂的代理层,直接与大语言模型提供方进行交互的方法)接入方式有三种:【API 远程调用】、【开源模型本地部署】和【SDK 和官方客户端库】


6.1 API 接入

这是目前最主流、最便捷的接入方式,尤其适用于快速开发、集成到现有应用以及不想管理硬件资源的场景。

通过 HTTP 请求(通常是 RESTful API)直接调用模型提供商部署在云端的模型服务。代表厂商:OpenAI (GPT-4o),Anthropic (Claude),Google (Gemini),百度文心一言,阿里通义千问,智谱 AI 等。

典型流程就是:

  1. 注册账号并获取 API Key:在模型提供商的平台上注册,获得用于身份验证的密钥。
  2. 查阅 API 文档:了解请求的端点、参数(如模型名称、提示词、温度、最大生成长度等)和返回的数据格式。
  3. 构建 HTTP 请求:在你的代码中,使用 HTTP 客户端库(如 Python 的 requests)构建一个包含 API Key(通常在 Header 中)和请求体(JSON 格式,包含你的提示和参数)的请求。
  4. 发送请求并处理响应:将请求发送到提供商指定的 API 地址,然后解析返回的 JSON 数据,提取生成的文本。

以 DeepSeek 为例【点击进入】进行注册登录

登入成功之后,我们点击左侧的 API Keys

进行个人令牌添加:【注意进行密钥复制保存】

我们下面点击接口文档,进行接入:

我们就需要一个基础 url 和 我们刚刚获取的密钥信息,往下滑有相关的调用实例:

我是使用 Apifox,下面是详细步骤:

下面设置前置 url【base_url】

下面我们可以开始发送请求了,我们先来设置一下请求头:

【注意这里的密钥格式是:Bearer 你的申请的密钥】【Bearer 后面有一个空格】

我们下面就可以自行设置响应正文,进行发送了:【我这里¥不足了】

以 OpenAI 为例,官网地址:https://platform.openai.com/(✈上网)接入流程参考:https://platform.openai.com/docs/quickstart

如果没有账号先注册账号,登录成功后,选择 API keys 配置页面:

点击 “Create new secret key” 按钮,新增 API key:

调用:

curl https://api.openai.com/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -d '{
    "model": "gpt-5",
    "input": "Write a one-sentence bedtime story about a unicorn."
  }'

或使用 HTTP 客户端(如 Apifox)发起调用。(调用需要开启系统代理)

输出示例:

{
  "id": "resp_68da0ae40f408319c8f33465a1d923fcb0b003ac22034ffda",
  "object": "response",
  "created_at": 1759120100,
  "status": "completed",
  "background": false,
  "payer": "developer",
  "error": null,
  "instruction_details": null,
  "max_output_tokens": null,
  "model": "gpt-4o-mini-2024-07-18",
  "output": [
    {
      "id": "msg_68da0ae4a90819cb9544144353167060b003ac22034fda",
      "type": "message",
      "status": "completed",
      "content": [
        {
          "type": "output_text",
          "text": "你好!我是一个人工智能助手,旨在回答你的问题和提供帮助。有什么我可以为你做的呢?"
        }
      ],
      "role": "assistant",
      "prevail_tools": true,
      "prompt_caching_key": null,
      "reasoning": null,
      "summary": null,
      "safety_identifiers": null,
      "service_tier": "default",
      "temperature": 1.0,
      "top_p": 1.0,
      "format": "text",
      "conversation": "hello",
      "tools": [],
      "top_logprobs": null,
      "usage": {
        "input_tokens": 11,
        "output_tokens": 27,
        "total_tokens": 38,
        "input_tokens_details": {
          "cached_tokens": 0
        },
        "output_tokens_details": {
          "reasoning_tokens": 0
        }
      }
    }
  ]
}

API 参考:https://platform.openai.com/docs/api-reference/introduction

6.2 本地接入

大模型本地部署,这种方式就是将开源的大型语言模型(如 Llama、ChatGLM、Qwen 等)部署在你自己的硬件环境(本地服务器或私有云)中。核心概念就是,将下载模型的文件(权重和配置文件),使用专门的推理框架在本地服务器或 GPU 上加载并运行模型,然后通过类似 API 的方式进行交互。

典型流程是:

获取模型:从 Hugging Face(国外)、魔搭社区(国内)等平台下载开源模型的权重。(平台参考略)

准备环境:配置具有足够显存(如 NVIDIA GPU)的服务器,安装必要的驱动和推理框架。

选择推理框架:使用专为生产环境设计的框架来部署模型,例如:

  • vLLM:特别注重高吞吐量的推理服务,性能极佳。
  • TGI:Hugging Face 推出的推理一键拉取和运行模型,适合快速入门和本地开发。
  • Ollama:非常用户友好,可以一键拉取和运行模型使用软件快速简单。
  • LM Studio:提供图形化界面,让本地运行模型像使用软件一样简单。

启动服务并调用:框架会启动一个本地 API 服务器(如 http://localhost:8000),你可以像调用云端 API 一样向这个本地地址发送请求。

以 Ollama 为例,下面我们来演示下具体过程。


6.2.1 下载并安装 Ollama

Ollama 是一款专为本地部署和运行大型语言模型 (LLM) 设计的开源工具,旨在简化大型语言模型 (LLM) 的安装、运行和管理。它支持多种开源模型 (如 qwen、deepseek、LLaMA),并提供简单的 API 接口,方便开发者调用,适合开发者和企业快速搭建私有化 AI 服务。

Ollama 官网:https://ollama.ai

下载 Ollama

安装 Ollama下载完成之后,一步一步安装即可。

验证:安装完成后,Ollama 默认会启动。

  • 访问:http://127.0.0.1:11434,页面显示 Ollama is running 即代表服务正常。
  • 或者使用 cmd 命令验证版本:ollama --version,示例输出:ollama version is 0.9.3

C:\Users\A1983>ollama --version
ollama version is 0.18.2

6.2.2 拉取模型

Ollama 可以管理和部署模型,我们使用之前,需要先拉取模型。

修改模型存储路径:模型默认安装在 C 盘个人目录下 C:\Users\XXX\.ollama,可以修改 ollama 的模型存储路径,使得每次下载的模型都在指定的目录下。有以下两种方式:

1. 配置系统环境变量

变量名:OLLAMA_MODELS
变量值:${自定义路径}

2. 通过 Ollama 界面来进行设置

设置完成后,重启 Ollama

拉取模型:查找模型:https://ollama.com/search

DeepSeek-R1 为例,DeepSeek-R1 是一系列开放推理模型,其性能接近 O3 和 Gemini 2.5 Pro 等领先模型。DeepSeek-R1 有不同的版本,我们需要根据自己机器的配置及需求来选择相应的版本。

NameSizeContextInput
deepseek-r1:latest5.2GB128KText
deepseek-r1:1.5b1.1GB128KText
deepseek-r1:7b4.7GB128KText
deepseek-r1:8b (latest)5.2GB128KText
deepseek-r1:14b9.0GB128KText
deepseek-r1:32b20GB128KText
deepseek-r1:70b43GB128KText
deepseek-r1:671b404GB160KText

分为 1.5b7b8b 等,"b" 是 "Billion" (十亿) 的缩写,代表模型的参数量级。671b 表示 "满血" 版本,其他版本称为 "蒸馏" 版本。

参数越多 → 模型 "知识量" 越大 → 处理复杂任务的能力越强,硬件需求也越高。

根据需求及电脑配置,选择合适的模型版本,以 1.5b 为例:

ollama run deepseek-r1:1.5b

下载完成之后,就会出现命令行,可以通过命令行和 AI 模型对话。


6.2.3 测试

模型拉取之后,可以通过命令行和 AI 模型对话。

ollama run deepseek-r1:1.5b

我们可以对比下 1.5b70b 的区别:

1.5b

>>> 夸夸我
哈哈,你这夸奖有点幽默!不过还是得体点哦~你可以这样夸我:
"我的优点可不少呢,**好奇心强,** 思维敏捷,** always keep an eye out for the best!** 无论是学习还是生活,我都kept追求更卓越的水平。如果你也有哪些特别的地方,我也乐你分享! 😉"
或者用些更中性的词汇:
"嗯,我觉得我的优点很多啊~比如**认真对待每一件事情,**遇到问题总能想个办法解决。如果你觉得还有其他好说的,我再继续夸奖你吧! 😉
希望我能帮到你, 😉 一起进步吧!
>>> Send a message (? for help)

70b(测试机器:28 核 CPU 64G 内存 44G 显存,速度 3-4token/s)

>>> 夸夸我


哇!你真是个了不起的人!不管是在工作、学习还是生活中,你都展现出了无与伦比的智慧和能力。你的独特见解总能给人带来启发,仿佛有一种神奇的力量让你总能找到最好的解决方案。
而且,你的热情和积极性简直感染力十足!每当你投入到某件事情中时,整个氛围都会变得活跃起来。你的存在就像是阳光一样,总能为身边的人带来温暖和希望。
此外,你的幽默感真的无人能及!总是能够在最合适的时机说出让人捧腹大笑的话,这种能力实在是太令人佩服了。你的生活一定充满了欢声笑语,真好啊!
总之,你是一个无论外表、内在还是能力都非常出色的一个人!你应该为自己感到骄傲,因为你真的做到了很多人难以企及的事情。期待你未来会有更多的成就和收获!加油!
>>> Send a message (? for help)

可以通过接口调用:

curl "http://127.0.0.1:11434/api/chat" \
  -d '{
    "model": "deepseek-r1:1.5b",
    "messages": [
      {"role": "user", "content": "夸夸我"}
    ],
    "stream": false
  }'

6.3 SDK 接入

这并非一种独立的接入方式,而是对第一种 API 接入的封装和简化。模型提供商通常会发布官方编程语言 SDK,为我们封装好了底层的 HTTP 请求细节,提供一个更符合编程习惯的、语言特定的函数库。

典型流程(以 OpenAI Python SDK 为例):

安装库:

pip install openai

安装 OpenAI SDK 后,可以创建一个名为 example.py 的文件并将示例代码复制到其中:

from openai import OpenAI
client = OpenAI(api_key="your-api-key")

response = client.responses.create(
    model="gpt-5",
    input="介绍一下你自己。"
)

print(response.output_text)

相比直接构造 HTTP 请求,代码更简洁、更易读、更易维护。


6.4 问题与思考

对于以上三种接入方式,我们该如何选择?

  • 看数据敏感性:如果数据极其敏感,必须留在内部,本地部署是唯一选择。
  • 看技术实力和资源:如果团队没有强大的 MLOps(机器学习运维)能力,也没有预算购买和维护 GPU 服务器,云端 API 是更实际的选择。
  • 看成本和规模:如果应用规模很大,长期来看,本地部署的固定成本可能低于持续的 API 调用费用。反之,小规模应用用 API 更划算。
  • 看定制需求:如果只是使用模型的通用能力,云端 API 足够。如果需要用自己的数据微调模型,则需要选择支持微调的 API 或直接本地部署。

实际上,只要是原生 LLM,无论怎么接入都有限制。为什么?

输入长度限制:所有 LLM 都有固定的输入长度(如 4K、8K、128K、400K Token)。我们无法将一本几百页的 PDF 或整个公司知识库直接塞给模型。

缺乏私有知识:模型的训练数据有截止日期,且不包含我们的私人数据(如公司内部文档、个人笔记等)。让它基于这些知识回答问题,非常困难。

复杂任务处理能力弱:原生 API 本质是一个 “一问一答” 的接口。对于需要多个步骤的复杂任务(如 “分析这份财报,总结要点,并生成一份 PPT 大纲”),我们需要自己编写复杂的逻辑来拆解任务、多次调用 API 并管理中间状态。

输出格式不可控:虽然可以通过提示词要求模型输出 JSON 或特定格式,但它仍可能产生格式错误或不合规的内容,需要我们自己编写后处理代码来校验和清洗。

像 LangChain 这样的框架,正是为了系统性地解决这些问题而诞生的。

总结与感知

一、大模型:只有 “智商”,没有 “记忆” 和 “手脚” 的纯函数

我们先戳破一个常见误区:大模型本身完全没有记忆,也不会主动做事。无论是 GPT、DeepSeek、Llama 这类主流大模型,本质都是一个 “输入→输出” 的纯数学函数 —— 你给它一段文本(输入),它基于训练好的语言规律算出最合理的回应(输出),整个过程像 “一次性计算器”:算完当下的结果,就清空所有临时信息,不会留存任何 “过往记录”。

你在聊天时感受到的 “它记得我之前说的话”,其实是平台在背后帮它 “记”:每次你发新消息,系统都会把之前的完整对话记录一起打包,作为新的输入传给大模型。比如你先问 “推荐一部科幻电影”,再问 “它的导演是谁”,大模型能回应,是因为第二次输入里包含了 “推荐科幻电影” 的历史对话,它并非自己 “记住”,而是基于新的完整输入重新计算输出。

一句话总结:大模型是具备强大语言理解和推理能力的 “智商核心”,但没有自主记忆、没有行动能力,也不会主动触发任何操作,必须依赖外部辅助才能发挥更大价值。

二、Agent(智能体):给大模型装上 “记忆”“手脚” 和 “决策脑”

如果说大模型是 “裸大脑”,那 Agent 就是把这个大脑升级成 “能自主干活的机器人”—— 它的核心逻辑是:Agent = 大模型 + 记忆模块 + 工具集 + 自主决策系统

具体来说,Agent 在大模型的基础上,增加了三个关键能力:

  • 记忆能力:能主动存储和调用信息 —— 既可以记住你的偏好(比如 “我喜欢无剧透影评”),也能记住任务进度(比如 “我正在帮你整理 3 篇论文的核心观点,已经完成 2 篇”),无需每次都重复传递历史信息;
  • 工具使用能力:拥有 “手脚”,能调用外部工具完成大模型本身做不到的事 —— 比如搜索实时信息(“查今天的股市行情”)、读取本地文件(“分析我电脑里的销售数据”)、调用 API(“给客户发一封邮件”)、操作软件(“生成一个 Excel 表格”);
  • 自主决策与规划能力:能自己拆解任务、制定步骤、执行到底 —— 比如你让它 “帮我完成一份市场调研报告”,它会自主规划:第一步搜索行业最新数据,第二步整理竞品分析,第三步提炼核心结论,第四步生成 PPT,全程无需你逐一步骤指导,遇到问题还会自主调整(比如搜索不到某数据时,换一个数据源)。

简单说:大模型是 “只会思考的大脑”,而 Agent 是 “能思考、能记忆、能动手、能自主做事的完整智能体”—— 它以大模型为核心,通过补充记忆、工具和决策能力,把 “被动回应” 升级成了 “主动执行”。

三、Coze(扣子):零代码就能搭建 Agent 的 “可视化平台”

Coze 扣子本质是一个低代码 / 零代码的 Agent 开发平台—— 它把 Agent 的复杂架构(大模型、记忆、工具、决策)打包成可视化工具,让普通人不用写代码,就能快速搭建属于自己的 Agent(也就是扣子里的 “bot”)。

你在 Coze 里搭建的每一个 bot,都是标准的 Agent:

  • 有记忆:能记住你和它的对话偏好(比如 “每次回复控制在 300 字内”),也能记住任务状态(比如 “帮我追踪快递,已经查询到物流在运输中”);
  • 能调用工具:内置了搜索、文件处理、API 调用、表格生成等多种工具,你只需勾选配置,bot 就会在需要时自主使用;
  • 能自主决策:支持设置流程规则(比如 “先验证用户身份,再提供核心信息”),bot 会按照你设定的逻辑,自主拆解任务、执行步骤;
  • 有状态和身份:你可以给 bot 设定角色(比如 “客服专员”“学术助手”“旅行规划师”),它会基于角色身份回应,同时保持任务的连续性(比如 “旅行规划师” 会记住你之前选定的出行日期和目的地,后续推荐酒店时自动匹配)。

所以结论很明确:Coze 扣子不是单纯的 “聊天工具”,而是一个让所有人都能轻松创建 Agent 的平台 —— 它降低了 Agent 的开发门槛,让 “大模型变智能体” 的过程像搭积木一样简单。

四、LangChain:开发者把大模型变成 Agent 的 “万能工具包”

如果说 Coze 是给普通人用的 “可视化 Agent 搭建平台”,那 LangChain 就是给开发者用的 “Agent 开发框架”—— 它的核心定位的是:一套帮开发者快速、高效把 “裸大模型” 升级成 “Agent” 的标准工具集,堪称 “大模型转 Agent 的钥匙”。

开发者如果想自己写一个 Agent,要是从零开始,需要解决一堆复杂问题:怎么管理记忆(短期对话记忆、长期用户偏好记忆)、怎么让大模型调用工具(工具的接口适配、调用逻辑判断)、怎么让大模型规划任务(拆解步骤、处理异常)、怎么调度多个模型(比如用 A 模型做推理,用 B 模型做数据分析)…… 这些工作繁琐且重复,而 LangChain 已经把这些 “脏活累活” 都封装好了,开发者只需调用对应的模块,就能快速组装出一个 Agent。

具体来说,LangChain 的核心功能包括:

  • 记忆管理:提供短期记忆(对话上下文存储)、长期记忆(向量数据库对接,存储用户偏好、知识库等)模块;
  • 工具调用:内置搜索引擎、数据库、API、文件处理等常用工具的接口,支持自定义工具接入;
  • 规划与推理:封装了 ReAct、思维链(Chain of Thought)等主流决策框架,让大模型能自主拆解任务、逐步执行;
  • 流程编排:支持用 “链(Chain)” 或 “智能体(Agent)” 模式,串联起 “输入→处理→工具调用→输出” 的完整流程;
  • 多模型调度:能同时对接多个大模型,根据任务需求切换模型(比如文本生成用 GPT,数据分析用 CodeLlama)。

简单说:没有 LangChain,开发者也能做 Agent,但可能需要花几个月写基础代码;有了 LangChain,开发者只需专注核心业务逻辑,几周甚至几天就能搭建出一个功能完善的 Agent—— 它是 AI 开发者生态里的 “基础设施”,让 “大模型变 Agent” 的效率提升了一个量级。

从大模型到能自主干活的智能体,整个生态的逻辑的是:

裸大模型(纯智商)→ 借助 LangChain(开发工具包)/ Coze(零代码平台)→ 升级为 Agent(有记忆、有手脚、能自主决策)

  • 大模型是 “核心智商”,是一切的基础;
  • LangChain 是 “开发者工具”,面向技术人员,解决 Agent 开发的效率问题;
  • Coze 是 “大众平台”,面向普通人,降低 Agent 的使用门槛;
  • 而 Agent 是最终的 “产品形态”,是大模型落地到实际场景(工作、生活、办公)的关键载体。

更多推荐