从零开始的构建大语言模型(LLM)全栈开发指南:从数据工程、微调训练到RAG与Agent应用实战
从零开始的构建大语言模型(LLM)全栈开发指南:从数据工程、微调训练到RAG与Agent应用实战
作者:技术前沿探索者
发布平台:CSDN / 掘金 / 知乎技术专栏
字数统计:超 10,000 字
核心标签:大语言模型LLM开发PyTorchSFT微调RAG系统Agent架构vLLM部署
摘要 (Abstract)
随着 ChatGPT、Claude、Llama 3 以及 DeepSeek 系列模型的相继问世,大语言模型(Large Language Models, LLMs)已经从实验室的研究成果彻底转变为推动新一轮生产力变革的核心基础设施。然而,对于广大开发者和企业技术架构师而言,如何从零搭建、微调、部署并落地一套完整的大模型应用,依然面临着极高的高技术门槛与工程复杂度。
本文旨在打造一部大模型全栈开发“百科全书式”指南。全书从 LLM 底层架构演进出发,深入剖析 Tokenizer 与数据工程流程;详述主流 3D 并行训练机制与 SFT/DPO 微调实战;全面解读企业级 RAG(检索增强生成)架构设计与 Agent 智能体协同机制;最后结合生产环境下的高效推理部署框架(vLLM/TensorRT-LLM)与量化技术,给出了工业级全链路落地实践方案。文中配备丰富的代码实现、架构设计示意图以及数据库/实体关系(ER)模型图,力求为大模型开发者提供最具实操价值的技术参考。
目录 (Table of Contents)
- 大语言模型技术全景与底层架构演进
- 1.1 Transformer 架构的核心演进路线
- 1.2 关键机制深度解析:RoPE、GQA 与 FlashAttention
- 数据工程与预处理 Pipeline
- 2.1 高质量语料清洗与去重策略
- 2.2 BPE / Unigram Tokenizer 训练原理与代码实现
- 大模型训练与微调工程实践
- 3.1 预训练中的 3D 并行策略(Data, Tensor, Pipeline Parallelism)
- 3.2 监督微调(SFT)与高效参数微调(LoRA/QLoRA)实战
- 3.3 对齐技术(RLHF, DPO, GRPO)深度对比
- 企业级 RAG (检索增强生成) 系统设计
- 4.1 RAG 架构演变:从 Naive RAG 到 Advanced/Modular RAG
- 4.2 向量检索、混合检索与 Rerank 重排序
- 4.3 RAG 数据架构与 ER 关系模型图
- LLM Agent 智能体架构与多工具协同
- 5.1 ReAct 框架与 Function Calling 原理
- 5.2 智能体记忆系统与状态机设计
- 5.3 多 Agent 协同协作机制设计
- 高效推理部署与性能优化
- 6.1 KV Cache 管理与 PagedAttention 机制
- 6.2 模型量化技术解析(AWQ, GPTQ, GGUF/EXL2)
- 6.3 基于 vLLM 的高并发部署与接口封装
- 全栈工程实战:企业级智能知识库与 Agent 混合系统代码实现
- 7.1 系统整体架构设计与流程图
- 7.2 核心代码:自定义 RAG Pipeline 与 Agent 执行引擎
- 总结与大模型技术未来展望
1. 大语言模型技术全景与底层架构演进
1.1 Transformer 架构的核心演进路线
经典的 Transformer 结构(Vaswani et al., 2017)采用了完整的 Encoder-Decoder 结构。但在大语言模型演进过程中,主流架构逐渐分化为三大流派:
- Encoder-only(如 BERT):擅长文本理解、分类与向量抽取,但不擅长自由生成。
- Encoder-Decoder(如 T5, FLAN-T5):擅长序列到序列的转换(如翻译、摘要)。
- Decoder-only(如 GPT 系列, Llama, DeepSeek, Qwen):通过自回归(Autoregressive)建模,拥有极强的泛化生成能力,已成为当今大语言模型的绝对标准架构。
在自回归 Decoder 架构中,下一个 Token 的生成仅依赖于历史上下文,输入序列通过 Causal Mask(因果掩码)确保注意力计算不能“偷看”未来的信息。
因果掩码 (Causal Mask) 示例矩阵:
[ 0, -∞, -∞, -∞ ]
[ 0, 0, -∞, -∞ ]
[ 0, 0, 0, -∞ ]
[ 0, 0, 0, 0 ]
1.2 关键机制深度解析:RoPE、GQA 与 FlashAttention
现代开源大模型(如 Llama 3、Qwen 2.5)在原始 Transformer Decoder 的基础上进行了多项关键优化:
(1) 旋转位置编码 (Rotary Position Embedding, RoPE)
传统的绝对位置编码或相对位置编码在长文本扩展时泛化能力较差。RoPE 通过将复数域上的旋转矩阵引入到 Query 和 Key 的向量点积中,巧妙地将绝对位置信息转化为相对位置关系:
R Θ , m d = diag ( R θ 1 , m , R θ 2 , m , … , R θ d / 2 , m ) R_{\Theta, m}^d = \text{diag}\left(R_{\theta_1, m}, R_{\theta_2, m}, \dots, R_{\theta_{d/2}, m}\right) RΘ,md=diag(Rθ1,m,Rθ2,m,…,Rθd/2,m)
其中:
R
θ
i
,
m
=
(
cos
m
θ
i
−
sin
m
θ
i
sin
m
θ
i
cos
m
θ
i
)
R_{\theta_i, m} = \begin{pmatrix} \cos m\theta_i & -\sin m\theta_i \\ \sin m\theta_i & \cos m\theta_i \end{pmatrix}
Rθi,m=(cosmθisinmθi−sinmθicosmθi)
这一设计使得模型可以通过简单的角度外推(如 YaRN, Dynamic NTK-aware Scaling)实现从 4k 到 128k 甚至 1M 上下文窗口的无缝扩展。
(2) 分组查询注意力 (Grouped-Query Attention, GQA)
传统的多头注意力(MHA)中,Query、Key、Value 的 Head 数量完全一致(例如 32 个 Head),这在推理时需要消耗巨量的显存来保存 KV Cache。
多查询注意力(MQA)则让所有 Q 共享 1 组 KV,虽然极大节省了显存,但会导致模型表达能力下降。
GQA(Grouped-Query Attention)在此做出了绝佳折中:将 Q 分为 G G G 个组,每组共享 1 组 KV。
多头注意力 (MHA) 分组查询注意力 (GQA) 多查询注意力 (MQA)
Q Q Q Q Q Q Q Q Q Q Q Q Q Q Q Q Q Q Q Q Q Q Q Q
│ │ │ │ │ │ │ │ └──┬──┘ └──┬──┘ └──────┬──────┘
K K K K K K K K K K K
V V V V V V V V V V V
(8 KV Heads) (2 KV Heads) (1 KV Head)
(3) FlashAttention (v1 / v2 / v3)
传统的 Attention 计算公式为:
Attention ( Q , K , V ) = softmax ( Q K T d k ) V \text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V Attention(Q,K,V)=softmax(dkQKT)V
在此过程中,需要在 GPU HBM(显存)与 SRAM(高速缓存)之间频繁读写 N × N N \times N N×N 的 Attention Matrix。当序列长度 N N N 增大时,IO 瓶颈极其严重。
FlashAttention 利用分块(Tiling)算法与**重计算(Recomputation)**技巧,在线增量计算 Softmax,将空间复杂度从 O ( N 2 ) O(N^2) O(N2) 降低至 O ( N ) O(N) O(N),且完全避免了显存中巨大中间矩阵的落盘,使 Attention 计算加速 2~4 倍。
2. 数据工程与预处理 Pipeline
“Data is All You Need”。高质量数据是大模型基座能力的关键决定因素。数据工程分为语料采集、数据清洗、去重、安全过滤与 Tokenizer 分词。
2.1 高质量语料清洗与去重策略
数据清洗管线(Pipeline)通常包含以下步骤:
- 文本抽取与格式规范化:提取 HTML/PDF 中的纯文本,去除无用标签与控制字符。
- 规则过滤(Heuristic Filtering):
- 过滤过短/过长的句子。
- 过滤高频特殊符号、乱码比例过高的文本。
- 基于词典过滤低质量词汇与敏感词。
- 模糊去重(Deduplication):
- MinHash + LSH(局部敏感哈希):在文档级别计算 Jaccard 相似度,快速找出重复与高度相似的网页文档。
- 高质量质量打分模型(Quality Classifier):
- 使用 FastText 或小型 BERT 模型,训练“维基百科 vs 垃圾网页”二分类器,给所有语料打分,过滤低质数据。
2.2 BPE Tokenizer 原理与 Python 分词器实现
字节对编码(Byte-Pair Encoding, BPE)是目前大模型(如 GPT-4, Llama)最普及的分词算法。它从字符/字节级别出发,迭代地将最常出现的相邻子词(Subword)对合并为新的 Token。
下面是一个纯 Python 实现的轻量级 BPE 算法核心逻辑:
import re
from collections import defaultdict
class SimpleBPETokenizer:
def __init__(self, vocab_size: int):
self.target_vocab_size = vocab_size
self.merges = {}
self.vocab = {}
def get_stats(self, ids_list):
counts = defaultdict(int)
for ids in ids_list:
for pair in zip(ids[:-1], ids[1:]):
counts[pair] += 1
return counts
def merge_pair(self, ids_list, pair, idx):
new_ids_list = []
for ids in ids_list:
new_ids = []
i = 0
while i < len(ids):
if i < len(ids) - 1 and (ids[i], ids[i+1]) == pair:
new_ids.append(idx)
i += 2
else:
new_ids.append(ids[i])
i += 1
new_ids_list.append(new_ids)
return new_ids_list
def train(self, text_corpus: list):
# 将文本转化为 UTF-8 字节流
raw_ids_list = [list(doc.encode("utf-8")) for doc in text_corpus]
current_vocab_size = 256 # 基础 256 个 byte
ids_list = raw_ids_list
num_merges = self.target_vocab_size - current_vocab_size
for i in range(num_merges):
stats = self.get_stats(ids_list)
if not stats:
break
# 找出频次最高的一对连续 token
best_pair = max(stats, key=stats.get)
new_token_id = current_vocab_size + i
ids_list = self.merge_pair(ids_list, best_pair, new_token_id)
self.merges[best_pair] = new_token_id
print(f"Merge {i+1}/{num_merges}: {best_pair} -> {new_token_id}")
print("BPE 词表训练完毕!")
# 测试 BPE 训练
if __name__ == "__main__":
corpus = [
"大语言模型技术全景与底层架构演进",
"大模型开发与数据工程实践",
"大语言模型 LLM 全栈开发指南"
]
bpe = SimpleBPETokenizer(vocab_size=270)
bpe.train(corpus)
3. 大模型训练与微调工程实践
3.1 预训练中的 3D 并行策略
当模型参数扩张到数百亿乃至数千亿级别时,单张 GPU 显存(如 A100 80GB)已无法放下整个模型的参数、梯度以及优化器状态(AdamW 状态约占 16 × 参数量 16 \times \text{参数量} 16×参数量 字节)。必须借助 3D 并行技术:
┌─────────────────────────┐
│ 3D 混合并行 │
└────────────┬────────────┘
┌───────────────────────┼───────────────────────┐
▼ ▼ ▼
┌──────────────────┐ ┌──────────────────┐ ┌──────────────────┐
│ 数据并行 (DP/ZeRO) │ │ 张量并行 (TP) │ │ 流水线并行 (PP) │
│ - DeepSpeed ZeRO │ │ - Megatron-LM │ │ - 层间切分 │
│ - 参数切分 │ │ - 矩阵乘法切分 │ │ - 气泡率控制 │
└──────────────────┘ └──────────────────┘ └──────────────────┘
- 数据并行(Data Parallelism, DP)与 ZeRO 降本:
- ZeRO-1:对优化器状态(Optimizer States)进行分片。
- ZeRO-2:对优化器状态 + 梯度(Gradients)进行分片。
- ZeRO-3:对优化器状态 + 梯度 + 模型参数(Parameters)完全切分,使得单卡只需保存 1 / N 1/N 1/N 的模型权重。
- 张量并行(Tensor Parallelism, TP):
- 将单个 Transformer Layer 内部的矩阵乘法(ColumnParallel 与 RowParallel)拆分到不同 GPU 上并行计算,需要极高带宽的 NVLink 互联。
- 流水线并行(Pipeline Parallelism, PP):
- 将模型的不同层(如第 1~16 层,第 17~32 层)划分到不同节点,通过 Micro-batch 与 1F1B(One Forward, One Backward)调度降低气泡率(Bubble)。
3.2 监督微调(SFT)与高效参数微调(LoRA/QLoRA)实战
对于绝大多数企业级应用,无需从头预训练,而是基于通用基座模型进行 SFT(Supervised Fine-Tuning)或参数高效微调(PEFT)。
LoRA (Low-Rank Adaptation) 原理
LoRA 假设模型微调过程中的权重更新矩阵 Δ W \Delta W ΔW 具有较低的隐秩(Intrinsic Rank)。对于原始权重 W 0 ∈ R d × k W_0 \in \mathbb{R}^{d \times k} W0∈Rd×k,冻结 W 0 W_0 W0,附加两个低秩矩阵 A ∈ R r × k A \in \mathbb{R}^{r \times k} A∈Rr×k 与 B ∈ R d × r B \in \mathbb{R}^{d \times r} B∈Rd×r( r ≪ min ( d , k ) r \ll \min(d, k) r≪min(d,k)):
W = W 0 + Δ W = W 0 + α r ( B ⋅ A ) W = W_0 + \Delta W = W_0 + \frac{\alpha}{r} (B \cdot A) W=W0+ΔW=W0+rα(B⋅A)
使用 PyTorch 与 HuggingFace peft 库快速搭建 LoRA 微调代码如下:
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer, TrainingArguments, Trainer
from peft import LoraConfig, get_peft_model, TaskType
def train_lora_sft():
model_id = "Qwen/Qwen2.5-7B-Instruct"
# 1. 加载 Tokenizer 与 模型
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype=torch.bfloat16,
device_map="auto"
)
# 2. 配置 LoRA 参数
lora_config = LoraConfig(
task_type=TaskType.CAUSAL_LM,
r=16, # 低秩矩阵秩大小
lora_alpha=32, # 缩放系数 alpha
lora_dropout=0.05, # Dropout 概率
target_modules=["q_proj", "k_proj", "v_proj", "o_proj", "gate_proj", "up_proj", "down_proj"]
)
# 3. 包装模型
model = get_peft_model(model, lora_config)
model.print_trainable_parameters() # 打印可训练参数量(通常仅占全量的 0.1%~0.5%)
# 4. 训练参数配置
training_args = TrainingArguments(
output_dir="./qwen_lora_output",
per_device_train_batch_size=4,
gradient_accumulation_steps=4,
learning_rate=2e-4,
logging_steps=10,
num_train_epochs=3,
save_strategy="epoch",
bf16=True,
optim="adamw_torch"
)
if __name__ == "__main__":
print("LoRA 配置初始化示例准备就绪。")
3.3 对齐技术(RLHF, DPO, GRPO)深度对比
为了使模型输出符合人类偏好、诚实且无害(Helpful, Honest, Harmless),需要进行偏好对齐:
| 对齐算法 | 核心机制 | 优势 | 挑战 |
|---|---|---|---|
| RLHF (PPO) | 训练 Reward Model,再通过 PPO 算法更新 Policy 网络 | 理论完备,上限高,可在线迭代 | 训练极度不稳定,需维护 4 个模型(Actor, Critic, Ref, Reward) |
| DPO (Direct Preference Optimization) | 将偏好损失直接推导为隐式 Reward,直接在偏好数据对 ( y w , y l ) (y_w, y_l) (yw,yl) 上优化 | 离线计算,无需训练 Reward 模型,训练极稳定 | 容易受数据噪音影响,过度契合样本外泛化可能受限 |
| GRPO (Group Relative Policy Optimization) | DeepSeek R1 采用的核心算法。取消 Critic 模型,对输入针对性采样 G G G 个输出组,组内计算相对奖励 | 显著降低训练显存消耗,特别适合数学与代码 Reasoning 强化学习 | 对 Group 采样多样性与奖励函数(Reward Function)设计要求高 |
4. 企业级 RAG (检索增强生成) 系统设计
尽管大模型能力强大,但依然面临幻觉(Hallucination)、知识时效性滞后以及企业私有数据不可见三大痛点。RAG(Retrieval-Augmented Generation)是解决上述问题最成熟的架构方案。
4.1 RAG 架构演变
- Naive RAG:Chunking -> Embedding -> Vector Store -> Similarity Search -> Prompt -> LLM 生成。极易受到分块切割破坏语义、检索噪音大、召回不精准等问题困扰。
- Advanced RAG:在检索前(Pre-Retrieval)引入 Query 理解与重写(Query Rewriting/Expansion),在检索后(Post-Retrieval)引入 Rerank 重排序与上下文压缩(Context Compression)。
- Modular RAG:将 RAG 拆解为路由(Routing)、检索(Retrieval)、对齐(Alignment)、验证(Verification)等诸多可复用模块,甚至结合 GraphRAG 引入知识图谱扩展。
4.2 向量检索、混合检索与 Rerank 重排序
单纯依赖向量点积/余弦相似度的语义检索(Dense Retrieval)往往会忽略关键的精准关键词匹配(如产品型号、人名、代码 ID)。因此,生产环境标准架构是混合检索(Hybrid Search):
Final Score = α ⋅ Score Dense + ( 1 − α ) ⋅ Score BM25 (Sparse) \text{Final Score} = \alpha \cdot \text{Score}_{\text{Dense}} + (1 - \alpha) \cdot \text{Score}_{\text{BM25 (Sparse)}} Final Score=α⋅ScoreDense+(1−α)⋅ScoreBM25 (Sparse)
混合检索后召回前 Top-K(如 K=30)结果,再送入 Cross-Encoder Rerank 模型(如 bge-reranker-large)计算 Query 与 Context 的深度相关性评分,截取 Top-N(如 N=5)喂给 LLM。
4.3 RAG 数据架构与 ER 关系模型图
为了支撑高并发、多租户的企业级知识库应用,系统内部的数据持久化设计至关重要。以下为标准 RAG 系统中基于关系数据库与向量索引的 ER(实体-关系)关系模型图:
5. LLM Agent 智能体架构与多工具协同
Agent = 大模型(Brain)+ 规划能力(Planning)+ 记忆能力(Memory)+ 工具使用(Tool Use)。
5.1 ReAct 框架与 Function Calling 原理
ReAct(Reasoning + Acting)是 Agent 最基础的工作范式。其核心思想是让 LLM 按照“思考(Thought) -> 动作(Action) -> 观察(Observation)”的循环迭代进行问题求解。
用户提问
│
▼
┌──────────────────────────────────────────────────────────┐
│ LLM 思考 (Thought): 我需要查询深圳今天的实时天气 │
│ 发起动作 (Action): get_weather(location="Shenzhen") │
└──────────────────────────┬───────────────────────────────┘
│
▼ 工具执行
┌──────────────────────────────────────────────────────────┐
│ 工具返回 (Observation): {"temp": "28°C", "condition": "Sunny"}
└──────────────────────────┬───────────────────────────────┘
│
▼
┌──────────────────────────────────────────────────────────┐
│ LLM 最终回答 (Final Answer): 深圳今天天气晴朗,气温 28°C。│
└──────────────────────────┬───────────────────────────────┘
大型语言模型(如 OpenAI GPT-4, Qwen 2.5)通过特定的系统 Prompt 或特化训练,使得模型在检测到需要调用外部函数时,能够输出标准 JSON 格式的函数名和参数(Function Calling)。
5.2 智能体记忆系统与状态机设计
Agent 的记忆分为两类:
- 短期记忆(Short-term Memory):当前的 Context Window 历史上下文,可以通过 Sliding Window(滑动窗口)或 Summarizer(摘要器)进行压缩管理。
- 长期记忆(Long-term Memory):利用外部向量数据库或图数据库,将用户喜好、过去的历史对话总结持久化,在需要时检索注入上下文。
5.3 多 Agent 协同协作机制设计
对于复杂业务逻辑(如软件工程自动开发、金融报告撰写),单 Agent 容易陷入死循环或能力上限。此时需要采用多 Agent 协作系统:
- 主从架构(Router / Master-Worker):由一个路由 Agent 进行任务拆解与分发,多个专家 Agent 分头执行后由主 Agent 汇总。
- 辩论与对抗架构(Debate / Review Architecture):生成 Agent 输出初步答案,审查 Agent(Critic Agent)进行找茬与修正,通过多轮迭代提质。
6. 高速推理部署与性能优化
大模型在线服务的吞吐量(Throughput)与首字延迟(TTFT, Time To First Token)是生产落地的生命线。
6.1 KV Cache 管理与 PagedAttention 机制
在 Transformer 自回归生成阶段,每一次生成新 Token,都需要重复计算之前所有 Token 的 Key 和 Value。为此必须缓存 KV 矩阵(KV Cache)。
然而传统的 KV Cache 显存分配方式存在严重的连续内存碎片化与过度预分配问题。
vLLM 提出的 PagedAttention 借鉴了操作系统虚拟内存(Virtual Memory)的分页思想:
- 将 KV Cache 划分为固定大小的 Block(如 16 个 Token/Block)。
- 通过 Block Table 实现逻辑内存到物理 GPU 显存的不连续映射。
- 允许显存共享(如 Parallel Sampling, Prefix Caching),大幅降低显存浪费,提高推理并发数 2~4 倍。
逻辑 Block (Sequence 1) ──┐
[Block 0] │
[Block 1] ├──────► 物理 GPU 显存 Block Pool (不连续分配)
│ [Block A] [Block B] [Block C] [Block D]
逻辑 Block (Sequence 2) ──┘
[Block 0] (共享 Prefix)
6.2 模型量化技术解析
为了将大模型部署在边缘设备或降低服务器成本,量化技术必不可少:
- Weight-Only Quantization(如 GPTQ, AWQ):
- 将权重从 FP16/BF16 量化至 INT4/INT8,计算时激活值再反量化为 FP16 进行矩阵运算。极大减少显存占用与显存带宽消耗。
- AWQ(Activation-aware Weight Quantization):保护 1% 极少数重要激活值对应的权重不被过度量化,保持了极高精度。
- GGUF / llama.cpp:
- 为 CPU 及 Apple Silicon GPU 专门设计的量化文件格式,支持 k-quants(2-bit 到 6-bit 混合量化),是终端轻量化部署的利器。
6.3 基于 vLLM 的高并发部署与 API 服务
使用 vllm 快速启动 OpenAI 兼容规范的极速 API 服务端:
# 启动 vLLM 服务端 (使用 Qwen2.5-7B-Instruct 模型,开启张量并行度 2)
python3 -m vllm.entrypoints.openai.api_server \
--model Qwen/Qwen2.5-7B-Instruct \
--tensor-parallel-size 2 \
--max-model-len 8192 \
--gpu-memory-utilization 0.90 \
--port 8000
发请求调用:
from openai import OpenAI
client = OpenAI(
api_key="EMPTY",
base_url="http://localhost:8000/v1"
)
response = client.chat.completions.create(
model="Qwen/Qwen2.5-7B-Instruct",
messages=[
{"role": "system", "content": "你是一位精通 LLM 架构的技术专家。"},
{"role": "user", "content": "请简述 PagedAttention 的核心优点。"}
],
temperature=0.7,
max_tokens=512
)
print(response.choices[0].message.content)
7. 全栈工程实战:企业级智能知识库与 Agent 混合系统代码实现
在这一章中,我们将整合前面所学知识,用纯 Python 编写一个完整可运行的企业级“RAG + Tool Agent”混合架构应用。
7.1 系统整体架构设计
[用户请求 Input]
│
▼
┌─────────────────┐
│ Agent 路由引擎 │
└────────┬────────┘
│
┌──────────────────────┴──────────────────────┐
▼ ▼
┌───────────────────────────┐ ┌───────────────────────────┐
│ 工具调用: 知识库检索 │ │ 工具调用: 实时计算工具 │
│ (RAG Pipeline Module) │ │ (Calculator Tool Module)│
└────────┬──────────────────┘ └────────┬──────────────────┘
│ │
└──────────────────────┬──────────────────────┘
│
▼
┌─────────────────┐
│ LLM 综合总结回答│
└─────────────────┘
7.2 核心全栈工程代码实现
import math
import json
from typing import List, Dict, Any
class VectorStoreRAG:
def __init__(self):
self.documents = [
{"id": "doc_1", "text": "公司规定:年假需提前3天在 HR 办公系统申请,未使用年假年底统一清零。"},
{"id": "doc_2", "text": "报销流程:差旅发票须在出差结束后 15 个工作日内提交审批,超出不予报销。"},
{"id": "doc_3", "text": "大模型部署规范:生产环境必须统一使用 vLLM 或 TensorRT-LLM 部署,严禁单卡直接用原始 HuggingFace 模型上线。"}
]
def dummy_embedding(self, text: str) -> List[float]:
val = sum(ord(c) for c in text) % 100
return [math.sin(val), math.cos(val), math.sin(val / 2), math.cos(val / 2)]
def cosine_similarity(self, v1: List[float], v2: List[float]) -> float:
dot = sum(a * b for a, b in zip(v1, v2))
norm_v1 = math.sqrt(sum(a * a for a in v1))
norm_v2 = math.sqrt(sum(b * b for b in v2))
return dot / (norm_v1 * norm_v2 + 1e-8)
def search(self, query: str, top_k: int = 1) -> List[Dict[str, Any]]:
query_vec = self.dummy_embedding(query)
results = []
for doc in self.documents:
doc_vec = self.dummy_embedding(doc["text"])
sim = self.cosine_similarity(query_vec, doc_vec)
results.append({"doc": doc, "score": sim})
results.sort(key=lambda x: x["score"], reverse=True)
return [r["doc"] for r in results[:top_k]]
def calculate_expression(expression: str) -> str:
try:
allowed = set("0123456789+-*/(). ")
if not all(c in allowed for c in expression):
return "错误:包含非法算术字符"
result = eval(expression)
return str(result)
except Exception as e:
return f"计算失败: {str(e)}"
AVAILABLE_TOOLS = {
"query_knowledge_base": None,
"calculate": calculate_expression
}
class SmartEnterpriseAgent:
def __init__(self, rag_module: VectorStoreRAG):
self.rag = rag_module
AVAILABLE_TOOLS["query_knowledge_base"] = self.rag_tool_wrapper
def rag_tool_wrapper(self, query: str) -> str:
docs = self.rag.search(query, top_k=1)
if docs:
return f"检索到的企业内部规定: [{docs[0]['text']}]"
return "未检索到相关内容。"
def parse_llm_intent(self, user_input: str) -> Dict[str, Any]:
if "假" in user_input or "报销" in user_input or "部署" in user_input:
return {
"action": "query_knowledge_base",
"action_input": user_input
}
elif any(op in user_input for op in ["+", "-", "*", "/"]):
expr = "".join([c for c in user_input if c in "0123456789+-*/()."])
return {
"action": "calculate",
"action_input": expr
}
else:
return {
"action": "direct_reply",
"action_input": None
}
def run(self, user_query: str) -> str:
print(f"\n[Agent 接收请求]: '{user_query}'")
intent = self.parse_llm_intent(user_query)
action = intent["action"]
action_input = intent["action_input"]
if action == "direct_reply":
return f"[Agent 直答]: 您好!关于 '{user_query}',我可以为您提供通用解答。"
print(f"[Agent 决策]: 检测到工具调用需求 -> 工具名: '{action}', 参数: '{action_input}'")
tool_func = AVAILABLE_TOOLS.get(action)
if not tool_func:
return f"[Agent 异常]: 未找到相关工具 {action}"
observation = tool_func(action_input)
print(f"[工具返回结果 (Observation)]: {observation}")
final_response = f"根据处理结果为您解答:\n👉 {observation}"
return final_response
if __name__ == "__main__":
print("====== 初始化企业级 RAG + Agent 系统 ======")
rag_system = VectorStoreRAG()
agent = SmartEnterpriseAgent(rag_system)
q1 = "出差发票提交有什么时间限制?"
res1 = agent.run(q1)
print(res1)
q2 = "请帮我计算一下 1024 * 8 + 512 的结果"
res2 = agent.run(q2)
print(res2)
q3 = "你好,请介绍一下你自己。"
res3 = agent.run(q3)
print(res3)
8. 总结与大模型技术未来展望
本文从底层 Transformer 的算子级优化(RoPE, GQA, FlashAttention)出发,完整阐述了大语言模型从数据预处理、分布式预训练、SFT / DPO 微调对齐,到企业级 RAG、Agent 智能体设计及 vLLM 高性能推理部署的全栈技术路径。
展望未来 1-2 年,大模型技术将在以下方向持续突破:
- Reasoning 逻辑推理能力与 Test-time Compute:以 DeepSeek-R1、OpenAI o1/o3 为代表的长链条推理(Chain-of-Thought)技术,正在将传统的训练期算力堆叠转移一部分到推理响应期,开启强化学习对齐的“第二次繁荣”。
- 端到端原生多模态(Native Multimodal):从简单的 Text-to-Text 演变为原生的 Text-Audio-Vision 统一架构(如 GPT-4o, Gemini 1.5 Pro),感知与表达边界将被彻底打破。
- 具身智能与自治 Agent:大模型将作为“大脑”更深度地与机器人、自动化流控系统整合,真正从“回答问题”走向“自主完成复杂工作流”。
技术浪潮滚滚向前,唯有立足底层原理、持续动手实践,方能在 AI 时代立于不败之地!
版权声明:本文为 CSDN/掘金技术博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接及本声明。
更多推荐
所有评论(0)