大模型相关的概念
·
1、Transformer结构:
分词器(Tokenizer)、注意力机制(MHA/GQA/稀疏注意力/kvcache)、FFN/残差连接/LN、位置编码器(RoPE/ALiBi)、模型结构类型(encoder/decoder)、解码策略(top-k/top-p/DPO)
2、主流大模型:
BERT/GPT/Llama/Qwen/GLM/Baichuan/DeepSeek(发展脉络+核心优化点)
3、预训练:
预训练任务、数据筛选/配比、合成数据
4、后训练:
SFT(PFET方法)、RLHF/DPO/RLAIF/SimPO等对齐方法
5、模型压缩量化
GPTQ/AWQ、量化精度、显存计算
6、MoE:
结构原理、训练思路
7、RAG&Agent:
RAG流程、LangChain、Agent框架(ReAct)
8、部署&加速:
vllm/flash attention、Deepspeed、多端部署
9、模型评估:
Bencmark、幻觉检测
10、其他结构:
Manba、RWKV
更多推荐
所有评论(0)