1、Transformer结构:

分词器(Tokenizer)、注意力机制(MHA/GQA/稀疏注意力/kvcache)、FFN/残差连接/LN、位置编码器(RoPE/ALiBi)、模型结构类型(encoder/decoder)、解码策略(top-k/top-p/DPO)

2、主流大模型:

BERT/GPT/Llama/Qwen/GLM/Baichuan/DeepSeek(发展脉络+核心优化点)

3、预训练:

预训练任务、数据筛选/配比、合成数据

4、后训练:

SFT(PFET方法)、RLHF/DPO/RLAIF/SimPO等对齐方法

5、模型压缩量化

GPTQ/AWQ、量化精度、显存计算

6、MoE:

结构原理、训练思路

7、RAG&Agent:

RAG流程、LangChain、Agent框架(ReAct)

8、部署&加速:

vllm/flash attention、Deepspeed、多端部署

9、模型评估:

Bencmark、幻觉检测

10、其他结构:

Manba、RWKV

更多推荐