
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
如果以上语句无法执行成功,则执行语句“git config -global -e"此时push就会需要输入username 和password;git config –global –unset 此时执行git push 即可成功。1.删除全局配置信息。将全局配置信息删除;

核心思想:降低模型权重的数值精度,从 FP32 → FP16/BF16 → INT8 → INT4,大幅减少显存占用。核心思想:将一个大模型的层或参数切分到多个 GPU 上,每张卡只存储一部分模型。核心思想:不保存所有中间激活值,反向传播时重新计算,大幅降低训练时的显存占用。显存减半(FP32 7B 模型约 28GB → FP16 约 14GB)显存节省 50%~80%,但训练速度降低 20%~3
监督微调(Supervised Fine-Tuning, SFT)是大语言模型(LLM)对齐技术中的基础且关键的一步。它是在预训练模型的基础上,使用人工标注的数据对模型进行有监督训练,使其学会遵循指令、生成高质量的回答。
高效微调(PEFT)是指在不修改原始大模型参数或仅训练少量新增参数的前提下,使模型适应下游任务的技术。它解决了全参数微调(Full Fine-Tuning)显存消耗大、成本高的问题。
x_out = x_in + F(x_in) # F 是一个子网络(如 Attention 或 FFN)x_in是输入(来自上一层)F(x_in)是变换后的输出(如注意力计算结果)目标:让x_out和x_in在同一个“数量级”上,这样梯度可以顺畅回传(避免梯度消失/爆炸)💡 如果F(x_in)的输出量级是1e-3,而x_in是1e+2,那么:→ 梯度几乎全来自x_inF(x_in)的梯度被淹没
大模型参数量巨大(如 LLaMA-7B 有 70 亿参数),且 NLP 任务中 embedding 层梯度极度稀疏(仅少数 token 被激活)。Adam 结合了一阶动量(类似 SGD with momentum)和二阶动量(类似 RMSProp),在训练初期能快速穿越平坦区域,加速收敛。Adam 内置动量(momentum) + 自适应学习率,对初始学习率不敏感,开箱即用,大幅降低调参成本。✅关
OCR 大模型(如 GPT-4V、Qwen-VL、Donut、Pix2Struct、LLaVA-Document 等)在处理多页文档(如 PDF、扫描册子、合同、报告)时,面临核心挑战:上下文长度限制(如 LLM 仅支持 4K–32K tokens)与跨页语义连贯性。
对于 decode only 的 Transformer 架构,我们给一个输入文本,模型会输出一个回答(长度为 N),每一步根据之前 token 生成下一个 token,也就是每次推理只输出一个 token,输出的 token 会与输入 token 拼接在一起,然后作为下一次推理的输入,这样不断反复直到遇到终止符。因此,减少 KV Cache 的目的是为了在更少的设备上推理更长的 Context,
大模型参数量巨大(如 LLaMA-7B 有 70 亿参数),且 NLP 任务中 embedding 层梯度极度稀疏(仅少数 token 被激活)。Adam 结合了一阶动量(类似 SGD with momentum)和二阶动量(类似 RMSProp),在训练初期能快速穿越平坦区域,加速收敛。Adam 内置动量(momentum) + 自适应学习率,对初始学习率不敏感,开箱即用,大幅降低调参成本。✅关
OCR 大模型(如 GPT-4V、Qwen-VL、Donut、Pix2Struct、LLaVA-Document 等)在处理多页文档(如 PDF、扫描册子、合同、报告)时,面临核心挑战:上下文长度限制(如 LLM 仅支持 4K–32K tokens)与跨页语义连贯性。







