
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文展示了如何使用unsloth库对Gemma-3-4B模型进行微调。代码首先加载本地已下载的4bit量化模型,然后通过FastVisionModel.from_pretrained函数检查模型架构,自动判断是否为视觉语言模型(VLM)并选择相应的处理器。模型加载后,用户配置LoRA参数,包括是否微调视觉层、语言层等模块,并设置相关超参数。内部逻辑通过正则表达式匹配需要微调的模块名称,最终将这些模
本文探讨了注意力机制的发展与优化,重点分析了多头注意力(MHA)、多查询注意力(MQA)和分组查询注意力(GQA)的特点及适用场景。同时介绍了阿里Qwen3-Next-80B-A3B模型采用的创新混合注意力机制,该机制结合标准注意力与改进的线性注意力,通过Gated DeltaNet和门控机制解决线性注意力在全局特征捕捉上的不足。其中,线性注意力利用核函数和矩阵结合律将复杂度降至O(L),而Del
摘要: 正则化技术是防止大模型过拟合的关键方法,主要包括L2正则化和Dropout两种核心机制。L2正则化通过在损失函数中增加权重平方惩罚项,迫使模型参数变小,从而获得更平滑、泛化能力更强的解。Dropout则通过随机屏蔽神经元,打破神经元间的共适应关系,等效训练多个子模型集成。两者从不同角度提升模型鲁棒性:L2正则化约束参数空间,Dropout改变网络结构。现代实现多采用Inverted Dro
本文系统梳理了工业级Agent模型蒸馏与数据合成的技术闭环,主要包含五大核心维度: Agent蒸馏范式:对比动态轨迹蒸馏(工业界主流)与静态指令蒸馏的优缺点,强调真实环境交互对逻辑迁移的关键作用。 两阶段训练演进:提出"静态虚拟轨迹冷启动→真实环境轨迹精调"的渐进策略,并设计三层防御机制解决虚拟/真实数据间的知识冲突问题。 自动化数据采集Pipeline:构建包含用户模拟器与环境校验器的自动化系统
本文系统梳理了工业级Agent模型蒸馏与数据合成的技术闭环,主要包含五大核心维度: Agent蒸馏范式:对比动态轨迹蒸馏(工业界主流)与静态指令蒸馏的优缺点,强调真实环境交互对逻辑迁移的关键作用。 两阶段训练演进:提出"静态虚拟轨迹冷启动→真实环境轨迹精调"的渐进策略,并设计三层防御机制解决虚拟/真实数据间的知识冲突问题。 自动化数据采集Pipeline:构建包含用户模拟器与环境校验器的自动化系统
摘要: 本文详细解析了nanochat大模型项目的训练设置与关键技术点。核心训练参数包括:矩阵学习率(0.02)实现参数差异化更新、梯度裁剪(阈值1.0)防止梯度爆炸、学习率调度(final_lr_frac=0.0)实现动态调整。模型采用meta设备初始化高效部署,支持混合精度(BF16)加速训练。训练轮数通过三级策略确定:直接指定>目标FLOPs计算>数据-参数比例计算,其中目标参数比(如Chi
RAG优化核心要点 文档分块原因:突破模型窗口限制,提升检索精度和效率,避免信息过载。通过重叠分块、添加上下文头信息、结构化分层和多块召回解决上下文缺失问题。采用层级检索、父子块关联和图谱RAG处理跨片段依赖。 检索效果优化:调整分块策略(大小/重叠/语义切分),清洗索引内容,采用混合检索(向量+关键词)。优化查询端(改写/上下文增强)和召回排序(增加召回数+重排序)。选择合适索引类型并调整参数。
vLLM是一个高效的大语言模型推理开源工具,采用PagedAttention和连续批处理技术提升显存利用率和推理效率。实验显示在14GB显存显卡上运行Qwen3-VL-4B-Instruct模型时,合理配置max-model-len等参数可优化资源使用。建议max-num-seqs设为1-2,gpu-memory-utilization设为0.95,避免使用cpu-offload-gb等影响性能的
文章摘要:在更新ollama时遇到下载失败问题,通过分析安装脚本发现下载逻辑集中在download_and_extract函数。解决方案是修改该函数以支持使用本地预下载的ollama文件(.tar.zst或.tgz格式),通过设置LOCAL_OLLAMA_PATH环境变量指定文件路径即可。该方法也适用于安装后的更新操作。另提到运行gemma4:26b模型需要约14GB显存和10GB内存,建议降低上








