
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
Agents(智能体)并非单一的大模型工具,而是一套以目标为导向、具备自主能力的智能系统,核心是将大模型的推理能力与记忆、规划、工具调用等模块结合,实现“感知-思考-行动-反馈”的闭环,无需人类持续干预即可完成复杂任务。简单来说,普通大模型是“能回答问题的大脑”,而 Agents 是“能自主解决问题的完整智能体”,可类比为“数字员工”,能主动适配环境、调整策略,完成端到端的任务。自主性。
1. 微调是复用预训练模型知识、适配特定任务的高效技术,核心价值是降低成本、提升任务适配性,与RAG互补,可结合使用实现更优效果。2. 微调的关键的是参数更新策略、学习率设置、数据处理和过拟合控制,主流框架以Hugging Face Transformers、PEFT为主。3. 基座模型选择需围绕任务需求,平衡模型性能、计算资源、数据条件、可解释性和社区生态,避免盲目追求大模型,优先选择“适配性强
Tokenizer:负责文本编码,必须和模型配对AutoModel:自动匹配模型结构,不用手动写网络Trainer:封装训练全流程,不用写for循环LoRA:大模型微调核心,单卡微调 7B/13B 模型固定超参:微调学习率用最优选型:PyTorch + HuggingFace Transformers + PEFT 是微调唯一最优解核心:Tokenizer 编码 → 模型加载 → LoRA 配置
对新手:一键安装、10 行代码完成微调,无需深入底层原理;对进阶开发者:支持多模型、多精度、多部署场景,满足企业级定制需求Unsloth AI;对硬件有限用户:消费级显卡即可微调大模型,降低 AI 开发门槛。
1. 三种技术的核心共性:均遵循PEFT“冻结主干、微调少量参数”的核心思想,旨在平衡模型性能与训练/部署成本,避免全量微调的参数冗余和算力浪费。2. 技术选择逻辑:根据任务类型、模型规模和算力资源选择——非生成任务(分类、序列标注)优先选Adapter Tuning;大模型快速适配、简单任务优先选Prompt Tuning;生成任务、小模型高性能适配优先选Prefix Tuning。
核心逻辑:微调大模型的评估,核心是“对齐场景、量化指标、定位短板、指导迭代”,避免过度追求单一指标(如准确率),忽略性能、鲁棒性与合规性;关键原则:测试集与训练集必须独立,确保评估结果真实可靠;多次实验取平均,进行显著性检验,保证结果可复现;工具使用:无需追求“多而全”,根据微调场景与评估目标选择1-2套核心工具,熟练掌握其核心功能即可;实践重点:评估不是“一次性工作”,需融入“微调-评估-优化”
1. 核心逻辑:LoRA及其改进算法的核心都是“参数高效微调”,通过冻结原始模型权重、训练少量辅助参数(低秩矩阵、量化参数等),在降低算力/显存开销的同时,实现下游任务适配,避免“灾难性遗忘”。2. 算法对比:LoRA是基础框架,AdaLoRA优化“秩分配”、QLoRA优化“显存占用”、LongLoRA优化“长上下文适配”,三者各有侧重,可根据任务需求(性能、资源、序列长度)选择合适的算法。
核心占用部分:总显存 ≈ 固定显存 + 动态显存。其中固定显存包括模型参数、梯度、优化器状态,动态显存包括激活值、临时缓存及解码器模型特有的KV缓存(用于自回归生成时缓存键值对,降低重复计算)。模型参数显存:与参数量和精度直接相关,例如FP32精度下每个参数占用4字节,FP16占用2字节,FP8占用1字节,INT4仅占用0.5字节;以Llama2 7B模型为例,FP16格式下参数显存约14GB,量
AWQ:轻量、激活感知、端侧友好,低比特(3/4bit)精度更优,量化快、适配边缘设备。GPTQ:精准、二阶优化、生态成熟,云端部署首选,4bit 量化几乎无损,稳定性极强。
将模型的高精度参数(FP32/FP16/BF16)转换为低精度参数(INT8/INT4)减少模型显存占用(INT4 比 FP16 小 75%)提升推理速度、降低算力消耗保持模型精度尽可能接近原始模型模型训练完成后,直接进行量化,不修改模型权重原始分布,仅做精度转换 + 校准。训练中模拟量化噪声,让模型适应低精度,是精度最优的量化方案。PTQ:训练后量化,零训练成本、速度快,适合快速落地QAT:量化







