
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
提示工程是系统性设计、优化、迭代提示词的技术与方法论,属于AI交互的核心技能,无需编程基础,核心目标是通过精准指令,最大化发挥大模型能力,降低无效输出,提升结果可靠性。本质是弥合人类自然语言与AI理解逻辑的鸿沟,让AI按照人类的思考框架、需求标准输出内容,而非随机生成。提示工程不是玄学,而是有规律、可复用的科学方法,适用于ChatGPT、文心一言、通义千问、Claude等所有主流大模型。核心价值:
FastAPI 是一个现代、高性能极速的性能(可与 Node.js、Go 媲美);自动生成交互式 API 文档(Swagger UI / ReDoc);强类型支持,结合 Python 类型注解实现数据校验;异步支持,兼容同步代码;极简的语法,上手成本低。Pydantic 是 Python 中用于数据校验和设置管理自动校验输入数据的类型、格式、范围;转换数据类型(如字符串转整数、日期字符串转 dat
开源语言模型的核心价值在于“开放、灵活、可控”,而私有化部署是实现企业数据安全、业务定制化的关键路径。本次学习覆盖了开源LLM的核心知识点:从国外主流模型(Llama、Mistral等)的特性,到Hugging Face平台的工具使用,再到VLLM的推理加速原理、OpenLLM的生产级部署实践、Ollama的轻量化架构,形成了“理论-工具-实践”的完整学习链路。
1. 微调是复用预训练模型知识、适配特定任务的高效技术,核心价值是降低成本、提升任务适配性,与RAG互补,可结合使用实现更优效果。2. 微调的关键的是参数更新策略、学习率设置、数据处理和过拟合控制,主流框架以Hugging Face Transformers、PEFT为主。3. 基座模型选择需围绕任务需求,平衡模型性能、计算资源、数据条件、可解释性和社区生态,避免盲目追求大模型,优先选择“适配性强
Tokenizer:负责文本编码,必须和模型配对AutoModel:自动匹配模型结构,不用手动写网络Trainer:封装训练全流程,不用写for循环LoRA:大模型微调核心,单卡微调 7B/13B 模型固定超参:微调学习率用最优选型:PyTorch + HuggingFace Transformers + PEFT 是微调唯一最优解核心:Tokenizer 编码 → 模型加载 → LoRA 配置
对新手:一键安装、10 行代码完成微调,无需深入底层原理;对进阶开发者:支持多模型、多精度、多部署场景,满足企业级定制需求Unsloth AI;对硬件有限用户:消费级显卡即可微调大模型,降低 AI 开发门槛。
核心逻辑:微调大模型的评估,核心是“对齐场景、量化指标、定位短板、指导迭代”,避免过度追求单一指标(如准确率),忽略性能、鲁棒性与合规性;关键原则:测试集与训练集必须独立,确保评估结果真实可靠;多次实验取平均,进行显著性检验,保证结果可复现;工具使用:无需追求“多而全”,根据微调场景与评估目标选择1-2套核心工具,熟练掌握其核心功能即可;实践重点:评估不是“一次性工作”,需融入“微调-评估-优化”
1. 核心逻辑:LoRA及其改进算法的核心都是“参数高效微调”,通过冻结原始模型权重、训练少量辅助参数(低秩矩阵、量化参数等),在降低算力/显存开销的同时,实现下游任务适配,避免“灾难性遗忘”。2. 算法对比:LoRA是基础框架,AdaLoRA优化“秩分配”、QLoRA优化“显存占用”、LongLoRA优化“长上下文适配”,三者各有侧重,可根据任务需求(性能、资源、序列长度)选择合适的算法。
核心占用部分:总显存 ≈ 固定显存 + 动态显存。其中固定显存包括模型参数、梯度、优化器状态,动态显存包括激活值、临时缓存及解码器模型特有的KV缓存(用于自回归生成时缓存键值对,降低重复计算)。模型参数显存:与参数量和精度直接相关,例如FP32精度下每个参数占用4字节,FP16占用2字节,FP8占用1字节,INT4仅占用0.5字节;以Llama2 7B模型为例,FP16格式下参数显存约14GB,量
AWQ:轻量、激活感知、端侧友好,低比特(3/4bit)精度更优,量化快、适配边缘设备。GPTQ:精准、二阶优化、生态成熟,云端部署首选,4bit 量化几乎无损,稳定性极强。







