logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

DeepSeek-R1本地部署实战:Ollama+MacBook M2全链路指南

大语言模型本地运行是AI工程落地的关键环节,其核心在于模型格式转换、推理引擎适配与硬件资源协同。基于GGUF量化格式的轻量级推理框架(如Ollama)显著降低了消费级设备部署门槛,兼顾性能与易用性。DeepSeek-R1作为具备强推理能力的开源模型,在代码理解、数学推理与长上下文处理方面表现突出,成为开发者本地化实践的热门选择。本文围绕MacBook M2平台,详解从模型获取、GGUF格式转换、O

#Ollama
Grok-3技术解析:MoE架构、128K上下文与MMLU-Pro实测

大语言模型(LLM)的稀疏专家混合(MoE)架构正成为提升推理效率与模型规模的关键路径。其核心原理在于动态激活部分参数子集,在控制计算开销的同时扩展总参数量。这一技术显著提升了长上下文理解能力与多任务泛化性能,广泛应用于AI助手、企业知识引擎与代码生成等场景。以xAI发布的Grok-3为例,该模型采用真实部署的MoE设计,支持128K上下文长度,并在MMLU-Pro基准上取得78.3%准确率,体现

GPT-4的2%参数激活真相:MoE稀疏性原理与工程实践

混合专家(MoE)是大模型突破显存墙与算力瓶颈的核心架构,其本质并非简单减少参数,而是通过动态路由实现计算稀疏性。原理上,Router网络基于语义特征对token进行领域感知匹配,按需激活少量专家子集,从而在保持模型容量的同时显著降低FLOPs消耗。技术价值体现在三重平衡:高精度语义路由、低开销负载均衡、可控的计算稀疏度(如常提的‘2%’实为FLOPs占比而非参数占比)。典型应用场景包括千亿级模型

从Hugging Face到本地:PyTorch版BERT-base-chinese模型文件获取与部署实战

本文详细介绍了如何从Hugging Face获取PyTorch版BERT-base-chinese模型文件并进行本地部署。内容包括模型文件下载、目录结构组织、本地加载方法以及常见问题排查,帮助开发者实现稳定高效的离线模型应用,特别适合需要处理敏感数据或网络不稳定的企业场景。

目标检测损失函数演进史:从IoU到Shape-IoU,我们到底在优化什么?

本文深入解析了目标检测损失函数从IoU到Shape-IoU的演进历程,揭示了优化边界框匹配的核心逻辑。Shape-IoU通过引入形状敏感权重,显著提升了检测精度,特别是在小目标场景中表现突出。文章对比了不同损失函数的性能差异,并提供了实践选择策略,为计算机视觉研究者提供了重要参考。

#目标检测#计算机视觉
别再只调API了!用PyTorch从零复现Facenet,搞懂人脸识别背后的度量学习

本文深入解析如何用PyTorch从零实现Facenet人脸识别系统,重点探讨度量学习与Triplet Loss机制。通过实战代码展示特征空间优化、网络架构选择及训练策略,帮助开发者超越API调用,真正掌握人脸识别核心技术。

#人脸识别
别再死记ResNet18结构图了!用PyTorch代码逐层打印输入输出尺寸,彻底搞懂残差连接

本文通过PyTorch代码动态分析ResNet18的网络结构,重点解析残差连接的维度变化。利用hook机制实时追踪每层输入输出尺寸,帮助开发者直观理解下采样、通道调整等关键操作,彻底掌握CNN经典架构的设计精髓。

大模型量化实战:从INT8到INT4的工程落地指南

模型量化是将高精度浮点模型(如FP32)压缩为低比特整数表示(如INT8、INT4)以适配内存受限硬件的关键技术。其核心原理在于在数值表示位宽约束下,对权重与激活分布进行有损但可控的离散化映射,平衡精度损失与计算效率。该技术具备显著的工程价值:可降低70%以上显存占用、提升1.5–2倍推理吞吐,并支持边缘端部署。典型应用场景包括笔记本本地运行大语言模型、车载SoC实时推理、以及云上高并发API服务

手把手构建行业大模型:从数据清洗到私有部署的全流程实战

领域大模型不是通用AI的简单微调,而是将垂直行业知识结构化、可计算化、可审计化的工程实践。其核心原理在于复用开源基座的通用能力,通过高质量领域数据注入、LoRA/QLoRA参数高效适配与业务闭环评估,实现专业深度超越通用广度。技术价值体现在可控性(数据不出域)、精准性(关键决策点准确率>85%)与嵌入性(无缝对接CRM/ERP等现有系统)。典型应用场景覆盖法律合同审查、医疗病历结构化、制造业故障归

单卡微调大模型实战:Gradient Checkpointing、LoRA与Quantization协同优化

大语言模型(LLM)微调面临显存爆炸、训练缓慢与部署困难三重瓶颈。其本质是前向激活存储、参数更新开销与模型体积之间的系统性矛盾。Gradient Checkpointing通过时间换空间降低内存峰值,LoRA以低秩适配器冻结主干实现高效参数更新,Quantization(尤其是AWQ/QLoRA)则从权重精度维度压缩模型体积并支持可训练推理。三者协同并非简单叠加,而是分层解耦:量化奠定轻量基础,L

#LoRA
    共 163 条
  • 1
  • 2
  • 3
  • 17
  • 请选择