logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型格式转换全解析:从训练到部署的完整技术路线与最佳实践

大模型格式转换是连接训练与部署的核心技术环节。本文从技术原理、实现方案和性能优化三个维度,系统剖析了safetensors、ONNX、GGUF等主流格式的底层机制与转换策略。重点分析了计算图优化、量化压缩(Q4_K_M/Q5_K_M)等关键技术,对比了不同格式在训练存储、中间转换和推理部署阶段的适用场景。针对CPU/GPU不同硬件平台,提供了完整的格式转换技术路线,包括环境配置、模型验证、量化策略

文章图片
#人工智能
大模型推理部署框架深度解析:核心技术原理与实践指南

大模型推理部署面临算力成本高、响应延迟和吞吐量瓶颈等挑战。本文系统分析了主流推理框架的核心技术,包括KV Cache缓存优化、PagedAttention分页管理、Continuous Batching批处理、推测解码和量化技术等,显著提升了推理效率。重点介绍了vLLM等框架如何通过创新架构实现显存利用率从40%提升至95%以上,吞吐量增加3-10倍。文章还探讨了Prefill-Decode分离架

文章图片
#语言模型#transformer
本地大模型部署指南:16G/32G/64GB内存配置全解析(附最新模型速查表)

本文针对不同内存配置(16GB/32GB/64GB)提供了本地大模型选型指南。16GB设备推荐2B-9B量级模型如Qwen3.5 9B,32GB可运行27B-35B级别模型如Qwen3.5 27B,64GB则能驾驭70B级旗舰模型和视觉多模态应用。文章详细列出了各场景下的最优模型组合,并解释了GGUF量化等级的选择策略,帮助用户根据硬件条件平衡模型性能与推理质量。

文章图片
#人工智能#语言模型#milvus
大模型量化技术实战指南

大模型量化技术综述:从理论到实践 本文系统介绍了大语言模型量化技术的关键原理与实践方法。首先分析了量化技术对大模型落地的重要性,指出量化可将70B参数模型的显存需求从140GB压缩至35GB,实现消费级显卡部署。文章详细阐述了浮点数(FP32/FP16/FP8)和定点数(INT8/INT4)的数值表示原理,以及量化映射的数学本质。随后深入对比了PTQ(后训练量化)和QAT(量化感知训练)两大技术流

文章图片
#人工智能#系统架构
Python 大厂面试题库 100 道 · 职场开发必备

高频考点闭眼都要过一遍——可变与不可变对象区别、装饰器写法、生成器与迭代器原理、GIL是什么、深拷贝浅拷贝、*args/**kwargs、闭包。数据结构上,列表字典的底层实现、哈希冲突解决,基本必问。算法至少刷到LeetCode中等,重点是双指针、滑动窗口、二叉树遍历。

文章图片
#python#fastapi#numpy +2
Agent Skills 深度解析:AI 编码代理的工程化生产级工作流引擎

Agent Skills 是一套由 Addy Osmani 设计的工程化框架,旨在解决当前 AI 编码代理的短视化开发问题(如跳过测试、忽视安全)。该框架通过标准化工作流、质量门禁和反合理化机制,强制 AI 代理遵循生产级研发流程,输出工业级代码。其核心架构包括六阶段研发生命周期(定义、规划、构建、验证、审查、交付)、20 项结构化技能(如规格驱动开发、TDD、安全加固)及七层命令映射体系(如 /

文章图片
#人工智能#面试#深度学习
多 AI 编码工具技能乱套?skills-manage 一站式统一管理全平台 Agent Skills

AI技能管理神器skills-manage重磅发布!这款开源桌面工具通过中央技能库+软链接同步技术,彻底解决多AI平台技能管理难题。核心功能包括:1)统一管理20+主流AI编码工具技能;2)可视化查看、安装/卸载技能;3)支持本地项目、GitHub和市场多渠道导入;4)技能集合批量管理。采用Tauri框架开发,具有轻量高性能、隐私安全、跨平台等特点,支持macOS/Windows/Linux系统。

文章图片
#人工智能
大模型格式转换全解析:从训练到部署的完整技术路线与最佳实践

大模型格式转换是连接训练与部署的核心技术环节。本文从技术原理、实现方案和性能优化三个维度,系统剖析了safetensors、ONNX、GGUF等主流格式的底层机制与转换策略。重点分析了计算图优化、量化压缩(Q4_K_M/Q5_K_M)等关键技术,对比了不同格式在训练存储、中间转换和推理部署阶段的适用场景。针对CPU/GPU不同硬件平台,提供了完整的格式转换技术路线,包括环境配置、模型验证、量化策略

文章图片
#人工智能
本地大模型部署指南:16G/32G/64GB内存配置全解析(附最新模型速查表)

本文针对不同内存配置(16GB/32GB/64GB)提供了本地大模型选型指南。16GB设备推荐2B-9B量级模型如Qwen3.5 9B,32GB可运行27B-35B级别模型如Qwen3.5 27B,64GB则能驾驭70B级旗舰模型和视觉多模态应用。文章详细列出了各场景下的最优模型组合,并解释了GGUF量化等级的选择策略,帮助用户根据硬件条件平衡模型性能与推理质量。

文章图片
#人工智能#语言模型#milvus
LlamaIndex索引类型全解析:原理与实战指南

本文深入解析了LlamaIndex的14种索引类型,重点介绍了最常用的VectorStoreIndex、SummaryIndex、TreeIndex和KeywordTableIndex四种索引。VectorStoreIndex基于向量相似度检索,适用于90%的RAG场景;SummaryIndex通过遍历所有内容实现简单汇总;TreeIndex采用分层摘要树结构,适合大规模文档;KeywordTab

文章图片
#服务器#运维
    共 49 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择