logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

小模型在昇腾NPU上的推理部署:【MinerU 性能调优】

MinerU是一个高质量的开源工具,能够将包含图片、表格、公式等元素的多模态PDF文档转化为清晰、易于分析的Markdown格式,同时也支持从包含广告等干扰信息的网页中快速解析、抽取正式内容,并将其批量转化为Markdown格式,本文基于昇腾平台,针对 MinerU 的多个核心模块进行适配与优化,旨在提升整体推理效率。

文章图片
#pytorch#人工智能#python +1
小模型在昇腾NPU上的推理部署:【MinerU 性能调优】

MinerU是一个高质量的开源工具,能够将包含图片、表格、公式等元素的多模态PDF文档转化为清晰、易于分析的Markdown格式,同时也支持从包含广告等干扰信息的网页中快速解析、抽取正式内容,并将其批量转化为Markdown格式,本文基于昇腾平台,针对 MinerU 的多个核心模块进行适配与优化,旨在提升整体推理效率。

文章图片
#pytorch#人工智能#python +1
小模型在昇腾NPU上的推理部署:【Triton-NPU初了解与使用】

模型服务化是将训练好的模型包装成一个可以通过网络访问的标准化服务的过程。将模型部署在一个专门的服务中,而其他的程序不需要关心模型所有的细节,只需要通过网络协议(HTTP/gRPC) 发送数据并且接收预测结果即可。Triton Inference Server 是一个开源的高性能推理服务框架,支持 TensorFlow、PyTorch、ONNX 等多种模型,并可在 GPU、CPU 和 NPU 等异构

文章图片
#macos#xcode#pytorch +1
小模型在昇腾NPU上的推理部署:【Triton-NPU初了解与使用】

模型服务化是将训练好的模型包装成一个可以通过网络访问的标准化服务的过程。将模型部署在一个专门的服务中,而其他的程序不需要关心模型所有的细节,只需要通过网络协议(HTTP/gRPC) 发送数据并且接收预测结果即可。Triton Inference Server 是一个开源的高性能推理服务框架,支持 TensorFlow、PyTorch、ONNX 等多种模型,并可在 GPU、CPU 和 NPU 等异构

文章图片
#macos#xcode#pytorch +1
小模型在昇腾NPU上的推理部署:【小模型推理精度问题定位系统方法论】

精度问题一直是AI领域中的难点问题,小模型领域模型数量繁多、模型种类多样,推理技术路线多样,精度问题的原因五花八门,定位时间通常较长。本文对小模型推理精度问题做了系统性的抽象,进行剖析和整理,试图建立一个结构性的框架来讨论小模型精度问题,也便于初学者对整个小模型精度领域建立起基本的概念。

文章图片
#人工智能
小模型在昇腾NPU上的推理部署:【小模型推理精度问题定位系统方法论】

精度问题一直是AI领域中的难点问题,小模型领域模型数量繁多、模型种类多样,推理技术路线多样,精度问题的原因五花八门,定位时间通常较长。本文对小模型推理精度问题做了系统性的抽象,进行剖析和整理,试图建立一个结构性的框架来讨论小模型精度问题,也便于初学者对整个小模型精度领域建立起基本的概念。

文章图片
#人工智能
小模型在昇腾NPU上的推理部署:【基于昇腾 NPU 的 OCR 业务系统性能优化实践】

在将多模态OCR业务从GPU迁移至昇腾NPU的过程中,由于硬件架构的差异,原有推理链路在性能和资源管理方面出现了新的瓶颈。本文基于一套五层架构的文档解析系统,详细记录了在昇腾NPU环境下的性能调优过程,涵盖推理调用结构重组、并发模型重构以及底层内存分配策略调整。通过一系列优化,最终在单卡单进程场景下实现了显著的性能提升和资源优化。该文档解析系统采用流水线架构,核心功能是对PDF或图片进行版面分析,

文章图片
#性能优化#人工智能#机器学习 +2
小模型在昇腾NPU上的推理部署:【基于昇腾 NPU 的 OCR 业务系统性能优化实践】

在将多模态OCR业务从GPU迁移至昇腾NPU的过程中,由于硬件架构的差异,原有推理链路在性能和资源管理方面出现了新的瓶颈。本文基于一套五层架构的文档解析系统,详细记录了在昇腾NPU环境下的性能调优过程,涵盖推理调用结构重组、并发模型重构以及底层内存分配策略调整。通过一系列优化,最终在单卡单进程场景下实现了显著的性能提升和资源优化。该文档解析系统采用流水线架构,核心功能是对PDF或图片进行版面分析,

文章图片
#性能优化#人工智能#机器学习 +2
    共 54 条
  • 1
  • 2
  • 3
  • 6
  • 请选择