
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文为开发者提供一份实用指南,演示如何利用与华为 CANN的对接能力,将通用 ONNX 模型快速部署到昇腾 AI 处理器(NPU)上进行高效推理。通过标准化的中间格式和高效的执行提供者,实现一次导出、多处部署,是拥抱国产 AI 硬件生态的便捷路径。什么是 ONNX Runtime CANN?是一个跨平台的高性能推理引擎,支持多种硬件后端。CANN是华为昇腾 AI 处理器的计算架构。两者的结合点在于

在实际开发中,我们通常使用 PyTorch 训练模型,并通过将其导出为 ONNX 格式,以便在不同框架或推理引擎中部署。然而,有时我们只拥有 ONNX 模型文件,却丢失了原始的 PyTorch 代码或权重文件。此时,如何将 ONNX 模型逆向转换回 PyTorch 格式,便成为一个实际需求。本文将介绍社区中可行的转换方案及其注意事项。ONNX 转 PyTorch 虽无官方支持,但借助社区工具可以解

MinerU是一个高质量的开源工具,能够将包含图片、表格、公式等元素的多模态PDF文档转化为清晰、易于分析的Markdown格式,同时也支持从包含广告等干扰信息的网页中快速解析、抽取正式内容,并将其批量转化为Markdown格式,本文基于昇腾平台,针对 MinerU 的多个核心模块进行适配与优化,旨在提升整体推理效率。

MinerU是一个高质量的开源工具,能够将包含图片、表格、公式等元素的多模态PDF文档转化为清晰、易于分析的Markdown格式,同时也支持从包含广告等干扰信息的网页中快速解析、抽取正式内容,并将其批量转化为Markdown格式,本文基于昇腾平台,针对 MinerU 的多个核心模块进行适配与优化,旨在提升整体推理效率。

MinerU是一个高质量的开源工具,能够将包含图片、表格、公式等元素的多模态PDF文档转化为清晰、易于分析的Markdown格式,同时也支持从包含广告等干扰信息的网页中快速解析、抽取正式内容,并将其批量转化为Markdown格式,本文基于昇腾平台,针对 MinerU 的多个核心模块进行适配与优化,旨在提升整体推理效率。

模型服务化是将训练好的模型包装成一个可以通过网络访问的标准化服务的过程。将模型部署在一个专门的服务中,而其他的程序不需要关心模型所有的细节,只需要通过网络协议(HTTP/gRPC) 发送数据并且接收预测结果即可。Triton Inference Server 是一个开源的高性能推理服务框架,支持 TensorFlow、PyTorch、ONNX 等多种模型,并可在 GPU、CPU 和 NPU 等异构

模型服务化是将训练好的模型包装成一个可以通过网络访问的标准化服务的过程。将模型部署在一个专门的服务中,而其他的程序不需要关心模型所有的细节,只需要通过网络协议(HTTP/gRPC) 发送数据并且接收预测结果即可。Triton Inference Server 是一个开源的高性能推理服务框架,支持 TensorFlow、PyTorch、ONNX 等多种模型,并可在 GPU、CPU 和 NPU 等异构

:昇腾实战派。

:昇腾实战派。

精度问题一直是AI领域中的难点问题,小模型领域模型数量繁多、模型种类多样,推理技术路线多样,精度问题的原因五花八门,定位时间通常较长。本文对小模型推理精度问题做了系统性的抽象,进行剖析和整理,试图建立一个结构性的框架来讨论小模型精度问题,也便于初学者对整个小模型精度领域建立起基本的概念。








