logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【RK3588S 嵌入式AI系列⑦】多线程异步推理:榨干三核NPU的6 TOPS算力

【摘要】本文深入讲解RK3588S三核NPU的多线程推理优化。揭示默认单实例只用一个核心的根本原因,提出两大策略:1)单模型三核并发,通过rknn_set_core_mask设置RKNN_NPU_CORE_0_1_2,单次推理延迟降低约40%;2)多模型多实例并发,三线程各绑一核,三路视频总吞吐提升3倍。给出完整的生产级C++多线程推理框架代码,含任务队列、条件变量同步、回调式异步API用法。附r

#性能优化
【RK3588S 嵌入式AI系列⑧】RGA零拷贝图像加速:1080P预处理从12ms压到1ms内

【摘要】本文讲解RK3588S RGA硬件加速器的零拷贝图像预处理方案。对比CPU软件实现,RGA将1080P resize+格式转换从12ms压缩至1ms内,提升超10倍。详解imresize/improcess API实现resize、裁剪、旋转、格式转换的组合调用;通过DMA Buffer fd打通摄像头→RGA→NPU全硬件直通链路,彻底消除CPU memcpy开销;演示RKNN推理直接读

#图像处理#性能优化
【RK3588S 嵌入式AI系列③】RKNN SDK快速上手:第一个NPU推理程序全流程

【RK3588S NPU推理开发实战:MobileNetV2图像分类全流程】 本文是RK3588S NPU开发系列第三篇,完整演示从模型转换到板端推理的全流程: 开发流程 PC端(Ubuntu):使用RKNN-Toolkit2将PyTorch/ONNX模型转换为.rknn格式(含INT8量化) 板端(RK3588S):通过C++调用librknnrt.so实现高效推理 关键实现步骤 导出Mobil

#c++#边缘计算
【RK3588S 嵌入式AI系列②】Linux开发环境从零搭建:交叉编译工具链 + SDK + VSCode远程调试全攻略

本文详解 RK3588S 嵌入式 AI 开发环境的完整搭建流程。涵盖:1)交叉编译工具链(aarch64-none-linux-gnu)安装与验证;2)RKNN-Toolkit2 SDK 目录结构解析,厘清 PC 端工具与板端运行时库的分工;3)ADB/SSH 连接板子,将 librknnrt.so 部署到目标设备;4)VSCode Remote-SSH 远程开发配置,实现"编译→推板→运行"一键

【RK3588S 嵌入式AI系列④】模型转换全流程:PyTorch/TFLite/PaddlePaddle → RKNN 实战指南

本文系统梳理 RK3588S RKNN-Toolkit2 的模型转换全流程,覆盖三大主流框架:1)PyTorch→ONNX→RKNN,重点说明 opset 版本选择、动态 shape 关闭、onnxsim 简化等关键细节;2)TFLite→RKNN 直接加载路径;3)PaddlePaddle→ONNX→RKNN,含 paddle2onnx 工具使用。重点解析"算子不支持"问题的四种解决策略:模型切

【RK3588S 嵌入式AI系列①】硬件全解析:NPU/CPU/GPU架构与芯片选型指南

【摘要】本文深度解析RK3588S芯片硬件架构,为嵌入式AI开发打下坚实基础。重点剖析三大核心模块:1)CPU采用4xA76+4xA55大小核设计,需注意线程绑定策略;2)NPU三核异构架构(6TOPS INT8),揭示单核/多核调度的关键技术;3)内存带宽瓶颈分析及零拷贝优化方案。特别强调RGA硬件加速器在图像预处理中的关键作用(1080P缩放在1ms内完成)。通过对比RK3568等竞品,提供芯

文章图片
【RK3588S 嵌入式AI系列⑤】INT8量化实战:原理、校准集选择与精度调优全攻略

【摘要】本文深入剖析RK3588S NPU INT8量化的数学原理与实践。从scale/zero_point映射出发,讲解量化误差来源;详解校准集选择四条原则(数量、分布代表性、边缘场景覆盖、类别均衡);对比normal/mmse/kl_divergence三种量化算法取舍,生产环境推荐mmse;通过accuracy_analysis逐层余弦相似度分析定位精度问题层,给出混合量化(FP16保留关键

#边缘计算
【RK3588S 嵌入式AI系列⑧】RGA零拷贝图像加速:1080P预处理从12ms压到1ms内

【摘要】本文讲解RK3588S RGA硬件加速器的零拷贝图像预处理方案。对比CPU软件实现,RGA将1080P resize+格式转换从12ms压缩至1ms内,提升超10倍。详解imresize/improcess API实现resize、裁剪、旋转、格式转换的组合调用;通过DMA Buffer fd打通摄像头→RGA→NPU全硬件直通链路,彻底消除CPU memcpy开销;演示RKNN推理直接读

#图像处理#性能优化
【RK3588S 嵌入式AI系列⑥】量化精度评估与调试:accuracy_analysis深度实战

【摘要】本文构建RK3588S NPU量化精度调试的完整闭环。五步方法论:1)Top-1/mAP定量评估精度损失基线;2)accuracy_analysis逐层余弦相似度诊断,可视化问题层分布;3)识别三类误差模式(浅层累积/孤立层突变/输出层劣化)并归因;4)两阶段混合量化API操作,手动编辑cfg将问题层设为FP16;5)三版本对比回归验证。附完整Python可视化脚本和调试命令速查表。实测:

【RK3588S 嵌入式AI系列②】Linux开发环境从零搭建:交叉编译工具链 + SDK + VSCode远程调试全攻略

本文详解 RK3588S 嵌入式 AI 开发环境的完整搭建流程。涵盖:1)交叉编译工具链(aarch64-none-linux-gnu)安装与验证;2)RKNN-Toolkit2 SDK 目录结构解析,厘清 PC 端工具与板端运行时库的分工;3)ADB/SSH 连接板子,将 librknnrt.so 部署到目标设备;4)VSCode Remote-SSH 远程开发配置,实现"编译→推板→运行"一键

    共 17 条
  • 1
  • 2
  • 请选择