
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
对外提供大模型推理API接口,或者UI界面板端Qwen3-VL提供了两种API调用方式:RKLLM-Server-Flask Demo和KLLM-Server-Gradio Demo两者底层共用一套 librkllmrt RKLLM 推理库,模型加载、NPU 推理逻辑完全一致,差异仅在对外交互方式、使用场景、部署目标。核心定位对比后端 API 服务,无界面,供程序调用基于 Flask 轻量 Web

瑞芯微官方给出了一个精度评估工具这里有一个参数特别重要:target=None一般表示在 PC simulator 上做分析。它适合回答:量化模型在工具链模拟器里和浮点模型差多少?如果设置具体芯片目标,并连接了设备,例如:target=具体芯片平台device_id=设备 ID它更接近回答:真实 NPU 每一层输出和参考输出差多少?

例如,下图中有两个模型,模型 1 的 Internal Tensor 占用大于模型 2,如果模型 1 和模型 2 顺序地运行,可以只开辟 0x00000000~0x000c4000 地址的一块内存给模型 1 和 2 共用,模型 1 推理结束后,这块内存可以被模型 2 用来读写 Internal Tensor 数据,从而节省内存。,硬件之间只传递内存 fd(文件描述符),不搬运图像 / 张量原始数据

把板子CPU、NPU、DDR运行频率设置到最大,后续的性能分析都在这个基准上比较,避免动态调频导致性能表现出现误差。可以看到 Expand 和 Transpose是运行在CPU上的,可以通过算子替换等把它修改到NPU上以提高性能。整个部署程序的推理部分耗时的占用有如下三个方面:用户应用程序耗时、输入输出数据拷贝耗时、模型推理耗时。校准数据集作用:前向跑一遍模型,收集每层输出特征图所有数值,统计该层

输出蒸馏也叫硬样本蒸馏、API 蒸馏,DeepSeek‑R1‑Distill、很多开源小推理模型都是这套流程准备一批 prompt(业务数据 / 公开数据集);调用教师 API,生成完整回答(包含 CoT 思考过程);清洗、过滤、去重,做成 prompt→response SFT 数据集;拿这份数据集对学生底座做 SFT 微调。输出蒸馏代码# ====================== 硬样本蒸

输出蒸馏也叫硬样本蒸馏、API 蒸馏,DeepSeek‑R1‑Distill、很多开源小推理模型都是这套流程准备一批 prompt(业务数据 / 公开数据集);调用教师 API,生成完整回答(包含 CoT 思考过程);清洗、过滤、去重,做成 prompt→response SFT 数据集;拿这份数据集对学生底座做 SFT 微调。输出蒸馏代码# ====================== 硬样本蒸

rknn-llm-export 和rknn-llm环境类似,只不过rknn-llm需要transformers版本为4.57.3,rknn-llm-export 需要transformers版本为4.55.2。rknn-toolkit2是可以通过pip直接安装的,安装最新版即可(我这里使用的rknn-toolkit2是2.3.2版本)。这两个工具有些依赖是互斥的,所以需要用到虚拟环境来隔离,虚拟环

本节我们的工作目录切换至:rknn-llm/examples/multimodal_model_demo/deploy这个目录的作用是编译出测试Qwen3-VL大模型用的demo、so库等。

比如用户新问题 “电动车充满要多久”,它的向量和历史 “电动车续航、快充” 向量距离很近,和 “柯基小狗” 向量距离很远,程序就能自动筛选出相关历史对话,实现记忆匹配。向量就是一组数字数组,比如 [0.12, -0.35, 0.78, ...],这里用的轻量模型输出固定 384 个浮点数,也叫文本嵌入(Embedding)。新提问时先检索历史对话,把相关图文拼接进 prompt 喂给 Qwen3-

比如用户新问题 “电动车充满要多久”,它的向量和历史 “电动车续航、快充” 向量距离很近,和 “柯基小狗” 向量距离很远,程序就能自动筛选出相关历史对话,实现记忆匹配。向量就是一组数字数组,比如 [0.12, -0.35, 0.78, ...],这里用的轻量模型输出固定 384 个浮点数,也叫文本嵌入(Embedding)。新提问时先检索历史对话,把相关图文拼接进 prompt 喂给 Qwen3-









