• 在大多数标准硬件上运行边缘人工智能是一项艰巨的任务。
  • SECO公司开发了一款可以在搭载高通跃龙QCS6490处理器的专用系统模块 (SoM) 上运行的边缘AI助手,从而可以将大型语言模型与检索增强生成一起使用。
  • 涉及大型语言模型与检索增强生成的所有工作均在系统模块上运行,从而消除了数据与云之间传输的延迟,并提高了安全性和隐私性。

本文与SECO股份有限公司AI服务团队合作撰写。

如何在边缘AI设备上充分利用大语言模型 (LLM) 和检索增强生成 (RAG) ?当您在边缘运行AI时,您的各种资源均受到限制:有限的内存、紧张的网络带宽和功耗,且无法连接云端或数据中心。即使模型已针对边缘推理进行优化,对于硬件而言仍然属于一项沉重负担。

正因如此,SECO开发出一款由高通跃龙 QCS6490驱动、基于SoC运行的边缘AI助手,该解决方案采用结合检索增强生成技术的大语言模型,其结构紧凑到足以在单个系统模块 (SoM) 上运行。在2025年嵌入式世界大会上,SECO公司展示了在其系统模块上运行,并搭载跃龙QCS6490处理器的AI助手。

跃龙QCS6490处理器专为高性能边缘计算而设计。该处理器合并多达8核的高通Kryo CPU,集成了高通Adreno GPU和强大的AI引擎 (NPU + DSP) ,实现了高达12 TOPS的算力。该平台为自主机器人、智能视觉和工业自动化等计算密集型应用提供了实时本地处理功能。

打造一个没有云的AI助手

随着对边缘部署AI智能体和大语言模型关注度的日益提升,SECO公司发现了在硬件计算效率测试领域的市场机遇。该公司对硬件进行了压力测试,以探索其性能极限,同时针对客户问题提供多种解决方案。

该公司围绕跃龙QCS6490处理器设计并构建了SECO SOM-SMARC-QCS6490,一种高性能边缘AI计算模块。作为AI和物联网 (IoT) 的测试用例,该公司开发了AI助手,以执行本地推理和实时响应生成,同时并不依赖于基于云的服务。

该助手使用具有30亿个参数的Llama (Llama 3B) 模型和检索增强生成,通过结构化知识库提供精确、与情境相关的响应。该助手分两个阶段处理用户输入:

1. 预处理和查询优化

  • 对用户输入进行清理、重新规划与合成,以优化有关检索文档任务的查询
  • 提高数据库搜索的效率,并确保查询请求与产品文档保持一致

2. 情境式文档检索与响应生成

  • 从数据集中搜索和检索相关文档
  • 将这些文档作为附加情境与用户查询一起传递
  • 根据查询和检索的文档生成最终响应,以确保更高的准确性和相关性

SECO公司本地AI助手在嵌入式世界大会进行的演示

主板特写

将聊天应用程序和增强检索生成从云移动到边缘设备

这项AI助手测试案例需要将两个工作负载迁移至边缘设备,即基于Llama模型的聊天应用程序和RAG处理流程。这些工作负载通常在具有充足资源的云端运行,需要对其进行优化,以便在边缘设备上充分运行。

为开发有关系统模块测试用例,SECO公司工程师使用了:

工程师们还对检索与生成流程进行了优化。他们给开发者的建议是,花时间构建结构良好的知识库,并细化检索模型,以提高准确性。

在2025年嵌入式世界展上亮相的这款AI助手,其开发测试工作由SECO人工智能服务团队主导。其他团队成员在具体的技术、集成和协调任务上做出了贡献,该团队受益于高通技术公司提供的技术支持。

结果

SECO在边缘设备上运行Llama.cpp的核心优化目标是提升每秒生成令牌数。实际部署结果显示,上述两个工作负载在SECO SOM-SMARC-QCS6490模块上平均每秒可处理10.3个令牌。

第一项工作负载是聊天应用程序本身。用户通过聊天界面直接在设备上与大语言模型进行交互。用户可以根据大语言模型的训练数据提出通用知识问题,这类基础交互无需依赖云端处理。第二项个更高级的工作负载是检索增强生成。它通过从本地数据源检索培训后信息的方式来增强大语言模型的能力。这些数据源(例如:数据库和文档集合)均保留在设备上。

在不依赖云的情况下,大语言模型和检索增强生成涉及的所有工作均在系统模块上运行。该解决方案消除了数据与云之间传输的延迟,并提高了本地存储数据的安全性和隐私性。

后续步骤

SECO公司的目标是在构建面向未来的边缘解决方案时确保系统集成商和原始设备制造商具有灵活性,同时保持对于功耗、外形尺寸和部署成本的控制。该公司预见预测性维护、计算机视觉和本地化大语言模型等应用在边缘设备中的作用将日益凸显。该公司认为,高通技术公司不断发展的产品组合非常适合这方面的作用。

该公司依靠跃龙QCS6490处理器在工业自动化、医疗设备和物联网系统等垂直领域实现强大而高效的AI性能。该公司还在评估模块化视觉人机接口系列所用芯片组,该系列专为强大的边缘AI应用而设计。

为了提高效率,该公司正在开发基于跃龙QCS5430处理器的SMARC模块。该芯片组支持现场软件升级CPU性能,这一特性被SECO视为其灵活性的重要体现。

对于高端设备,该公司已经启动了一个在骁龙X 处理器基础上构建模块的新项目,以提供更高的AI加速器性能(每秒高达45万亿次的操作)。COM Express模块是边缘型AI和生成式AI任务的理想选择,同时可以保持边缘部署中典型的功率和热封装。

如要了解更多关于SECO公司的信息,请访问seco.com

在所发布内容中表达的观点仅为原作者的个人观点,并不代表高通技术公司或其子公司(以下简称为“高通技术公司”)的观点。所提供的内容仅供参考之用,而并不意味着高通技术公司或任何其他方的赞同或表述。本网站同样可以提供非高通技术公司网站和资源的链接或参考。高通技术公司对于可能通过本网站引用、访问、或链接的任何非高通技术公司网站或第三方资源并没有做出任何类型的任何声明、保证、或其他承诺。

骁龙与高通品牌产品均为高通技术公司和/或其子公司的产品。

关于作者

塞巴斯蒂亚诺·迪·菲利波,高通欧洲公司业务开发高级总监

阅读更多

Logo

分享最新、最前沿的AI大模型技术,吸纳国内前几批AI大模型开发者

更多推荐