GenieX是一款开源运行时,仅需几行代码即可在高通设备上运行生成式AI模型 – 它由Nexa AI团队打造,该团队于今年早些时候通过收购加入高通。本文将详解开发者预览版中包含的内容,以及如何在Windows、Android和Linux系统上运行模型。

今年早些时候,高通收购了Nexa AI,如今Nexa团队推出了这款产品,为高通预优化 AI 模型库生态系统实现了重大更新,原有NexaSDK用户可无缝继续使用。

我们正式推出GenieX – 这是在各种高通设备上运行任意生成式AI的最简便方式,目前已在GitHub上提供了开发者预览版。

设备端生成式AI已跨过关键门槛。过去需要云端级基础设施才能实现的大型语言模型功能,如今已能在设备端高效运行。但是,开发者体验仍有待完善:借助NPU加速运行生成式AI模型的实际难度远超预期,尽管收益十分明确:能够以极少的功耗实现更低的延迟与更高的吞吐量。打通对接NPU的技术壁垒,对于开发者打造下一代设备端AI体验至关重要。

GenieX为开发者提供了一条无缝路径,数分钟内即可完成从优化生成式AI模型到设备端执行的全流程。该运行时的核心构建原则是:仅需几行代码,就能在NPU、GPU、CPU上运行并集成最新生成式AI模型,同时兼容Windows、Android、Linux三大系统。GenieX根据BSD-3-Clause协议开源,并随开源社区共同成长 – 我们欢迎所有人参与贡献,并将重点展示贡献者成果。

GenieX是高通AI软件栈堆栈的延伸,为开发者提供了一条轻量化路径,可将各类强大AI能力落地至设备端,为终端用户带来隐私性更强、云端推理成本可控、延迟性更低的使用体验。

设备端生成式AI模型快速装载

GenieX是在各种高通设备上运行任意生成式AI模型的最快路径:

  • 可运行任何Hugging Face GGUF格式模型。
  • 可在高通预优化AI模型库中的模型上运行各种生成式AI模型,我们还进一步扩充了模型列表,新增了通义千问3.5、通义千问3、Gemma 4、Granite 4、Ministral-3、Phi-4、GPT-OSS等最新模型
  • 轻松构建多模态与智能体工作流。

高通预优化AI模型库模型页面

结合您已熟悉工具的开箱即用体验

GenieX架构

GenieX融合了llama.cpp与Qualcomm AI Runtime(QAIRT)的功能,确保开发者在同一技术软件栈中同时获得广泛的模型支持与最优的NPU性能。无论您面向哪个平台交付、使用哪种开发语言,GenieX都能通过友好的开发者工具,为您提供即插即用的便捷路径,在Windows、Android、Linux系统下的高通芯片NPU、GPU、CPU上完成部署:

  • 各种平台范围内均可实现简单的一键安装 – 覆盖Windows、Android和Linux系统。
  • Windows系统:CLI(命令行界面)、Python包与本地服务器。
  • Android系统:提供用于实现应用程序内推理的原生Maven包。
  • Linux系统:Docker容器、命令行工具、Python包与本地服务器。
  • 与OpenAI兼容的本地服务器API,可与各种外部工具轻松集成。
Windows系统

命令行界面,与OpenAI兼容的API

仅需一行代码,即可直接在终端中获取并运行模型,还能与OpenClaw等外部本地智能体工具完成集成。

Android系统

用于应用程序内推理的原生Maven软件包。开发者可沿用对接任何其他Android系统库的相同方式,将生成式AI集成到Android应用程序中。

或者,您也可以直接通过示例演示应用程序快速上手。

val paths = ModelManagerWrapper.getPaths("unsloth/Qwen3.5-2B-GGUF")
    ?: error("Model not downloaded")
val llm = LlmWrapper.builder()
    .llmCreateInput(
        LlmCreateInput(
            model_name = paths.model_name,
            model_path = paths.model_path,
            config     = ModelConfig(nCtx = 4096),
            runtime_id = "llama_cpp",
            compute_unit = null,   // null → NPU on Snapdragon (recommended)
        )
    )
    .build()
    .getOrThrow()
val chat = arrayListOf(ChatMessage("user", "What is 15 times 15"))

Linux系统 

Docker容器、命令行界面以及OpenAI兼容的API。专为Linux ARM64系统构建。仅需一行代码即可获取并运行各种模型。

Python环境

将其导入,加载一个模型,然后在您的自有代码中调用。该Python环境API的体验与Hugging Face Transformers完全一致。

from geniex import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained(
    "unsloth/GPT-OSS-20B-GGUF",
    device_map="auto",
)
messages = [{"role": "user", "content": "What is 2+2?"}]
prompt = model.tokenizer.apply_chat_template(
    messages, add_generation_prompt=True,
)
print(model.generate(prompt, max_new_tokens=256).text)

什么是“开发者预览版”?

这是面向意图在正式版本发布之前利用GenieX开始构建工作的开发者的早期版本。该运行时对上述工作流已具备稳定性。从当前版本到正式版本发布前 (GA),我们还将拓展模型覆盖范围、新增更多集成能力、扩大平台支持等。

我们提前发布该版本,是为了获取真实构建者的反馈,也希望合作伙伴和更广泛的设备端AI社区能够尽早开始集成该运行时。我们欢迎所有开发者为项目仓库贡献内容。

后续步骤

我们期待看到您构建令人惊叹的设备端AI体验,并聆听您的反馈。


本产品由原Nexa团队为您打造。现有NexaSDK用户可无缝继续使用。

在所发布内容中表达的观点仅为原作者的个人观点,并不代表高通技术公司或其子公司(以下简称为“高通技术公司”)的观点。所提供的内容仅供参考之用,而并不意味着高通技术公司或任何其他方的赞同或表述。本网站同样可以提供非高通技术公司网站和资源的链接或参考。高通技术公司对于可能通过本网站引用、访问、或链接的任何非高通技术公司网站或第三方资源并没有做出任何类型的任何声明、保证、或其他承诺。

高通品牌产品均为高通技术公司和/或其子公司的产品。

关于作者

艾伦·朱,高通技术公司高级产品经理

阅读更多

 

扎克·李,高通技术公司高级工程师

阅读更多

 

亚历克斯·陈,高通技术公司首席工程师/经理

阅读更多

更多推荐