logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

从一次 generate() 开始:理解 vLLM-Ascend 的推理过程

输入一句话,调用 ,模型就返回了后续文本。但在推理框架内部,这个调用会被拆成多轮工作:调度请求、准备输入、读写 KV Cache、执行模型、选择新 token,最后释放请求占用的缓存块。本文用 Qwen3-0.6B 在昇腾 NPU 上的一组实验,把这条链路连起来。读者只需要了解基本 Python;文中会逐步解释 Tensor 形状、缓存地址和采样的含义。先记住本文要追踪的例子:我们不评价这句话生成

从一次 generate() 开始:理解 vLLM-Ascend 的推理过程

输入一句话,调用 ,模型就返回了后续文本。但在推理框架内部,这个调用会被拆成多轮工作:调度请求、准备输入、读写 KV Cache、执行模型、选择新 token,最后释放请求占用的缓存块。本文用 Qwen3-0.6B 在昇腾 NPU 上的一组实验,把这条链路连起来。读者只需要了解基本 Python;文中会逐步解释 Tensor 形状、缓存地址和采样的含义。先记住本文要追踪的例子:我们不评价这句话生成

到底了