
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
从一次 generate() 开始:理解 vLLM-Ascend 的推理过程
输入一句话,调用 ,模型就返回了后续文本。但在推理框架内部,这个调用会被拆成多轮工作:调度请求、准备输入、读写 KV Cache、执行模型、选择新 token,最后释放请求占用的缓存块。本文用 Qwen3-0.6B 在昇腾 NPU 上的一组实验,把这条链路连起来。读者只需要了解基本 Python;文中会逐步解释 Tensor 形状、缓存地址和采样的含义。先记住本文要追踪的例子:我们不评价这句话生成
从一次 generate() 开始:理解 vLLM-Ascend 的推理过程
输入一句话,调用 ,模型就返回了后续文本。但在推理框架内部,这个调用会被拆成多轮工作:调度请求、准备输入、读写 KV Cache、执行模型、选择新 token,最后释放请求占用的缓存块。本文用 Qwen3-0.6B 在昇腾 NPU 上的一组实验,把这条链路连起来。读者只需要了解基本 Python;文中会逐步解释 Tensor 形状、缓存地址和采样的含义。先记住本文要追踪的例子:我们不评价这句话生成
到底了







