问题分析

在vLLM框架下部署Qwen2.5VL模型时,观察到三种不同的生成行为差异。主要现象表现为:

  • 批量输入相同prompt时生成结果完全不一致
  • 循环单次输入相同prompt时生成结果高度一致
  • 循环重置模型且单次输入相同prompt时生成结果完全一致

用伪代码表示,具体而言:
现象一:

init VLM
VLM([prompt] * n)

现象二:

init VLM
for i in [0, n]:
  VLM([prompt])

现象三:

for i in [0, n]:
  init VLM
  VLM([prompt])

测试参数:
temperature = 0 & do_sample = true/false

可能的解释

对于现象一,可能是由批处理机制导致。
对于现象二,暂无法解释。

Logo

免费领 150 小时云算力,进群参与显卡、AI PC 幸运抽奖

更多推荐