Skip to content
AI情报Sep 7, 2026AI情报
文章

vLLM的推测解码可以在AMD GPU上单次传递中验证多个草拟的token,从而提高输出token吞吐量。结果因草拟方法、模型家族和工作负载而异。

Data Cube AI 编辑部来源: Techmeme
01

来源简报

vLLM的推测解码可以在AMD GPU上单次传递中验证多个草拟的token,从而提高输出token吞吐量。结果因草拟方法、模型家族和工作负载而异。