AI情报Sep 7, 2026AI情报文章vLLM的推测解码可以在AMD GPU上单次传递中验证多个草拟的token,从而提高输出token吞吐量。结果因草拟方法、模型家族和工作负载而异。Data Cube AI 编辑部2026年9月7日来源: Techmeme01来源简报vLLM的推测解码可以在AMD GPU上单次传递中验证多个草拟的token,从而提高输出token吞吐量。结果因草拟方法、模型家族和工作负载而异。02相关话题基础设施vLLMAMD推测解码查看本期