Amd
主题归档 • 1 条结果
AI 生成:摘要由 AI 根据所链接的来源撰写。 我们如何使用 AI
2026-09-07
科技
vLLM在AMD GPU上的推测解码可在单次传递中验证多个草稿词元,从而提高输出词元的吞吐量。结果因草稿方法、模型系列和工作负载而异。
基础设施 • Hacker News
永久链接
主题归档 • 1 条结果
AI 生成:摘要由 AI 根据所链接的来源撰写。 我们如何使用 AI
vLLM在AMD GPU上的推测解码可在单次传递中验证多个草稿词元,从而提高输出词元的吞吐量。结果因草稿方法、模型系列和工作负载而异。
基础设施 • Hacker News
永久链接