Skip to content
Inteligencia IASep 7, 2026Inteligencia IA
Artigo

A decodificação especulativa do vLLM em GPUs AMD pode verificar vários tokens propostos em uma única passada, melhorando a taxa de...

Transferência de tokens de saída. Os resultados variam conforme o método de proposta, a família de modelos e a carga de trabalho.

Editorial Data Cube AIFonte: Techmeme
01

Brief da fonte

A decodificação especulativa do vLLM em GPUs AMD pode verificar vários tokens propostos em uma única passada, melhorando a taxa de transferência de tokens de saída. Os resultados variam conforme o método de proposta, a família de modelos e a carga de trabalho.