Inteligencia IASep 7, 2026Inteligencia IA
Artigo
A decodificação especulativa do vLLM em GPUs AMD pode verificar vários tokens propostos em uma única passada, melhorando a taxa de...
Transferência de tokens de saída. Os resultados variam conforme o método de proposta, a família de modelos e a carga de trabalho.
Editorial Data Cube AIFonte: Techmeme
01
Brief da fonte
A decodificação especulativa do vLLM em GPUs AMD pode verificar vários tokens propostos em uma única passada, melhorando a taxa de transferência de tokens de saída. Os resultados variam conforme o método de proposta, a família de modelos e a carga de trabalho.
02