Gpu
Arquivo temático • 1 resultados
Gerado por IA: resumos escritos por IA a partir das fontes indicadas. Como usamos a IA
2026-09-07
Tecnologia
A decodificação especulativa do vLLM em GPUs da AMD pode verificar múltiplos tokens rascunhados em uma única passagem, melhorando a vazão de tokens de saída. Os resultados variam conforme o método de rascunho, a família do modelo e a carga de trabalho.
Infraestrutura • Hacker News
Link permanente