Skip to content

Gpu

Arquivo temático1 resultados

Gerado por IA: resumos escritos por IA a partir das fontes indicadas. Como usamos a IA

Voltar ao inícioGEO summary endpoint

2026-09-07

Tecnologia

  • A decodificação especulativa do vLLM em GPUs da AMD pode verificar múltiplos tokens rascunhados em uma única passagem, melhorando a vazão de tokens de saída. Os resultados variam conforme o método de rascunho, a família do modelo e a carga de trabalho.

    InfraestruturaHacker News

    Link permanente