Amd
Archivo temático • 1 resultados
2026-09-07
Tecnología
La decodificación especulativa de vLLM en GPU de AMD puede verificar múltiples tokens candidatos en una sola pasada, mejorando el rendimiento de tokens de salida. Los resultados varían según el método de borrado, la familia de modelos y la carga de trabajo.
Infraestructura • Hacker News
Enlace permanente