O AirLLM permite que modelos de linguagem com 70 bilhões de parâmetros sejam executados em uma única GPU de 4 GB sem quantização ou poda.
Ao transmitir modelos esparsos de Mixture-of-Experts um especialista por vez, a estrutura permite que até modelos com 2,8 trilhões de parâmetros operem com menos de 4 GB de VRAM, reduzindo significativamente as barreiras de hardware para inferência local e implantação na borda.
Gerado por IA: resumos escritos por IA a partir das fontes indicadas. Como usamos a IA
Brief da fonte
O AirLLM permite que modelos de linguagem com 70 bilhões de parâmetros sejam executados em uma única GPU de 4 GB sem quantização ou poda. Ao transmitir modelos esparsos de Mixture-of-Experts um especialista por vez, a estrutura permite que até modelos com 2,8 trilhões de parâmetros operem com menos de 4 GB de VRAM, reduzindo significativamente as barreiras de hardware para inferência local e implantação na borda.