AirLLM ermöglicht es, Sprachmodelle mit 70 Milliarden Parametern auf einer einzelnen 4-GB-GPU ohne Quantisierung oder Pruning auszuführen.
Durch das Streaming sparsamer Mixture-of-Experts-Modelle, jeweils einen Experten nach dem anderen, erlaubt die Framework sogar Modellen mit 2,8 Billionen Parametern, mit weniger als 4 GB VRAM zu laufen, was die Hardwarehürden für lokales Inference und Edge-Bereitstellung erheblich senkt.
KI-generiert: Die Zusammenfassungen schreibt eine KI auf Grundlage der verlinkten Quellen. So nutzen wir KI
Source Brief
AirLLM ermöglicht es, Sprachmodelle mit 70 Milliarden Parametern auf einer einzelnen 4-GB-GPU ohne Quantisierung oder Pruning auszuführen. Durch das Streaming sparsamer Mixture-of-Experts-Modelle, jeweils einen Experten nach dem anderen, erlaubt die Framework sogar Modellen mit 2,8 Billionen Parametern, mit weniger als 4 GB VRAM zu laufen, was die Hardwarehürden für lokales Inference und Edge-Bereitstellung erheblich senkt.