К Roadmap
Distributed training
FSDP, DeepSpeed ZeRO и sharding
Почему состояния оптимизатора занимают так много памяти, как FSDP и ZeRO делят параметры, градиенты и optimizer state и когда sharding оправдывает сложность.
Полный доступ
Открыть Roadmap «Продвинутая ML-инженерия»
Все темы Roadmap
Подробные объяснения и примеры
Практические материалы
Будущие обновления без доплаты
Отдельная покупка остаётся в аккаунте навсегда и включает будущие обновления.