SkewAdam : un optimiseur réduit la mémoire des modèles MoE de 97%
Un nouvel optimiseur nommé SkewAdam permet de réduire de 97% la mémoire d’état requise pour l’entraînement des modèles Mixture-of-Experts (MoE), rendant possible leur exécution sur des GPU de 40 Go.