SkewAdam : un optimiseur réduit la mémoire des modèles MoE de 97%

Un nouvel optimiseur, baptisé SkewAdam, a été présenté comme capable de réduire de 97% la mémoire d’état nécessaire à l’entraînement des modèles Mixture-of-Experts (MoE), permettant ainsi de faire tenir un MoE de 6,7 milliards de paramètres sur un GPU de 40 Go.

Les modèles MoE, reconnus pour leur efficacité, sont confrontés à un goulot d’étranglement majeur en termes de mémoire VRAM, principalement dû à l’état de l’optimiseur. À titre d’exemple, l’optimiseur AdamW peut consommer 50,6 Go de mémoire d’état pour un modèle de 12,6 Go. SkewAdam a été conçu pour résoudre ce problème en utilisant une allocation d’état hiérarchisée.

Cette innovation pourrait significativement abaisser les barrières matérielles pour l’entraînement de modèles MoE de grande taille, rendant ces architectures plus accessibles aux chercheurs et aux entreprises disposant de ressources GPU plus limitées. L’approche de SkewAdam ouvre des perspectives pour l’optimisation de la mémoire dans le développement de l’IA.

Source : Reddit r/MachineLearning

Catégories : Brèves IA
← Article précédentGoogle déploie ses « résumés par IA » en FranceArticle suivant →Paper Reader : un outil d'IA pour simplifier la lecture des articles scientifiques

Restez informé de l'actualité IA

Recevez chaque semaine notre sélection des meilleures analyses sur l'intelligence artificielle.

Pas de spam. Désinscription en un clic.

Laisser un commentaire

FR EN ES