AllenAI, en collaboration avec Hugging Face, a dévoilé Olmo-core 3, une infrastructure d’entraînement ouverte et évolutive spécifiquement conçue pour les grands modèles Mixture-of-Experts (MoE).
Cette nouvelle version vise à simplifier le développement et l’expérimentation avec les architectures MoE, reconnues pour leur efficacité et leurs performances accrues dans le domaine de l’intelligence artificielle. L’accent est mis sur la transparence et la reproductibilité des processus d’entraînement de ces modèles à grande échelle.
Olmo-core 3 propose un ensemble complet d’outils pour la gestion des données, l’orchestration de l’entraînement distribué et l’optimisation des performances sur des infrastructures de calcul à grande échelle. Cette infrastructure est pensée pour réduire les obstacles techniques et les coûts associés à la mise en œuvre et à l’expérimentation avec des modèles MoE complexes. Elle permet aux chercheurs de se concentrer sur l’innovation plutôt que sur la gestion de l’infrastructure sous-jacente.
En rendant ces capacités avancées plus accessibles à la communauté de recherche et aux développeurs, cette initiative pourrait accélérer l’innovation et la démocratisation des modèles d’IA de nouvelle génération. Elle s’inscrit dans une tendance de fond vers des infrastructures d’IA plus ouvertes et collaboratives, essentielles pour l’avancement du domaine.
Source : HuggingFace Blog