Un chercheur indépendant, Hugo Vergnes, a réussi à entraîner un modèle de langage de grande taille (LLM) de 3,8 milliards de paramètres pour seulement 998 dollars, atteignant un score de 0,384 sur le benchmark CORE. Cette réalisation, détaillée sur son blog, met en lumière la faisabilité de développer des LLM performants avec un budget limité.
L’entraînement a été effectué sur un unique GPU NVIDIA H100 loué, durant 36 heures. Le modèle, basé sur l’architecture Llama 2, a été alimenté par 100 milliards de tokens issus du dataset SlimPajama. Le score CORE (Common Open-source Research Evaluation) indique une performance notable pour un coût d’entraînement aussi bas.
Cette initiative de Hugo Vergnes suggère que l’accès à la création de modèles d’IA avancés pourrait se démocratiser, dépassant le cadre des grandes entreprises. Le coût total de l’opération est comparable à celui d’un ordinateur de jeu de milieu de gamme, ouvrant des perspectives pour les chercheurs indépendants et les petites équipes. Cela pourrait encourager de nouvelles expérimentations et innovations dans le domaine des LLM.
Source : Hacker News (Algolia)