Un LLM de 3,8 milliards de paramètres entraîné pour moins de 1000 dollars

Un chercheur indépendant, Hugo Vergnes, a réussi à entraîner un modèle de langage de grande taille (LLM) de 3,8 milliards de paramètres pour seulement 998 dollars, atteignant un score de 0,384 sur le benchmark CORE. Cette réalisation, détaillée sur son blog, met en lumière la faisabilité de développer des LLM performants avec un budget limité.

L’entraînement a été effectué sur un unique GPU NVIDIA H100 loué, durant 36 heures. Le modèle, basé sur l’architecture Llama 2, a été alimenté par 100 milliards de tokens issus du dataset SlimPajama. Le score CORE (Common Open-source Research Evaluation) indique une performance notable pour un coût d’entraînement aussi bas.

Cette initiative de Hugo Vergnes suggère que l’accès à la création de modèles d’IA avancés pourrait se démocratiser, dépassant le cadre des grandes entreprises. Le coût total de l’opération est comparable à celui d’un ordinateur de jeu de milieu de gamme, ouvrant des perspectives pour les chercheurs indépendants et les petites équipes. Cela pourrait encourager de nouvelles expérimentations et innovations dans le domaine des LLM.

Source : Hacker News (Algolia)

Catégories : Brèves IA
← Article précédentLe SEO face aux moteurs IA : réinventer la visibilité en ligneArticle suivant →Alignement IA : une idée « stupide » face au « specification gaming »

Restez informé de l'actualité IA

Recevez chaque semaine notre sélection des meilleures analyses sur l'intelligence artificielle.

Pas de spam. Désinscription en un clic.

Laisser un commentaire

FR EN ES