DiffusionGemma : Google adapte un modèle existant pour la génération de texte

Google DeepMind a démontré qu’il est possible de créer un modèle de diffusion textuelle sans entraînement initial complet, en adaptant un modèle existant.

Cette innovation, baptisée DiffusionGemma, a été développée en transformant le modèle Gemma 4. L’équipe a réussi cette adaptation en utilisant moins de 10 % du budget d’entraînement qui aurait été nécessaire pour concevoir un modèle entièrement nouveau à partir de zéro.

Contrairement aux modèles traditionnels, DiffusionGemma se distingue par sa capacité à générer 256 jetons de texte en parallèle, plutôt qu’un seul à la fois. Cette architecture lui permet d’atteindre une vitesse impressionnante d’environ 1 500 jetons par seconde.

Malgré cette efficacité, les évaluations comparatives actuelles révèlent que la qualité de DiffusionGemma reste inférieure à celle du modèle autorégressif original. Cette lacune est particulièrement prononcée lors de l’exécution de tâches de raisonnement.

Cette approche pourrait redéfinir les stratégies de développement de modèles de langage, en privilégiant l’adaptation plutôt que la création ex nihilo.

Source : The Decoder

Catégories : Brèves IA
← Article précédentL'IA pousse Nvidia et Amazon à investir des milliards dans l'énergieArticle suivant →Meetily : transcription et résumé de réunions IA, gratuit et open source

Restez informé de l'actualité IA

Recevez chaque semaine notre sélection des meilleures analyses sur l'intelligence artificielle.

Pas de spam. Désinscription en un clic.

Laisser un commentaire

FR EN ES