Google DeepMind a démontré qu’il est possible de créer un modèle de diffusion textuelle sans entraînement initial complet, en adaptant un modèle existant.
Cette innovation, baptisée DiffusionGemma, a été développée en transformant le modèle Gemma 4. L’équipe a réussi cette adaptation en utilisant moins de 10 % du budget d’entraînement qui aurait été nécessaire pour concevoir un modèle entièrement nouveau à partir de zéro.
Contrairement aux modèles traditionnels, DiffusionGemma se distingue par sa capacité à générer 256 jetons de texte en parallèle, plutôt qu’un seul à la fois. Cette architecture lui permet d’atteindre une vitesse impressionnante d’environ 1 500 jetons par seconde.
Malgré cette efficacité, les évaluations comparatives actuelles révèlent que la qualité de DiffusionGemma reste inférieure à celle du modèle autorégressif original. Cette lacune est particulièrement prononcée lors de l’exécution de tâches de raisonnement.
Cette approche pourrait redéfinir les stratégies de développement de modèles de langage, en privilégiant l’adaptation plutôt que la création ex nihilo.
Source : The Decoder