Des chercheurs de Google, Google DeepMind et de l’Université Stony Brook ont développé CO₂Jump, une nouvelle approche visant à améliorer la cohérence entre la génération de texte et d’images par intelligence artificielle. Actuellement, les modèles d’IA multimodaux peuvent décrire correctement une solution, comme un chemin dans un labyrinthe, tout en générant une image qui représente un parcours différent. La simple production parallèle de ces deux types de sorties ne garantit pas leur alignement sémantique.
Leur échantillonneur, CO₂Jump, utilise la confiance du modèle textuel et l’attention intermodale pour guider les mises à jour de l’image durant le processus d’échantillonnage. Cette méthode permet une correction automatique et continue, assurant une meilleure adéquation entre le texte et l’illustration.
Présentée dans un article de NeurIPS 2026, cette recherche ouvre des perspectives pour des systèmes d’IA multimodaux plus fiables et intégrés, capables de produire des contenus textuels et visuels intrinsèquement liés.
Source : Reddit r/MachineLearning