Des chercheurs ont démontré qu’il est possible d’entraîner un modèle de langage de code, tel que StarCoder, à générer des images de style aquarelle. Cette méthode utilise le langage SVG (Scalable Vector Graphics) pour créer des œuvres d’art numériques. L’entraînement s’appuie sur le Reinforcement Learning for Transformers (TRL) et OpenEnv, un nouvel environnement conçu pour permettre aux modèles d’interagir avec des interfaces web. Le modèle apprend à produire du code SVG qui imite les techniques de l’aquarelle.
Le processus implique une fonction de récompense évaluant la similarité visuelle (via le score CLIP) et pénalisant la complexité du code SVG, encourageant ainsi la création d’images esthétiques et optimisées. Le modèle apprend à manipuler chemins, couleurs et opacités pour reproduire les effets de l’aquarelle, ouvrant des perspectives pour l’interaction des LLM avec des environnements visuels complexes par la génération de code.
Cette expérimentation souligne le potentiel des grands modèles de langage à étendre leurs compétences au-delà de la génération de texte ou de code fonctionnel. Elle illustre leur aptitude à s’engager dans des tâches créatives et visuelles. La capacité des modèles à traduire des intentions artistiques en code vectoriel pourrait transformer l’approche de la création graphique assistée par IA.
Source : HuggingFace Blog