Une nouvelle méthode de réglage fin, nommée GRPO, permet d’améliorer significativement la production de sorties structurées par les modèles de langage, et ce, en seulement 100 étapes d’entraînement.
Développée par Hugging Face, GRPO (Guided Reinforcement Learning for Program Optimization) est une approche d’apprentissage par renforcement. Elle vise à guider les modèles vers la génération de formats spécifiques, tels que JSON ou XML, essentiels pour de nombreuses applications. Cette technique s’intègre au cadre TRL (Transformer Reinforcement Learning) et utilise la bibliothèque ifstruct pour la génération structurée.
L’efficacité de GRPO est notable : des expérimentations ont montré qu’un modèle de 350 millions de paramètres pouvait être ajusté pour produire des sorties structurées de meilleure qualité en une centaine d’étapes. Cela représente une optimisation considérable du processus de fine-tuning, réduisant le temps et les ressources nécessaires.
Cette avancée ouvre des perspectives pour le développement d’applications nécessitant des interactions précises avec les modèles, où la conformité des données de sortie est primordiale. Elle suggère une voie vers des modèles plus fiables et plus facilement intégrables dans des systèmes complexes.
Source : HuggingFace Blog