GRPO : Le réglage fin rapide pour des sorties structurées de modèles
La méthode GRPO de Hugging Face permet d’optimiser la production de sorties structurées par les modèles de langage en seulement 100 étapes d’entraînement.
La méthode GRPO de Hugging Face permet d’optimiser la production de sorties structurées par les modèles de langage en seulement 100 étapes d’entraînement.
Un développeur a lancé DelveRL, un roguelike open-source, spécifiquement conçu pour l’entraînement d’agents d’intelligence artificielle, facilitant ainsi la recherche en IA.
Un chercheur a réussi à entraîner un agent PPO à jouer de manière réactive à Atari Breakout, simulant une approche plus humaine que les stratégies mémorisées.
L’entreprise Humanoid affirme que son approche KinetIQ Ascend permet aux robots d’atteindre une dextérité quasi humaine avec 99,9 % de fiabilité.
Une nouvelle bibliothèque, rewardspy, a été conçue pour détecter le « reward hacking » en apprentissage par renforcement, un phénomène où l’IA exploite la fonction de récompense sans réelle amélioration.
Un agent d’intelligence artificielle entraîné par auto-apprentissage a atteint un niveau surhumain et la première place du classement mondial sur le jeu Generals.io.
Des chercheurs d’OpenAI ont montré qu’entraîner l’IA sur des « traits bénéfiques » la rend plus sûre et moins manipulable, avec des résultats probants.
La communauté open source soutient activement OpenEnv, un nouveau cadre de travail conçu pour l’apprentissage par renforcement agentique (Agentic RL), visant à créer des agents IA plus autonomes.
Un nouveau package open source pour des environnements de drones basés sur l’apprentissage par renforcement multi-agents a été dévoilé sur Reddit, offrant une plateforme pour la recherche en IA.
L’optimisation des préférences directes (DPO) étend son influence au-delà des chatbots pour d’autres modèles d’IA.