Un chercheur indépendant a réussi à entraîner un agent PPO (Proximal Policy Optimization) à jouer de manière réactive à Atari Breakout, simulant une approche plus humaine que les stratégies mémorisées.
L’expérimentation, initiée il y a six mois, visait à approfondir la compréhension de l’apprentissage automatique et de l’apprentissage par renforcement. Initialement, les tentatives se concentraient sur l’obtention de scores élevés, mais l’approche de l’IA restait une exécution de scripts préétablis plutôt qu’une interaction dynamique avec le jeu.
Cette observation a conduit le chercheur à réorienter ses efforts. L’objectif est devenu de faire en sorte que l’agent PPO suive la balle activement, plutôt que de se focaliser uniquement sur l’accumulation de points. Après 124 expériences différentes sur Atari Breakout, cette capacité de jeu réactif a été atteinte.
Cette démarche illustre la complexité d’imiter la flexibilité de l’intelligence humaine dans des environnements de jeu, même pour des tâches apparemment simples.
Source : Reddit r/MachineLearning