Une nouvelle méthode d’évaluation, GoBench, mesure la capacité de raisonnement des grands modèles de langage (LLM) sur le jeu de Go, révélant des performances encore éloignées des meilleurs programmes spécialisés.
Développé pour évaluer les LLM sur des parties de Go 9×9, GoBench les confronte à une série d’adversaires KataGo, allant d’un niveau aléatoire à surhumain. Cette approche vise à sonder leur aptitude au raisonnement général, un aspect crucial de l’intelligence artificielle.
Les premiers résultats montrent une forte corrélation (r=0,83) entre les performances sur GoBench et celles sur ARC-AGI 2, suggérant que le jeu de Go est un bon indicateur de capacités cognitives plus larges. Le modèle GPT-6 Astra a atteint un score Elo de 2500, tandis que le meilleur KataGo culmine à 4400 Elo. Avec l’aide d’outils de codage et deux heures de préparation, Codex avec Astra a pu atteindre 3560 Elo.
Le classement GoBench reste largement insaturé, indiquant un potentiel significatif d’amélioration pour les LLM. Les créateurs de GoBench prévoient de maintenir le classement à jour tant qu’il ne sera pas saturé, offrant une plateforme continue pour suivre les progrès des modèles. Cette initiative ouvre la voie à une meilleure compréhension des limites actuelles des LLM en matière de raisonnement stratégique complexe.
Source : Reddit r/MachineLearning