GoBench : Évaluer les LLM au jeu de Go révèle des lacunes en raisonnement
Une nouvelle méthode d’évaluation, GoBench, mesure la capacité de raisonnement des grands modèles de langage (LLM) sur le jeu de Go, révélant des performances encore éloignées des meilleurs programmes spécialisés.