Des modèles de langage avancés ont été évalués sur des problèmes des Olympiades Internationales de Mathématiques (IMO) 2026, démontrant des capacités de résolution complexes.
Les problèmes des IMO constituent un banc d’essai pertinent pour les grands modèles de langage (LLM). Ils sont inédits, garantissant qu’ils n’ont pas été inclus dans les données d’entraînement des modèles. Leur nature mathématique complexe sert d’indicateur fiable des capacités d’intelligence générale.
Ces tâches exigent une résolution en plusieurs étapes, bénéficiant potentiellement d’une orchestration sophistiquée. Les modèles de pointe, tels que « sol » et « fable », ont obtenu des scores parfaits ou quasi parfaits, indépendamment de l’ingénierie du « harness » utilisée. Les modèles « sonnet » et « opus » ont également affiché des performances notables.
Cette évaluation suggère une progression significative des LLM dans la gestion de défis logiques et mathématiques ardus. La capacité à aborder des problèmes non vus et complexes ouvre des perspectives quant à leur application dans des domaines exigeant un raisonnement structuré.
Source : Reddit r/MachineLearning