Le nouveau modèle d’OpenAI, GPT-6 Astra, présente des résultats de benchmark contradictoires, mais son efficacité sur le test ARC-AGI-3, supérieure à celle d’un humain moyen, a poussé François Chollet à avancer sa prévision d’Intelligence Artificielle Générale (AGI).
Les évaluations initiales de GPT-6 Astra divergent. Alors qu’Epoch AI lui attribue un score de 169 points, le plaçant en tête, Artificial Analysis le juge équivalent à son prédécesseur et inférieur à Claude Fable 5.1. Ces disparités soulignent la complexité de mesurer objectivement les capacités des modèles de langage avancés.
La surprise majeure provient du benchmark ARC-AGI-3, où Astra démontre pour la première fois une efficacité supérieure à celle d’un humain moyen. François Chollet, créateur du prix ARC, précise que cela ne constitue pas une preuve d’AGI. Cependant, il estime que les progrès s’accélèrent « deux fois plus vite » que prévu, l’incitant à revoir ses projections temporelles pour l’avènement de l’AGI.
Cette avancée sur un test de raisonnement complexe relance les débats sur les étapes restantes avant l’atteinte d’une véritable AGI.
Source : The Decoder