GPT-6 Astra : benchmarks mitigés, efficacité humaine sur ARC-AGI-3 et prévision AGI avancée

Le nouveau modèle d’OpenAI, GPT-6 Astra, présente des résultats de benchmark contradictoires, mais son efficacité sur le test ARC-AGI-3, supérieure à celle d’un humain moyen, a poussé François Chollet à avancer sa prévision d’Intelligence Artificielle Générale (AGI).

Les évaluations initiales de GPT-6 Astra divergent. Alors qu’Epoch AI lui attribue un score de 169 points, le plaçant en tête, Artificial Analysis le juge équivalent à son prédécesseur et inférieur à Claude Fable 5.1. Ces disparités soulignent la complexité de mesurer objectivement les capacités des modèles de langage avancés.

La surprise majeure provient du benchmark ARC-AGI-3, où Astra démontre pour la première fois une efficacité supérieure à celle d’un humain moyen. François Chollet, créateur du prix ARC, précise que cela ne constitue pas une preuve d’AGI. Cependant, il estime que les progrès s’accélèrent « deux fois plus vite » que prévu, l’incitant à revoir ses projections temporelles pour l’avènement de l’AGI.

Cette avancée sur un test de raisonnement complexe relance les débats sur les étapes restantes avant l’atteinte d’une véritable AGI.

Source : The Decoder

Catégories : Brèves IA
← Article précédentQuand l'IA génère des plats peu appétissants pour les marquesArticle suivant →L'IA, une menace pour la production audiovisuelle selon Marianne Carpentier

Restez informé de l'actualité IA

Recevez chaque semaine notre sélection des meilleures analyses sur l'intelligence artificielle.

Pas de spam. Désinscription en un clic.

Laisser un commentaire

FR EN ES