Claude Opus 5 d’Anthropic excelle sur un benchmark d’intelligence réelle

Le modèle Claude Opus 5 d’Anthropic a réalisé une performance remarquable sur le benchmark ARC-AGI-3, un test conçu pour mesurer l’intelligence réelle des systèmes d’IA, surpassant largement ses concurrents.

Il a obtenu un score impressionnant de 30,2 %, près de quatre fois supérieur au précédent record de 7,8 % détenu par GPT-5.6 Sol d’OpenAI. Le benchmark ARC-AGI-3 évalue la capacité des modèles à résoudre des problèmes complexes nécessitant un raisonnement logique avancé, allant au-delà de la simple mémorisation ou de la reconnaissance de motifs. Les développeurs du benchmark ont noté que Claude Opus 5 a formulé de manière autonome des « équations de réflexion », un comportement inédit.

Cette capacité, jamais observée chez d’autres modèles, est interprétée comme le signe d’une logique de raisonnement plus robuste et d’une meilleure compréhension des principes sous-jacents aux problèmes. Cette avancée suggère une progression significative dans la capacité des intelligences artificielles à aborder des tâches cognitives complexes et ouvre des perspectives sur l’évolution future des modèles de langage et leurs applications potentielles.

Source : The Decoder

Catégories : Brèves IA
← Article précédentChatGPT et les recettes dangereuses : des centaines de requêtes pour poisonsArticle suivant →Une Nvidia Tesla V100 d'entreprise intégrée à un PC de jeu pour l'IA locale

Restez informé de l'actualité IA

Recevez chaque semaine notre sélection des meilleures analyses sur l'intelligence artificielle.

Pas de spam. Désinscription en un clic.

Laisser un commentaire

FR EN ES