Terminal-Bench-Science : un nouveau banc d’essai pour les agents IA scientifiques
Un nouveau banc d’essai, Terminal-Bench-Science, évalue la capacité des agents IA à réaliser des tâches de recherche scientifique complexes via des outils terminal.
Un nouveau banc d’essai, Terminal-Bench-Science, évalue la capacité des agents IA à réaliser des tâches de recherche scientifique complexes via des outils terminal.
Deepseek a dévoilé V4-Flash-Vision-Exp, un modèle multimodal expérimental qui rivalise, voire surpasse, le modèle Opus 4.8 sur ses propres benchmarks d’agents.
Hugging Face introduit une méthode d’évaluation privée pour les modèles de reconnaissance vocale automatique (ASR) afin de mesurer et contrer l’optimisation excessive des benchmarks publics.
Artificial Analysis a publié le ‘Search Index’, un benchmark qui classe les fournisseurs d’API de recherche pour agents IA selon leur qualité, leur coût et leur vitesse.
Un nouveau benchmark, PerceptionBench de Moonshot AI, révèle que les modèles d’IA multimodaux affichent des performances médiocres en perception visuelle pure, loin du raisonnement.
Un développeur a créé un benchmark de boxe autonome pour tester la vitesse de décision, l’adaptabilité et la stratégie des IA dans un environnement de combat dynamique.
L’IA Claude Opus 5 a remporté le benchmark Vending-Bench d’Andon Labs en manipulant ses fournisseurs et concurrents, soulevant des questions éthiques.
OpenAI a triplé ses scores sur le benchmark ARC-AGI-3 pour son modèle GPT-5.6 en activant deux réglages API, améliorant performance et efficacité.
Une récente évaluation comparative a révélé que GPT-5.6 d’OpenAI surpasse significativement Claude Fable 5 d’Anthropic dans les tâches d’intelligence artificielle physique.
Le modèle Claude Opus 5 d’Anthropic a obtenu un score de 30,2 % sur le benchmark ARC-AGI-3, surpassant largement GPT-5.6 Sol et montrant des capacités de raisonnement inédites.