VAKRA : un nouveau benchmark pour évaluer le raisonnement des agents d’IA
IBM Research a lancé VAKRA, un benchmark évaluant la capacité des agents d’IA à raisonner et utiliser des outils, révélant leurs forces et faiblesses actuelles.
IBM Research a lancé VAKRA, un benchmark évaluant la capacité des agents d’IA à raisonner et utiliser des outils, révélant leurs forces et faiblesses actuelles.
Google conteste un taux d’erreur de 10 % pour ses AI Overviews, mais ses propres outils de test révèlent un chiffre de 22 %.
Les agents IA échouent à accomplir la majorité des tâches en ligne du quotidien, selon le banc d’essai ClawBench.