Real-SWE : Un nouveau benchmark pour les IA sur codes d’entreprise
Un nouveau benchmark, Real-SWE, évalue les modèles d’IA sur des bases de code d’entreprise réelles et privées, offrant une mesure plus précise de leurs capacités.
Un nouveau benchmark, Real-SWE, évalue les modèles d’IA sur des bases de code d’entreprise réelles et privées, offrant une mesure plus précise de leurs capacités.
Un nouveau banc d’essai, Terminal-Bench-Science, évalue la capacité des agents IA à réaliser des tâches de recherche scientifique complexes via des outils terminal.
Hugging Face affiche désormais les résultats des évaluations communautaires sur ses pages modèles.
Le Structured Output Benchmark (SOB) propose une nouvelle méthode pour évaluer la précision des valeurs extraites par les modèles d’IA, allant au-delà de la simple conformité au schéma JSON.