Contamination des benchmarks : OpenAI retire les scores SWE-bench Verified

OpenAI a récemment annoncé l’arrêt du rapport des scores SWE-bench Verified, recommandant aux autres laboratoires de faire de même, en raison d’une contamination avérée des benchmarks d’évaluation.

Dès février, l’entreprise a cessé de publier ces résultats après avoir constaté que les modèles dits « de frontière » testés pouvaient reproduire, pour certaines tâches, soit les correctifs de référence écrits par des humains, soit des détails verbatim des énoncés de problèmes. Ce phénomène a conduit à une stagnation des progrès, avec seulement six points gagnés en six mois, rendant incertaine la part de capacité réelle dans les scores restants.

La décision est d’autant plus significative que le laboratoire à l’origine du benchmark SWE-bench, et qui avait toutes les raisons de le maintenir, est celui qui a choisi de le retirer. Il est désormais clair que les rapports de décontamination habituels ne suffisent pas à corriger ce type de contamination profonde des benchmarks.

Cette situation souligne la complexité croissante de l’évaluation fiable des performances des modèles d’intelligence artificielle.

Source : Reddit r/MachineLearning

Catégories : Brèves IA
← Article précédent"Pirate Face" sauve des modèles LLM menacés de suppressionArticle suivant →ScrollEd : les manuels scolaires se transforment en flux interactif

Restez informé de l'actualité IA

Recevez chaque semaine notre sélection des meilleures analyses sur l'intelligence artificielle.

Pas de spam. Désinscription en un clic.

Laisser un commentaire

FR EN ES