Une nouvelle étude d’AllenAI, relayée par Hugging Face, révèle que les benchmarks actuels des grands modèles de langage (LLM) mesurent souvent la mémorisation plutôt que la véritable capacité de raisonnement.
De nombreux LLM affichent des performances élevées sur les benchmarks standards. Cependant, cette réussite pourrait être attribuée à la mémorisation des données d’entraînement plutôt qu’à une compréhension ou un raisonnement profond. C’est ce que met en lumière le cadre BenchMIRT, développé par AllenAI.
BenchMIRT propose des ensembles de données « miroirs » qui, bien que structurellement similaires aux données d’entraînement, en diffèrent sémantiquement. Cette approche permet de distinguer la mémorisation de la capacité de généralisation. Les résultats montrent que de nombreux LLM voient leurs performances chuter drastiquement sur ces tâches miroirs.
Cette observation suggère que les scores actuels des benchmarks pourraient être surestimés, et souligne l’urgence de développer des méthodes d’évaluation plus robustes. La question de ce que mesurent réellement ces outils reste centrale pour l’avancement de l’IA.
Source : HuggingFace Blog