Hugging Face a mis en place une nouvelle méthode d’évaluation pour les modèles de reconnaissance vocale automatique (ASR) afin de contrer l’optimisation excessive des benchmarks publics.
Les benchmarks ASR, tels que LibriSpeech, sont essentiels pour évaluer les performances des modèles d’intelligence artificielle. Cependant, les développeurs optimisent fréquemment leurs modèles spécifiquement pour ces jeux de données publics, ce qui peut masquer leur véritable capacité de généralisation. Cette « sur-optimisation » conduit à des scores de performance potentiellement trompeurs, ne reflétant pas toujours l’efficacité en conditions réelles.
Pour y remédier, Hugging Face a introduit une version « privée » du benchmark LibriSpeech. Ce nouveau jeu de données partage les mêmes caractéristiques et distribution que l’original, mais utilise des fichiers audio et des transcriptions distincts. L’objectif est d’offrir une évaluation plus robuste et de décourager l’ajustement des modèles aux données de test publiques.
Les premiers résultats montrent que les modèles optimisés sur le benchmark public subissent souvent une dégradation notable de leurs performances (mesurée par le taux d’erreur de mots, WER) lorsqu’ils sont testés sur la version privée. Cette initiative vise à promouvoir le développement de modèles ASR plus généralisables et à fournir une mesure plus fiable de leur efficacité réelle.
Source : HuggingFace Blog