La société Qonto, spécialisée dans les services bancaires aux entreprises, a développé QontoFAQ, un nouveau benchmark pour évaluer plus précisément les modèles de recherche d’informations.
Ce nouvel outil vise à pallier les limites des benchmarks existants, souvent perçus comme « sur-optimisés » par les modèles d’IA. L’objectif principal de Qonto était de lier l’évaluation à un cas d’usage concret : identifier l’article pertinent répondant à une question produit spécifique.
Pour ce faire, l’entreprise a élaboré une nouvelle métrique qui semble mieux refléter la pertinence réelle des documents. Un jeu de données de référence a également été construit pour mesurer la performance des modèles d’embeddings, essentiels à la recherche d’informations.
Cette initiative, détaillée dans un article de blog et accompagnée de son code source, offre à la communauté de l’IA un nouvel instrument pour affiner et améliorer les systèmes de récupération d’informations.
Source : Reddit r/MachineLearning