La fiabilité des juges LLM, même en cas de consensus, est remise en question par une nouvelle étude d’Amazon Science.
Les modèles de langage (LLM) sont de plus en plus utilisés comme « juges » pour évaluer la qualité des réponses générées par d’autres IA. Une pratique courante suggère que l’accord entre plusieurs de ces juges LLM renforce la confiance en leur jugement.
Cependant, des recherches menées par Amazon Science indiquent que cet accord ne garantit pas toujours l’exactitude. Les juges LLM peuvent converger vers des évaluations incorrectes ou biaisées, même lorsqu’ils sont unanimes. L’étude suggère que la diversité des modèles ou des approches est plus efficace que la simple multiplication des juges pour améliorer la fiabilité.
Cette découverte souligne un défi persistant dans l’évaluation des performances des IA. Alors que l’évaluation humaine reste la référence, l’optimisation des juges LLM est essentielle pour une mise à l’échelle efficace.
La question demeure de savoir comment construire des systèmes d’évaluation automatisés qui soient à la fois évolutifs et intrinsèquement fiables.
Source : Hacker News (Algolia)