Une étude récente démontre que onze modèles d’intelligence artificielle générative, sollicités par une même requête, produisent des résultats significativement différents en termes de contenu et de respect des consignes.
L’expérience, menée par Netlify, a consisté à demander à des modèles comme GPT-4o, Claude 3 Opus et Llama 3 de rédiger une courte histoire de 500 mots sur un chevalier et un dragon, incluant trois obstacles. Les réponses ont révélé des écarts notables, notamment sur le nombre de mots, qui variait de 300 à plus de 700, loin de la consigne exacte.
Au-delà de la longueur, la qualité narrative, la créativité et la capacité à intégrer les trois obstacles différaient grandement d’un modèle à l’autre. Cette divergence souligne l’importance cruciale du choix du modèle en fonction des objectifs spécifiques, qu’il s’agisse de précision, de créativité ou de respect strict des instructions.
L’étude met également en lumière les disparités de coûts entre ces modèles, un facteur essentiel pour les développeurs et les entreprises. Elle suggère qu’il n’existe pas de « meilleur » modèle universel, mais plutôt des outils adaptés à des cas d’usage précis. La sélection d’un modèle d’IA générative reste donc une décision stratégique, nécessitant une évaluation approfondie de ses performances et de son coût par rapport aux attentes.
Source : Hacker News (Algolia)