Les modèles d’intelligence artificielle multimodaux rencontrent toujours des difficultés significatives en matière de perception visuelle, indépendamment de leurs capacités de raisonnement logique.
C’est la conclusion d’un nouveau benchmark, PerceptionBench, développé par Moonshot AI. Cet outil vise à évaluer précisément la capacité des IA à « voir » et à interpréter des images, en distinguant cette compétence fondamentale des processus de raisonnement plus complexes.
Les résultats obtenus sont révélateurs des lacunes actuelles. Aucun des modèles de pointe testés n’a réussi à atteindre 60 % de précision. Le modèle GPT-5.6 Sol, bien que leader, ne devance les autres que d’une faible marge, confirmant une faiblesse généralisée.
Cette analyse met en lumière que de nombreuses erreurs, souvent attribuées à un défaut de raisonnement, surviennent en réalité dès le stade initial de la lecture et de l’interprétation des informations visuelles par l’IA. Ces observations soulignent la nécessité de progresser dans la compréhension fondamentale des images par les systèmes d’IA afin d’améliorer leurs performances globales.
Source : The Decoder