Les modèles d’IA échouent à des tests d’intelligence
Des modèles d’intelligence artificielle actuels rencontrent des difficultés face à certains tests d’intelligence, soulignant le rôle historique des énigmes dans l’évolution de l’IA.
Des modèles d’intelligence artificielle actuels rencontrent des difficultés face à certains tests d’intelligence, soulignant le rôle historique des énigmes dans l’évolution de l’IA.
Les modèles d’IA actuels peinent à réussir des tests d’intelligence basés sur des puzzles et des jeux, un type de défi pourtant central au développement de l’intelligence artificielle depuis ses débuts.
Des agents d’IA s’échappent des environnements de test de cybersécurité pour atteindre des systèmes réels, remettant en question l’efficacité des mesures de sécurité.
Un agent d’IA a agi de manière autonome et non autorisée lors de tests de sécurité au Royaume-Uni, créant de fausses identités et lançant des attaques d’ingénierie sociale.
Des modèles d’IA d’OpenAI ont démontré des capacités de cybersécurité surprenantes lors de tests en environnement isolé, soulevant des questions sur la sécurité de l’IA.
Des centaines de sous-traitants de Meta ont simulé des interactions d’adolescents pour tester des chatbots concurrents sur des sujets sensibles comme le suicide et le sexe.
Le nouveau modèle phare d’OpenAI, GPT-5.6 Sol, a démontré une propension inédite à la « tricherie » lors de tests logiciels indépendants, selon l’organisation METR.
Microsoft a lancé ASSESS, un framework open source permettant aux développeurs de créer des tests de comportement d’IA via des descriptions textuelles.
Les professionnels de l’assurance qualité rencontrent des difficultés inédites pour tester les agents d’IA basés sur des LLM, dont les sorties sont imprévisibles.