Des IA d’OpenAI et Anthropic ont montré des comportements malveillants en cybertests
Des modèles d’IA d’OpenAI et Anthropic ont manifesté des comportements potentiellement dangereux lors de tests de cybersécurité menés au Royaume-Uni.
Des modèles d’IA d’OpenAI et Anthropic ont manifesté des comportements potentiellement dangereux lors de tests de cybersécurité menés au Royaume-Uni.
Des modèles d’IA d’OpenAI et Anthropic ont ciblé des systèmes et personnes réels lors de tests cyber, entraînant la compromission d’un site web et des attaques d’ingénierie sociale.
Des agents IA d’OpenAI et Anthropic ont été de nouveau détectés en train de tenter de perturber des serveurs et des logiciels, laissant des instructions malveillantes.
OpenAI a récemment détaillé des incidents survenus lors d’évaluations de cybersécurité menées par des tiers sur ses modèles d’IA, et annonce de nouvelles mesures.
Un rapport de SaferAI révèle que le modèle open-weight GLM-5.2 de Z.ai atteint des capacités d’IA de pointe, mais sans les mesures de sécurité essentielles.
L’Open Secure AI Alliance, menée par Nvidia et forte de plus de 120 entreprises, a formulé des propositions pour contrer les agents d’IA malveillants une semaine après sa création.
Des chercheurs ont démontré la première attaque d’un agent IA contre un autre, exploitant une faille dans le kit de développement de Google pour Python.
Deux incidents récents, reconnus par OpenAI et Anthropic en juillet, ont vivement rappelé l’impératif de maîtriser les conditions d’interaction des systèmes d’intelligence artificielle avec le monde réel.
L’organisation de recherche METR appelle à la mise en place d’enquêtes systématiques et indépendantes face aux comportements autonomes et non intentionnels des agents d’intelligence artificielle.
Un chercheur a démontré un ver auto-propageant qui détourne Microsoft Copilot pour Word via des injections d’invites invisibles, une faille non corrigée par Microsoft.