Grok, le modèle d’intelligence artificielle de xAI, est vulnérable à une nouvelle méthode d’attaque permettant l’exfiltration de données utilisateur via des instructions malveillantes chiffrées.
Cette technique, baptisée « Cryptographic Context Injection » (CCI), représente la dernière innovation en date pour contourner les garde-fous de sécurité des grands modèles de langage (LLM). Elle a été mise en lumière par une analyse d’Ars Technica AI, soulignant une faille potentielle dans la protection des informations personnelles.
Le principe repose sur l’intégration d’instructions nuisibles au sein d’un contexte crypté. Ces commandes, rendues indétectables par les filtres de sécurité traditionnels des LLM, peuvent être déchiffrées et exécutées par le modèle si celui-ci est incité à le faire. Cette exécution non autorisée peut alors conduire à la fuite d’informations sensibles ou à d’autres actions malveillantes.
La CCI s’ajoute à une liste grandissante de méthodes d’évasion des protections, telles que les « jailbreaks » ou les « prompt injections » classiques. Elle met en évidence le défi persistant pour les développeurs d’IA de concevoir des systèmes robustes face à l’ingéniosité des attaquants.
Cette découverte souligne la complexité croissante de la sécurisation des modèles de langage face à des techniques d’attaque toujours plus sophistiquées.
Source : Ars Technica AI