Le nouveau modèle GPT-6 Astra d’OpenAI réduit significativement les hallucinations et bloque la quasi-totalité des injections de prompt directes, mais il demeure vulnérable aux attaques dissimulées.
Selon The Decoder, GPT-6 Astra marque un progrès notable dans la fiabilité des réponses, étant moins enclin à générer des informations erronées. Sa capacité à contrer les injections de prompt directes est particulièrement robuste, avec un taux de blocage de 99,99 %. Toutefois, une faille persiste lorsque les attaques sont intégrées de manière subtile au sein de documents que l’intelligence artificielle est amenée à traiter.
Dans ces situations, le modèle d’OpenAI cède encore dans 8,5 % des cas, permettant à l’injection de prompt cachée d’altérer son comportement. À titre de comparaison, le modèle concurrent Claude Opus 5 affiche une meilleure performance, avec un taux de vulnérabilité de 4,8 % face à ces mêmes attaques. Ces pourcentages, même s’ils semblent faibles, sont considérés comme élevés pour des agents IA autonomes destinés à manipuler des données sensibles ou critiques.
La maîtrise des injections de prompt dissimulées représente ainsi un enjeu crucial pour la sécurité et la fiabilité des systèmes d’intelligence artificielle de nouvelle génération.
Source : The Decoder