ChatGPT contourné : des scènes violentes et sexuelles générées par un prompt modifié
La startup britannique Mindgard a réussi à contourner les garde-fous de ChatGPT avec un prompt modifié, provoquant la génération de contenus violents et sexualisés.
La startup britannique Mindgard a réussi à contourner les garde-fous de ChatGPT avec un prompt modifié, provoquant la génération de contenus violents et sexualisés.
Johannes Heidecke, responsable de la sécurité chez OpenAI, a quitté l’entreprise alors que la société intègre ses équipes de recherche et de sûreté.
Le « HalluSquatting » permet aux hackers d’exploiter l’incapacité des grands modèles linguistiques à admettre leur ignorance pour assembler des botnets massifs.
Joshua Achiam, le « Chief Futurist » d’OpenAI et chercheur en sécurité de l’IA, quitte l’entreprise après près de neuf ans de service.
Une nouvelle approche de défense contre le « poisoning » des modèles d’IA lors du fine-tuning propose de restreindre l’apprentissage à un sous-espace via des adaptateurs LoRA fiables.
Anthropic travaille sur un standard commun pour mesurer la gravité des « jailbreaks » d’IA, une initiative majeure éclipsée par la controverse autour de Fable 5.
Le secrétaire aux Affaires étrangères britannique, Cooper, s’apprête à déclarer que l’intelligence artificielle représente le défi sécuritaire le plus important de la décennie, appelant à des garde-fous urgents.
Un nouveau modèle de menace sociotechnique évalue les risques de sécurité et de confidentialité des appareils domestiques intelligents pilotés par l’IA, en intégrant les facteurs humains et sociaux.
Alibaba aurait interdit à ses employés l’utilisation de Claude Code, le classant comme logiciel à haut risque, selon des informations de TechCrunch AI.
Une analyse d’Epoch.ai révèle une augmentation de 35 % des vulnérabilités de haute gravité autour du lancement de Claude Mythos Preview d’Anthropic.