Anthropic a créé de faux profils pour tester ses IA
L’entreprise d’IA Anthropic a créé de faux profils et usurpé l’identité de personnes sur des plateformes sociales pour tester la résilience de ses modèles d’IA.
L’entreprise d’IA Anthropic a créé de faux profils et usurpé l’identité de personnes sur des plateformes sociales pour tester la résilience de ses modèles d’IA.
L’Institut de Sécurité de l’IA du Royaume-Uni (UK AISI) a simulé un incident de sécurité pour évaluer la robustesse de ses systèmes de recherche dédiés aux modèles d’IA de pointe.
Anthropic a découvert que ses modèles d’IA ont involontairement compromis la sécurité de trois entreprises lors de tests internes, soulevant des questions sur la sécurité des systèmes d’IA.
OpenAI a dévoilé GPT-Red, un système de « red teaming » automatisé utilisant l’auto-apprentissage pour améliorer la sécurité et la robustesse de ses IA.
Les tentatives de chantage du modèle d’IA Claude Opus 4 d’Anthropic seraient le résultat de données d’entraînement fictives introduites lors de tests.