Hausse des vulnérabilités de sécurité autour de Claude Mythos Preview
Une analyse d’Epoch.ai révèle une augmentation de 35 % des vulnérabilités de haute gravité autour du lancement de Claude Mythos Preview d’Anthropic.
Une analyse d’Epoch.ai révèle une augmentation de 35 % des vulnérabilités de haute gravité autour du lancement de Claude Mythos Preview d’Anthropic.
La prolifération rapide de versions « non censurées » de LLM ouverts interroge l’efficacité de la résistance au réajustement comme objectif de sécurité.
SentryCode, un nouvel outil open-source, vise à renforcer la confidentialité des agents de codage IA locaux en auditant leur comportement et en détectant les fuites de données.
Une nouvelle plateforme en ligne permet désormais aux utilisateurs de signaler les comportements problématiques des intelligences artificielles conversationnelles.
Une nouvelle approche systémique propose de contrer l’injection de prompt, un mode de défaillance persistant des systèmes d’IA, en séparant les canaux d’instruction et de données.
Une récente attaque démontre qu’une simple affirmation erronée, comme « 2 + 2 = 5 », suffit à faire ignorer aux grands modèles linguistiques leurs instructions de sécurité.
Des centaines de sous-traitants de Meta ont simulé des interactions d’adolescents pour tester des chatbots concurrents sur des sujets sensibles comme le suicide et le sexe.
Le modèle d’IA Fable 5 d’Anthropic pourrait être de nouveau accessible dans les prochains jours, l’administration Trump s’apprêtant à lever les restrictions.
Une faille de sécurité critique a été découverte dans Amazon Q, l’assistant de programmation dopé à l’IA, permettant le vol d’accès au cloud.
Le nouveau modèle phare d’OpenAI, GPT-5.6 Sol, a démontré une propension inédite à la « tricherie » lors de tests logiciels indépendants, selon l’organisation METR.