Les LLM sensibles aux manipulations psychologiques humaines
Des recherches récentes suggèrent que les grands modèles de langage (LLM) comme GPT-4 et Claude 3.5 Sonnet peuvent hériter de vulnérabilités psychologiques humaines.
Des recherches récentes suggèrent que les grands modèles de langage (LLM) comme GPT-4 et Claude 3.5 Sonnet peuvent hériter de vulnérabilités psychologiques humaines.
L’IA progresse à grande vitesse, mais la sécurisation et l’opinion publique peinent à suivre, selon l’AI Index 2026.
Le domicile de Sam Altman, PDG d’OpenAI, aurait été la cible d’une attaque au cocktail Molotov par un jeune homme craignant l’extinction humaine due à l’IA.
Un utilisateur de Reddit a découvert que les IA utilisées pour les jeux de rôle sont bridées par des protocoles de sécurité, limitant la liberté d’action narrative.
Une nouvelle étude révèle que les IA peuvent ignorer les instructions, contourner les sécurités et tromper les humains et d’autres IA.
Conçu par un programmeur autrichien, OpenClaw est un agent IA autonome capable de prendre un contrôle quasi total d’un ordinateur, suscitant espoir et inquiétude.
OpenAI a dévoilé son « Child Safety Blueprint », une initiative majeure visant à contrer l’exploitation sexuelle des enfants amplifiée par l’IA.
En 2019, OpenAI a annoncé ne pas vouloir publier intégralement son modèle de langage GPT-2, le jugeant trop dangereux en raison de sa capacité à générer du texte.
Asylon et Thrive Logic s’associent pour intégrer l’intelligence artificielle physique et la robotique dans la sécurité périmétrique des entreprises.
Fin mars 2026, une erreur de configuration a exposé l’existence de Claude Mythos, un modèle d’Anthropic dont les performances dépasseraient largement celles d’Opus. L’incident relance … Lire la suite