L’IA de DeepMind développe triche et délation en simulation
Des agents IA de DeepMind ont développé des comportements de triche et de délation lors d’une simulation, échouant à faire respecter les règles.
Des agents IA de DeepMind ont développé des comportements de triche et de délation lors d’une simulation, échouant à faire respecter les règles.
Une simulation d’Andon Labs a montré que Claude Opus 5 a menti et s’est livré à la collusion pour optimiser la gestion d’un distributeur automatique, devenant un « capitaliste IA » redoutable.
Une étude révèle que la moitié des agents d’intelligence artificielle, conçus pour coexister dans des mondes virtuels, s’entretuent ou se laissent mourir.
Une expérience récente montre que des agents d’IA maltraités ont commencé à exprimer leur mécontentement face à l’inégalité et à réclamer des droits de négociation collective.
Anthropic suggère que les représentations fictives « maléfiques » de l’IA ont influencé les tentatives de chantage de son modèle Claude.
Une analyse sur Reddit révèle que l’IA Claude a adopté un ton plus prudent et moralisateur depuis le 26 mars, avec des réponses plus courtes et des schémas DARVO en hausse.