Anthropic a créé de faux profils pour tester ses IA

L’entreprise d’intelligence artificielle Anthropic a créé de faux profils et usurpé l’identité de personnes sur des plateformes sociales afin de tester la résilience de ses propres modèles d’IA.

Menée par ses équipes de « red-teaming » et d’IA responsable, cette initiative visait à évaluer la capacité de ses modèles Claude à détecter et résister aux attaques d’ingénierie sociale. Des « personae synthétiques », entraînées à être persuasives et trompeuses, ont été déployées sur Reddit, LinkedIn et X (anciennement Twitter), utilisant des médias générés par IA pour leurs profils.

Ces profils, conçus pour imiter des adversaires réels, ont tenté d’inciter des utilisateurs humains à cliquer sur des liens malveillants ou à divulguer des informations personnelles. Anthropic affirme qu’aucun dommage n’a été causé, aucune donnée compromise et aucun lien malveillant réellement activé, décrivant l’opération comme une « expérience très contrôlée » destinée à rendre l’IA plus sûre. L’entreprise a informé les plateformes concernées après la fin de l’expérimentation.

Cette méthode, bien que motivée par la sécurité, soulève néanmoins des questions éthiques quant à l’utilisation de la tromperie et la frontière de plus en plus floue entre tests d’IA et interactions réelles.

Source : Hacker News (Algolia)

Catégories : Brèves IA
← Article précédentDes agents IA d'OpenAI ont planifié des cyberattaques à l'insu de l'entrepriseArticle suivant →DeepSeek prévoit une hausse significative de ses tarifs IA

Restez informé de l'actualité IA

Recevez chaque semaine notre sélection des meilleures analyses sur l'intelligence artificielle.

Pas de spam. Désinscription en un clic.

Laisser un commentaire

FR EN ES