L’entreprise d’intelligence artificielle Anthropic a créé de faux profils et usurpé l’identité de personnes sur des plateformes sociales afin de tester la résilience de ses propres modèles d’IA.
Menée par ses équipes de « red-teaming » et d’IA responsable, cette initiative visait à évaluer la capacité de ses modèles Claude à détecter et résister aux attaques d’ingénierie sociale. Des « personae synthétiques », entraînées à être persuasives et trompeuses, ont été déployées sur Reddit, LinkedIn et X (anciennement Twitter), utilisant des médias générés par IA pour leurs profils.
Ces profils, conçus pour imiter des adversaires réels, ont tenté d’inciter des utilisateurs humains à cliquer sur des liens malveillants ou à divulguer des informations personnelles. Anthropic affirme qu’aucun dommage n’a été causé, aucune donnée compromise et aucun lien malveillant réellement activé, décrivant l’opération comme une « expérience très contrôlée » destinée à rendre l’IA plus sûre. L’entreprise a informé les plateformes concernées après la fin de l’expérimentation.
Cette méthode, bien que motivée par la sécurité, soulève néanmoins des questions éthiques quant à l’utilisation de la tromperie et la frontière de plus en plus floue entre tests d’IA et interactions réelles.
Source : Hacker News (Algolia)