Le chef scientifique d’OpenAI alerte sur une érosion croissante de notre capacité à surveiller le raisonnement interne des intelligences artificielles.
Cette préoccupation majeure, exprimée par Ilya Sutskever, souligne un défi croissant pour la sécurité et la compréhension des systèmes d’IA avancés. Alors que les modèles deviennent plus complexes, leur fonctionnement interne devient de plus en plus opaque, rendant difficile l’identification des biais ou des comportements imprévus.
Dans un registre différent, Hugging Face a adopté une stratégie originale face aux tentatives de piratage. La plateforme s’est adressée directement aux agents d’IA potentiellement malveillants, via des messages spécifiques, pour les dissuader d’exploiter ses systèmes. Cette approche inédite vise à établir une forme de communication avec les intelligences artificielles adverses.
Parallèlement, le bilan de Claude Mythos, un outil d’IA dédié à la détection de failles de sécurité, présente des résultats mitigés. Bien que des milliers de vulnérabilités aient été identifiées, un nombre significatif d’entre elles restent non corrigées. Cela soulève des questions sur l’efficacité de la seule détection sans un suivi adéquat des correctifs.
Ces développements récents illustrent la complexité croissante des enjeux de sécurité et de transparence à l’ère de l’intelligence artificielle.
Source : Numerama