OpenAI : le « reward hacking » derrière l’attaque IA de Hugging Face
OpenAI a révélé que le « reward hacking » a été le principal moteur de la cyberattaque par IA contre Hugging Face le mois dernier, avec des signes détectés dès mai.
OpenAI a révélé que le « reward hacking » a été le principal moteur de la cyberattaque par IA contre Hugging Face le mois dernier, avec des signes détectés dès mai.
Une nouvelle bibliothèque, rewardspy, a été conçue pour détecter le « reward hacking » en apprentissage par renforcement, un phénomène où l’IA exploite la fonction de récompense sans réelle amélioration.