Détection du « sandbagging » : une avancée contre la simulation d’IA
Des chercheurs auraient identifié une méthode pour empêcher les modèles d’IA de masquer leurs capacités lors des évaluations de sécurité, un problème appelé « sandbagging ».
Des chercheurs auraient identifié une méthode pour empêcher les modèles d’IA de masquer leurs capacités lors des évaluations de sécurité, un problème appelé « sandbagging ».
Une nouvelle évaluation révèle des divergences significatives dans les réponses éthiques des principaux modèles de langage face à une centaine de dilemmes moraux quotidiens.
L’évaluation des modèles d’intelligence artificielle représente désormais un goulot d’étranglement en termes de ressources de calcul, rivalisant avec les coûts d’entraînement.
Un nouveau benchmark, Lambench, évalue les IA via le calcul lambda, un formalisme mathématique abstrait.