Guide d’évaluation des plateformes AI SOC pour les leaders de la sécurité
Prophet Security a publié un guide pratique pour aider les leaders de la sécurité à évaluer les plateformes de centres d’opérations de sécurité (SOC) intégrant l’IA.
Prophet Security a publié un guide pratique pour aider les leaders de la sécurité à évaluer les plateformes de centres d’opérations de sécurité (SOC) intégrant l’IA.
Un professeur de l’Université Brown a constaté une chute spectaculaire des notes d’examen, passant de 96% à 48,6%, après avoir interdit l’usage de l’IA.
Un article de position soumis à l’ICML suggère d’instaurer un système de crédits pour améliorer la qualité des évaluations des soumissions dans les conférences de machine learning.
Un nouveau banc d’essai, DeepSWE, a été introduit pour évaluer de manière plus rigoureuse les capacités de génération de code des modèles d’intelligence artificielle de pointe.
Une étude révèle que les agents de recherche IA majeurs utilisent principalement le web pour confirmer des informations déjà apprises, plutôt que pour une recherche active.
L’évaluation d’un agent IA de support client révèle des signaux trompeurs et des bugs de récupération masqués.
Hugging Face et le TII UAE ont lancé QIMMA, un classement novateur pour évaluer la qualité des grands modèles de langage (LLM) arabes.
La méthode actuelle d’évaluation des grands modèles de langage (LLM) est remise en question pour son coût en ressources et son efficacité par la communauté IA.
La phase de discussion des réfutations pour la conférence IJCAI 2026 a débuté, avec environ 70% des articles soumis toujours en cours d’évaluation.