Artificial Analysis révise son Indice d’Intelligence après les doutes sur GPT-6 Astra
Artificial Analysis a mis à jour son Indice d’Intelligence, révisant la notation de GPT-6 Astra suite aux critiques concernant sa précédente évaluation.
Artificial Analysis a mis à jour son Indice d’Intelligence, révisant la notation de GPT-6 Astra suite aux critiques concernant sa précédente évaluation.
DeepMind a lancé les premières évaluations d’IA en double aveugle au monde, une méthode innovante pour éliminer les biais humains dans l’appréciation des systèmes.
Hugging Face introduit une méthode d’évaluation privée pour les modèles de reconnaissance vocale automatique (ASR) afin de mesurer et contrer l’optimisation excessive des benchmarks publics.
Artificial Analysis a lancé Optima, une plateforme permettant de créer des benchmarks d’IA personnalisés avec les données et flux de travail des utilisateurs.
Une nouvelle bibliothèque Python open-source, oncothresh, permet d’évaluer les modèles d’IA en oncologie spécifiquement aux seuils de décision clinique.
OpenAI a récemment détaillé des incidents survenus lors d’évaluations de cybersécurité menées par des tiers sur ses modèles d’IA, et annonce de nouvelles mesures.
Hugging Face a dévoilé Real World VoiceEQ, une nouvelle méthodologie pour évaluer la qualité humaine des voix générées par l’IA, au-delà des métriques techniques.
Une nouvelle analyse d’OpenAI révèle des problèmes de fiabilité et de précision dans SWE-Bench Pro, un benchmark de codage populaire pour les IA.
Les métriques, bien qu’utiles, possèdent des faiblesses intrinsèques pouvant masquer ou altérer la réalité, un constat crucial pour l’évaluation de l’intelligence artificielle.
OpenAI a dévoilé la Simulation de Déploiement, une méthode pour prédire le comportement de ses modèles d’IA avant leur mise en service, améliorant sécurité et évaluation.