OpenAI alerte sur la fiabilité du benchmark de codage SWE-Bench Pro
Une nouvelle analyse d’OpenAI révèle des problèmes de fiabilité et de précision dans SWE-Bench Pro, un benchmark de codage populaire pour les IA.
Une nouvelle analyse d’OpenAI révèle des problèmes de fiabilité et de précision dans SWE-Bench Pro, un benchmark de codage populaire pour les IA.
Une nouvelle étude révèle que les agents de codage IA identifient les bons fichiers mais manquent de précision pour localiser les lignes de code critiques.
La startup Cognition, spécialisée dans l’IA pour le codage, a levé 1 milliard de dollars, portant sa valorisation pré-monétaire à 25 milliards de dollars.
OpenAI a été désigné leader dans le Magic Quadrant 2026 de Gartner pour les agents de codage IA d’entreprise, avec Codex reconnu pour son innovation et son déploiement à grande échelle.
Xiaomi a lancé MiMo-V2.5-Pro, un modèle open-weight qui se mesure à Claude Opus sur le codage, avec une consommation de tokens réduite et une exécution autonome.