Les LLM à l’épreuve des Olympiades Internationales de Mathématiques
Des modèles de langage avancés ont été évalués sur des problèmes inédits des Olympiades Internationales de Mathématiques 2026, montrant des capacités de résolution complexes.
Des modèles de langage avancés ont été évalués sur des problèmes inédits des Olympiades Internationales de Mathématiques 2026, montrant des capacités de résolution complexes.
Geekbench 7 est lancé avec des tests mis à jour pour mieux refléter les usages actuels, incluant l’encodage AV1, Whisper et la prise en charge de CUDA.
Le modèle chinois Kimi K3 de Moonshot a dominé le classement Code Arena: Frontend, surpassant Claude Fable 5 et GPT-5.6 Sol, mais affiche des lacunes en mathématiques complexes.
Un nouveau benchmark évalue la capacité des LLM à coordonner des actions complexes dans des mondes ouverts, montrant des performances limitées mais un potentiel pour Gemini 3.1 Pro.
Une startup développe un benchmark de données précis, validé par des experts, pour évaluer les modèles d’IA dans l’estimation des coûts de construction.
Ollama, l’outil open source pour l’IA sur PC, a levé 65 millions de dollars et compte désormais près de 9 millions d’utilisateurs.
Une nouvelle analyse d’OpenAI révèle des problèmes de fiabilité et de précision dans SWE-Bench Pro, un benchmark de codage populaire pour les IA.
Un nouveau système de mémoire hiérarchique open-source nommé TRACE a démontré une performance significativement supérieure pour les agents LLM, atteignant 82,5 % sur le benchmark MemoryAgentBench.
IBM Research a lancé ScarfBench, un benchmark pour évaluer la capacité des agents d’IA à migrer des applications Java d’entreprise, une tâche complexe et coûteuse.
OpenAI a lancé GeneBench-Pro, un nouveau banc d’essai pour évaluer les performances de l’IA en génomique, biologie et recherche scientifique avec des données réelles.