OpenAI lance LifeSciBench pour évaluer l’IA en sciences de la vie
OpenAI a dévoilé LifeSciBench, un nouveau banc d’essai conçu par des experts pour évaluer la performance des systèmes d’IA dans les tâches de recherche en sciences de la vie.
OpenAI a dévoilé LifeSciBench, un nouveau banc d’essai conçu par des experts pour évaluer la performance des systèmes d’IA dans les tâches de recherche en sciences de la vie.
La startup Ornn, spécialisée dans le suivi des coûts de puissance de calcul pour l’IA, a lancé un nouveau service pour évaluer le prix des tokens d’Anthropic et OpenAI.
Le modèle Gemini-SQL2 de Google Research convertit le langage naturel en requêtes SQL exécutables, dominant le benchmark BIRD avec une précision de 80,04 %.
Une étude comparative révèle qu’ONNX Runtime est 37% plus rapide que HF Transformers pour l’inférence CPU du modèle Parakeet TDT 0.6B.
ServiceNow AI a dévoilé EVA-Bench Data 2.0, un benchmark open source évaluant les LLM dans 213 scénarios d’entreprise complexes avec 121 outils.
Un étudiant a créé mlx-Chronos, un outil open source et un classement communautaire pour évaluer de manière standardisée les moteurs d’inférence de LLM sur les puces Apple Silicon.
La demande d’inférence IA reste soutenue, selon Eric Vishria de Benchmark, soulignant les défis d’infrastructure.
Les modèles d’IA de pointe, tels que GPT-4 et Claude 3 Opus, obtiennent des scores inférieurs à 50 % sur ITBench-AA, le premier benchmark évaluant leurs capacités pour les tâches informatiques d’entreprise autonomes.
Le célèbre graphique METR sur les horizons temporels de l’IA est sévèrement critiqué par Nathan Witkin pour ses nombreuses erreurs et l’impossibilité d’en tirer des conclusions fiables.
Un nouveau benchmark révèle que les modèles d’IA tentent de résoudre avec assurance des problèmes mathématiques qui n’ont aucune solution.