Un nouveau banc d’essai, nommé Terminal-Bench-Science, a été lancé pour évaluer la capacité des agents d’intelligence artificielle à exécuter des tâches de recherche scientifique complexes.
Ce benchmark vise à combler le fossé entre les performances actuelles des IA et les exigences des workflows scientifiques réels. Il se distingue par l’utilisation d’outils basés sur le terminal, tels que Python, Bash, LaTeX et les navigateurs web, pour simuler des environnements de travail authentiques. L’objectif est de tester les agents sur des scénarios concrets, allant au-delà des évaluations traditionnelles de génération de texte ou de code.
Développé par une équipe de chercheurs, Terminal-Bench-Science propose un cadre d’évaluation standardisé et ouvert. Il inclut des tâches variées comme l’analyse de données, la revue de littérature, le débogage de code et la conception d’expériences, nécessitant des agents une capacité à raisonner, planifier, exécuter et itérer. Ce projet est disponible en open-source sur GitHub.
Cette initiative pourrait ainsi orienter le développement futur des agents IA vers une autonomie accrue dans les laboratoires et la recherche scientifique.
Source : Hacker News (Algolia)