Le défi de tester les agents d’IA non déterministes en production
Les professionnels de l’assurance qualité rencontrent des difficultés inédites pour tester les agents d’IA basés sur des LLM, dont les sorties sont imprévisibles.
Les professionnels de l’assurance qualité rencontrent des difficultés inédites pour tester les agents d’IA basés sur des LLM, dont les sorties sont imprévisibles.
Browser Harness, une nouvelle bibliothèque open source, offre aux LLM une autonomie inédite pour naviguer et interagir sur le Web.
Deepseek AI rend publics ses nouveaux modèles linguistiques de grande taille, Deepseek V4, entraînés sur 2 000 milliards de tokens.
Les grands modèles de langage, quelle que soit leur taille, perdent en efficacité lorsqu’ils sont confrontés à des instructions hostiles.
Tencent et Alibaba négocient une entrée dans DeepSeek, valorisée à plus de 20 milliards de dollars.
Une étude comparative de 18 grands modèles de langage pour l’OCR révèle que des modèles plus anciens ou moins coûteux surpassent fréquemment les plus récents.
L’IA dans les cabinets d’avocats évolue, passant de l’achat de licences à une utilisation concrète pour des tâches spécifiques.
Les grands modèles de langage (LLM) devraient transformer la recherche en ligne d’ici cinq ans, selon des expertes SEO.
Des modèles de langage en production violent les contraintes de leurs outils, inventant des fonctionnalités d’interface utilisateur.
Hugging Face et le TII UAE ont lancé QIMMA, un classement novateur pour évaluer la qualité des grands modèles de langage (LLM) arabes.