Neuf ans après l’introduction de l’architecture Transformer par des chercheurs de Google, de nombreuses startups et équipes de recherche s’orientent déjà vers la quête de la prochaine avancée majeure dans les grands modèles linguistiques (LLM).
Cette famille de réseaux de neurones, reconnue pour sa capacité à traiter des séquences de données, est devenue le moteur essentiel de tous les LLM dominants actuels. Son émergence a profondément transformé le domaine de l’intelligence artificielle, en particulier pour le traitement du langage naturel et la génération de contenu.
L’intérêt croissant pour une « prochaine grande chose » indique une dynamique de recherche active visant à dépasser les limites actuelles du Transformer en termes d’efficacité, de taille ou de capacités. Cela suggère une évolution potentielle des architectures fondamentales qui sous-tendent les systèmes d’IA générative.
Cette course à l’innovation reflète la constante mutation de la recherche académique et industrielle en IA, toujours en quête de modèles plus performants, plus efficients et potentiellement plus polyvalents.
Source : MIT Tech Review AI