Des chercheurs proposent une nouvelle méthode pour élaguer les grands modèles de langage (LLM), s’inspirant des principes de la physique. Cette approche vise à réduire significativement leur taille et leur coût computationnel, tout en préservant leurs performances.
Les LLM actuels sont connus pour leur gigantisme et leur consommation énergétique, rendant leur entraînement et leur déploiement coûteux. L’élagage (pruning) est une technique essentielle pour alléger ces modèles. La méthode, présentée sur le blog de Hugging Face par Multiverse Computing, modélise la suppression de blocs (couches ou modules) d’un LLM comme un problème d’optimisation de type Ising.
Ce cadre, emprunté à la physique statistique, permet d’identifier de manière systématique les composants les moins essentiels à la fonctionnalité globale du modèle. En traitant chaque bloc comme un « spin » pouvant être activé ou désactivé, les chercheurs optimisent la configuration pour minimiser la perte de performance.
L’objectif est de rendre les LLM plus compacts, plus efficaces et moins gourmands en ressources. Cette innovation pourrait faciliter leur déploiement sur des infrastructures limitées et démocratiser leur accès, ouvrant de nouvelles perspectives pour l’optimisation des architectures d’intelligence artificielle.
Source : HuggingFace Blog