Une nouvelle technique, nommée « Quantization-Aware Healing », permet de créer des modèles d’intelligence artificielle compressés à 4 bits qui surpassent les performances de leurs versions originales en pleine précision.
La quantification est une méthode courante pour réduire la taille et la consommation des modèles d’IA en diminuant la précision de leurs poids. Traditionnellement, cette compression s’accompagne souvent d’une légère dégradation des performances. La méthode « Quantization-Aware Healing » (QAH), proposée par Multiverse Computing et CAI sur le blog HuggingFace, renverse cette tendance.
Le QAH ne se contente pas de compresser le modèle ; il intègre un processus de « guérison » durant la quantification. Ce mécanisme permet non seulement de maintenir, mais aussi d’améliorer la robustesse et la précision du modèle par rapport à son état initial non quantifié.
Cette avancée ouvre des perspectives significatives pour le déploiement de l’IA. Des modèles plus légers et plus performants réduisent drastiquement les besoins en mémoire et en puissance de calcul, facilitant leur intégration sur des appareils à ressources limitées ou dans des environnements énergétiquement contraints.
Source : HuggingFace Blog