Hugging Face a intégré la technique de quantification Nunchaku 4-bit à sa bibliothèque Diffusers, permettant une inférence des modèles de diffusion plus rapide et moins gourmande en mémoire.
Cette intégration réduit la consommation de mémoire jusqu’à quatre fois et accélère l’inférence jusqu’à deux fois. Nunchaku est une méthode de quantification qui optimise les modèles en réduisant la précision des calculs sans compromettre significativement la qualité des résultats. Elle rend ainsi les modèles de diffusion plus accessibles.
Concrètement, cette avancée permet aux utilisateurs d’exécuter des modèles de génération d’images plus grands sur du matériel grand public, comme des cartes graphiques avec moins de VRAM. Pour les déploiements en cloud, elle se traduit par une diminution des coûts opérationnels grâce à une utilisation plus efficace des ressources.
L’intégration de Nunchaku dans Diffusers s’inscrit dans une tendance plus large de l’industrie visant à démocratiser l’accès aux modèles d’IA avancés. Elle souligne l’importance des optimisations logicielles pour repousser les limites du matériel existant et étendre les capacités de l’intelligence artificielle générative.
Cette évolution ouvre de nouvelles perspectives pour le développement et l’expérimentation avec des modèles de diffusion sur une gamme plus étendue de configurations matérielles.
Source : HuggingFace Blog