La bibliothèque Transformers de Hugging Face intègre désormais la prise en charge des modèles quantifiés via llama.cpp, rendant les grands modèles de langage plus accessibles.
Cette mise à jour permet aux utilisateurs d’exécuter des modèles comme Llama 2, Mistral ou Mixtral avec une efficacité accrue. llama.cpp est un projet reconnu pour son optimisation de l’inférence des LLM sur CPU, même sans GPU puissant. La quantification réduit la taille et la consommation mémoire des modèles.
L’intégration supporte le format GGUF, standardisé par llama.cpp, qui permet une exécution rapide et une empreinte mémoire minimisée. Les développeurs peuvent désormais charger ces modèles directement via les classes AutoModelForCausalLM et AutoTokenizer de Transformers. Cette avancée facilite le déploiement local de modèles complexes sur du matériel grand public. Elle contribue à démocratiser l’accès aux capacités des LLM pour la recherche et le développement personnel.
Cette évolution ouvre de nouvelles perspectives pour l’expérimentation et l’intégration de l’IA sur des infrastructures moins coûteuses.
Source : HuggingFace Blog