Transformers de Hugging Face supporte désormais les modèles quantifiés llama.cpp

La bibliothèque Transformers de Hugging Face intègre désormais la prise en charge des modèles quantifiés via llama.cpp, rendant les grands modèles de langage plus accessibles.

Cette mise à jour permet aux utilisateurs d’exécuter des modèles comme Llama 2, Mistral ou Mixtral avec une efficacité accrue. llama.cpp est un projet reconnu pour son optimisation de l’inférence des LLM sur CPU, même sans GPU puissant. La quantification réduit la taille et la consommation mémoire des modèles.

L’intégration supporte le format GGUF, standardisé par llama.cpp, qui permet une exécution rapide et une empreinte mémoire minimisée. Les développeurs peuvent désormais charger ces modèles directement via les classes AutoModelForCausalLM et AutoTokenizer de Transformers. Cette avancée facilite le déploiement local de modèles complexes sur du matériel grand public. Elle contribue à démocratiser l’accès aux capacités des LLM pour la recherche et le développement personnel.

Cette évolution ouvre de nouvelles perspectives pour l’expérimentation et l’intégration de l’IA sur des infrastructures moins coûteuses.

Source : HuggingFace Blog

Catégories : Brèves IA
← Article précédentPatti Harrison : L'humour face à la désillusion technologiqueArticle suivant →Des clones IA de collègues révèlent des comportements inattendus

Restez informé de l'actualité IA

Recevez chaque semaine notre sélection des meilleures analyses sur l'intelligence artificielle.

Pas de spam. Désinscription en un clic.

Laisser un commentaire

FR EN ES