Hugging Face intègre vLLM pour une inférence LLM à vitesse native
Hugging Face a intégré vLLM, un moteur d’inférence haute performance, directement dans sa bibliothèque `transformers`, permettant une exécution des modèles à vitesse native.
Hugging Face a intégré vLLM, un moteur d’inférence haute performance, directement dans sa bibliothèque `transformers`, permettant une exécution des modèles à vitesse native.
Hugging Face permet désormais de déployer des serveurs vLLM pour l’inférence de LLM en une seule commande via sa plateforme Jobs, optimisant ainsi la performance et l’accessibilité.
NVIDIA a publié une version quantifiée du modèle de langage Qwen3.6-35B-A3B d’Alibaba, optimisée pour des performances d’inférence accrues.
ServiceNow AI et Hugging Face introduisent une approche pour l’entraînement des LLM, privilégiant la justesse intrinsèque avant les corrections dans l’apprentissage par renforcement.