DeepInfra s’intègre aux fournisseurs d’inférence de Hugging Face
Hugging Face intègre DeepInfra pour optimiser le déploiement et l’accès aux grands modèles de langage.
Hugging Face intègre DeepInfra pour optimiser le déploiement et l’accès aux grands modèles de langage.
Skymizer propose une carte unique pour l’inférence locale de LLM massifs, optimisant la génération de texte.
Google lance cette semaine de nouvelles puces TPU optimisées pour l’inférence IA.
Une nouvelle approche d’attention hybride a permis d’accélérer l’inférence de petits modèles de code jusqu’à 50 fois, tout en maintenant une faible perte de perplexité.