GPUHedge, un nouvel outil open source, réduit drastiquement la latence de démarrage à froid des GPU serverless, améliorant le p95 de 117 à 30 secondes.
Le développement de GPUHedge découle d’une problématique courante dans l’utilisation de modèles d’IA volumineux. Son créateur a constaté que l’évaluation d’un modèle d’IA de 17 Go sur des fournisseurs de GPU sans serveur entraînait des latences de démarrage à froid pouvant atteindre 90 à 122 secondes. Changer de fournisseur ne résolvait pas le problème, chaque plateforme présentant ses propres délais de latence.
Pour y remédier, GPUHedge adopte une stratégie de « couverture » (hedging) en distribuant les requêtes sur plusieurs fournisseurs de GPU serverless. Cette approche permet de contourner les pics de latence individuels. Actuellement en phase alpha et sous licence Apache-2.0, cet outil est disponible en open source.
L’implémentation de GPUHedge a démontré une amélioration significative, ramenant la latence de démarrage à froid p95 de 117 secondes à seulement 30 secondes. Cette innovation pourrait optimiser considérablement la performance et la réactivité des applications d’IA déployées sur des infrastructures serverless. Reste à voir comment cette solution évoluera et sera adoptée par la communauté des développeurs et les opérateurs de services d’IA.
Source : Reddit r/MachineLearning