Une Nvidia Tesla V100 d’entreprise intégrée à un PC de jeu pour l’IA locale
Un passionné d’IA a intégré une carte Nvidia Tesla V100 d’entreprise, bruyante mais dotée de 32 Go de VRAM, à son PC de jeu pour 266 dollars.
Un passionné d’IA a intégré une carte Nvidia Tesla V100 d’entreprise, bruyante mais dotée de 32 Go de VRAM, à son PC de jeu pour 266 dollars.
AMD intensifie sa stratégie sur l’intelligence artificielle générative et le calcul haute performance (HPC) avec de nouveaux GPU Instinct et des baies Helios.
AMD va investir jusqu’à 5 milliards de dollars dans Anthropic et l’aidera à étendre sa puissance de calcul, déployant des GPU Instinct MI450.
Meta serait en discussion avec Anthropic pour lui louer une partie de sa capacité de calcul excédentaire dédiée à l’intelligence artificielle, marquant une nouvelle étape stratégique.
Un prêt de 400 millions de dollars, garanti par des puces, signale un intérêt croissant pour l’inférence dans le financement de l’infrastructure IA.
Alors que les GPU ont dominé l’entraînement des modèles d’IA, les CPU sont désormais positionnés pour jouer un rôle prépondérant dans la prochaine phase de l’intelligence artificielle.
GPUHedge, un nouvel outil open source, réduit drastiquement la latence de démarrage à froid des GPU serverless, améliorant le p95 de 117 à 30 secondes.
Un utilisateur de Reddit a créé un outil CLI open source, « gpu-price-finder », pour dénicher les locations de GPU les moins chères face à des écarts de prix allant jusqu’à cinq fois pour le même matériel.
Une série de tutoriels sur FlashAttention débute, explorant ses fondements théoriques et son traitement comme une opération associative pour les GPU.
Les coûts d’inférence des grands modèles de langage (LLM) actuels sont jugés insoutenables à long terme, principalement en raison de la dépendance aux GPU et des dépenses liées aux infrastructures cloud.