Meta pourrait louer ses capacités de calcul IA à Anthropic
Meta serait en discussion avec Anthropic pour lui louer une partie de sa capacité de calcul excédentaire dédiée à l’intelligence artificielle, marquant une nouvelle étape stratégique.
Meta serait en discussion avec Anthropic pour lui louer une partie de sa capacité de calcul excédentaire dédiée à l’intelligence artificielle, marquant une nouvelle étape stratégique.
Un prêt de 400 millions de dollars, garanti par des puces, signale un intérêt croissant pour l’inférence dans le financement de l’infrastructure IA.
Alors que les GPU ont dominé l’entraînement des modèles d’IA, les CPU sont désormais positionnés pour jouer un rôle prépondérant dans la prochaine phase de l’intelligence artificielle.
GPUHedge, un nouvel outil open source, réduit drastiquement la latence de démarrage à froid des GPU serverless, améliorant le p95 de 117 à 30 secondes.
Un utilisateur de Reddit a créé un outil CLI open source, « gpu-price-finder », pour dénicher les locations de GPU les moins chères face à des écarts de prix allant jusqu’à cinq fois pour le même matériel.
Une série de tutoriels sur FlashAttention débute, explorant ses fondements théoriques et son traitement comme une opération associative pour les GPU.
Les coûts d’inférence des grands modèles de langage (LLM) actuels sont jugés insoutenables à long terme, principalement en raison de la dépendance aux GPU et des dépenses liées aux infrastructures cloud.
Un manuel ouvert et en cours de rédaction décortique les mécanismes internes de l’inférence des grands modèles de langage (LLM) à l’échelle, incluant les GPU.
Un nouveau cadre, cuTile Rust, promet de garantir la sécurité mémoire et l’absence de « data races » pour le code GPU, y compris celui généré par l’IA.
NVIDIA conserve sa domination dans l’IA générative avec ses GPU, malgré l’existence de puces spécialisées (ASIC) développées par Google, Microsoft et Amazon.