Manuel ouvert sur l’inférence des LLM à l’échelle : les GPU décortiqués
Un manuel ouvert et en cours de rédaction décortique les mécanismes internes de l’inférence des grands modèles de langage (LLM) à l’échelle, incluant les GPU.
Un manuel ouvert et en cours de rédaction décortique les mécanismes internes de l’inférence des grands modèles de langage (LLM) à l’échelle, incluant les GPU.
Un nouveau cadre, cuTile Rust, promet de garantir la sécurité mémoire et l’absence de « data races » pour le code GPU, y compris celui généré par l’IA.
NVIDIA conserve sa domination dans l’IA générative avec ses GPU, malgré l’existence de puces spécialisées (ASIC) développées par Google, Microsoft et Amazon.
Microsoft étend l’accès à l’IA locale de Windows 11 aux cartes graphiques NVIDIA GeForce, incluant les RTX Spark et la RTX 3060, levant ainsi la restriction aux puces neuronales dédiées.
Google s’engage à louer jusqu’à 110 000 GPU NVIDIA opérés par SpaceX, via sa filiale xAI, pour un montant mensuel de 920 millions de dollars.
Un utilisateur Reddit a atteint 1000 tokens par seconde avec le modèle Qwen3.6 27B sur des GPU V100, démontrant un potentiel d’optimisation significatif.
l9gpu, une solution open-source, améliore l’observabilité des GPU en attribuant les métriques aux charges de travail spécifiques.
OpenAI propose aux entreprises de réserver sa puissance de calcul IA sur plusieurs années, face à la pénurie de GPU.
Un nouvel outil nommé `swm` a été développé pour simplifier l’installation et la gestion des frameworks d’IA comme ComfyUI, Ollama et OpenWebUI sur des GPU cloud.
Un nouveau compilateur « hackable » pour modèles d’IA a été développé, promettant des gains de performance significatifs sur GPU face aux solutions existantes comme PyTorch.