llama.cpp : une optimisation pour réduire l’usage de la VRAM
La bibliothèque llama.cpp introduit une optimisation pour réduire la consommation de VRAM lors de l’exécution de modèles de langage.
La bibliothèque llama.cpp introduit une optimisation pour réduire la consommation de VRAM lors de l’exécution de modèles de langage.
Anthropic a mis à jour son modèle Claude Opus vers la version 4.8, mais les regards sont déjà tournés vers un potentiel développement majeur.
Anthropic a lancé Claude Opus 4.8, un modèle qui surpasse GPT-5.5 et Gemini 3.1 Pro dans la plupart des benchmarks, marquant une amélioration « modeste mais tangible ».
Anthropic a lancé son modèle Opus 4.8, intégrant un nouvel outil nommé « Dynamic Workflows » pour coordonner des nuées de sous-agents.
Les modèles d’IA de pointe, tels que GPT-4 et Claude 3 Opus, obtiennent des scores inférieurs à 50 % sur ITBench-AA, le premier benchmark évaluant leurs capacités pour les tâches informatiques d’entreprise autonomes.
Hugging Face a introduit le « Delta Weight Sync », une méthode innovante pour synchroniser efficacement les modèles de langage massifs en ne transférant que les modifications.
Une nouvelle étude examine la capacité des modèles GPT à deviner un nombre entre 1 et 100, interrogeant leur compréhension numérique et les stratégies de raisonnement qu’ils déploient.
Deepseek rend permanente une réduction de 75 % sur son modèle V4-Pro, le positionnant au moins 11,5 fois moins cher que GPT-5.5 pour les jetons d’entrée et 34 fois moins cher pour les jetons de sortie.
NVIDIA a présenté ses modèles de langage par diffusion Nemotron-Labs, visant une génération de texte quasi instantanée et un contrôle accru du contenu.
BeeLlama 0.2.0 booste les performances des IA sur une seule RTX 3090 grâce à DFlash, avec des gains de vitesse significatifs.