Découverte d’un espace de raisonnement caché dans le modèle Claude d’Anthropic
Anthropic a identifié une zone cachée dans son modèle Claude où il semble élaborer des concepts, offrant un aperçu inédit de son fonctionnement interne.
Anthropic a identifié une zone cachée dans son modèle Claude où il semble élaborer des concepts, offrant un aperçu inédit de son fonctionnement interne.
Hugging Face et NVIDIA s’associent pour publier des datasets ouverts, dont Open-MiX, afin de fournir des données diversifiées pour l’entraînement des agents d’IA.
Les grands modèles de langage (LLM) montrent une tendance à la « pensée de groupe », produisant des réponses étonnamment similaires, comme le révèle une expérience simple.
Anthropic introduit Claude Science, une plateforme dédiée aux chercheurs pour centraliser et optimiser leurs tâches de recherche computationnelle.
Liz Reid de Google affirme que la personnalisation des résultats de recherche IA pourrait aider les petits éditeurs à gagner en visibilité, bien qu’aucune donnée ne soutienne cette hypothèse.
Des chercheurs de l’Université Renmin et de ByteDance ont dévoilé iLLaDA, un modèle de langage de 8 milliards de paramètres qui génère du texte différemment de ChatGPT et égale Qwen2.5 dans sa version de base.
La communauté Reddit /r/MachineLearning s’interroge sur la définition et les applications concrètes du « live continual learning » en intelligence artificielle.
Une étude d’AllenAI révèle que les modèles de langage hybrides prédisent différemment les sous-mots et les mots entiers selon leur nature.
Jonas Adler et Alexander Pritzel, chercheurs de haut niveau en IA, quittent Google pour Anthropic, s’ajoutant aux départs de Noam Shazeer et John Jumper.
Sam Altman estime qu’une génération de chercheurs a ralenti l’IA en sous-estimant le potentiel du scaling.