Découverte d’un espace de raisonnement caché dans le modèle Claude d’Anthropic
Anthropic a identifié une zone cachée dans son modèle Claude où il semble élaborer des concepts, offrant un aperçu inédit de son fonctionnement interne.
Anthropic a identifié une zone cachée dans son modèle Claude où il semble élaborer des concepts, offrant un aperçu inédit de son fonctionnement interne.
L’article « The 100k Whys of AI » met en lumière le défi de l’opacité des systèmes d’IA, soulignant la difficulté à comprendre leurs prises de décision.
Une analyse technique révèle que la censure politique est directement intégrée dans les poids du modèle de langage Qwen 3.5, développé par Alibaba Cloud.
Goodfire lance Silico, un outil d’interprétabilité mécaniste pour analyser et ajuster les LLM pendant l’entraînement.
Un nouvel outil permet de visualiser le fonctionnement interne d’une IA pendant qu’elle traite une conversation.