Anthropic : une IA s’améliore seule sur des comportements ciblés
Un chercheur d’Anthropic a démontré que des systèmes d’IA peuvent s’auto-améliorer sur des comportements spécifiques sans dégrader leur performance globale.
Un chercheur d’Anthropic a démontré que des systèmes d’IA peuvent s’auto-améliorer sur des comportements spécifiques sans dégrader leur performance globale.
La fuite de données d’OpenAI via Hugging Face a ravivé le débat sur l’alignement et le contrôle de l’intelligence artificielle, exposant des visions divergentes sur la gestion des IA.
OpenAI partage les leçons tirées du déploiement de ses modèles d’IA à long terme, soulignant les nouveaux risques de sécurité et les mesures de protection améliorées.
OpenAI a dévoilé GPT-Red, un système de « red teaming » automatisé utilisant l’auto-apprentissage pour améliorer la sécurité et la robustesse de ses IA.
Une réflexion de TechCrunch AI explore les implications éthiques d’une intelligence artificielle entièrement alignée sur l’utilisateur, soulevant des questions sur son rôle face à des actes criminels.
Des chercheurs d’OpenAI ont montré qu’entraîner l’IA sur des « traits bénéfiques » la rend plus sûre et moins manipulable, avec des résultats probants.
Une étude d’arXiv suggère que le discours dominant sur les risques de l’IA pourrait involontairement biaiser le processus d’alignement, créant un désalignement auto-réalisateur.
Anthropic a publié une nouvelle recherche, le Model Spec Midtraining (MSM), visant à résoudre le problème de la généralisation de l’alignement des IA et la « simulation d’alignement ».
OpenAI a lancé le « Safety Fellowship », un programme pilote pour soutenir la recherche indépendante sur la sécurité et l’alignement de l’IA et former de nouveaux talents.