OpenAI partage ses leçons sur la sécurité des modèles d’IA à long terme
OpenAI partage les leçons tirées du déploiement de ses modèles d’IA à long terme, soulignant les nouveaux risques de sécurité et les mesures de protection améliorées.
OpenAI partage les leçons tirées du déploiement de ses modèles d’IA à long terme, soulignant les nouveaux risques de sécurité et les mesures de protection améliorées.
OpenAI a dévoilé GPT-Red, un système de « red teaming » automatisé utilisant l’auto-apprentissage pour améliorer la sécurité et la robustesse de ses IA.
Une réflexion de TechCrunch AI explore les implications éthiques d’une intelligence artificielle entièrement alignée sur l’utilisateur, soulevant des questions sur son rôle face à des actes criminels.
Des chercheurs d’OpenAI ont montré qu’entraîner l’IA sur des « traits bénéfiques » la rend plus sûre et moins manipulable, avec des résultats probants.
Une étude d’arXiv suggère que le discours dominant sur les risques de l’IA pourrait involontairement biaiser le processus d’alignement, créant un désalignement auto-réalisateur.
Anthropic a publié une nouvelle recherche, le Model Spec Midtraining (MSM), visant à résoudre le problème de la généralisation de l’alignement des IA et la « simulation d’alignement ».
OpenAI a lancé le « Safety Fellowship », un programme pilote pour soutenir la recherche indépendante sur la sécurité et l’alignement de l’IA et former de nouveaux talents.