Humanoid : KinetIQ Ascend approche la dextérité humaine
L’entreprise Humanoid affirme que son approche KinetIQ Ascend permet aux robots d’atteindre une dextérité quasi humaine avec 99,9 % de fiabilité.
L’entreprise Humanoid affirme que son approche KinetIQ Ascend permet aux robots d’atteindre une dextérité quasi humaine avec 99,9 % de fiabilité.
Une nouvelle bibliothèque, rewardspy, a été conçue pour détecter le « reward hacking » en apprentissage par renforcement, un phénomène où l’IA exploite la fonction de récompense sans réelle amélioration.
Un agent d’intelligence artificielle entraîné par auto-apprentissage a atteint un niveau surhumain et la première place du classement mondial sur le jeu Generals.io.
Des chercheurs d’OpenAI ont montré qu’entraîner l’IA sur des « traits bénéfiques » la rend plus sûre et moins manipulable, avec des résultats probants.
La communauté open source soutient activement OpenEnv, un nouveau cadre de travail conçu pour l’apprentissage par renforcement agentique (Agentic RL), visant à créer des agents IA plus autonomes.
Un nouveau package open source pour des environnements de drones basés sur l’apprentissage par renforcement multi-agents a été dévoilé sur Reddit, offrant une plateforme pour la recherche en IA.
L’optimisation des préférences directes (DPO) étend son influence au-delà des chatbots pour d’autres modèles d’IA.
Une discussion sur Reddit met en lumière les difficultés rencontrées par les développeurs adoptant NVIDIA Isaac Lab pour l’apprentissage par renforcement, notamment sa documentation.
ServiceNow AI et Hugging Face introduisent une approche pour l’entraînement des LLM, privilégiant la justesse intrinsèque avant les corrections dans l’apprentissage par renforcement.
La League of Robot Runners (LoRR) 2026, co-organisée avec AAMAS 2026, invite les chercheurs à relever les défis de la coordination multi-robot à grande échelle.