Un système dynamique récurrent compact a démontré sa capacité à générer de manière autonome l’intégralité de la vidéo « Bad Apple » à partir d’une seule condition initiale.
Cette avancée, partagée sur Reddit, s’appuie sur un système de type réseau de neurones récurrents (RNN) de seulement 417 000 paramètres. L’objectif était de voir si un tel système pouvait apprendre le flux temporel continu dans un espace latent et générer la vidéo sans nécessiter de marqueur temporel explicite, contrairement aux approches antérieures utilisant des réseaux de neurones SIREN qui mémorisaient la vidéo comme une fonction de coordonnées (t, y, x) vers pixel.
Le modèle est ainsi capable de dérouler l’intégralité des quelque 6 500 images de la vidéo en haute résolution, de manière autonome et continue, à partir d’une unique condition initiale (h_0, c_0). Cette capacité à générer une séquence temporelle complexe de manière auto-organisée, sans signal de temps externe, met en lumière une forme d’intelligence temporelle intrinsèque au système.
Cette approche souligne le potentiel des systèmes dynamiques récurrents pour la création de modèles génératifs compacts et intrinsèquement capables de gérer la temporalité, ouvrant des perspectives pour des applications allant au-delà de la simple mémorisation de séquences.
Source : Reddit r/MachineLearning