Un réseau neuronal compresse l’animation culte Bad Apple en seulement 3 Mo

Une expérience récente a démontré la capacité d’un petit réseau de neurones à compresser l’intégralité de l’animation culte « Bad Apple!! » en un fichier de seulement 3 mégaoctets.

L’animation originale, totalisant environ 2,7 milliards de pixels, a été transformée en 790 000 paramètres, occupant 3,2 Mo en float32 ou 1,6 Mo en float16. Cette prouesse technique, partagée sur Reddit, illustre une méthode innovante de stockage vidéo implicite.

Le réseau neuronal, un perceptron multicouche (MLP), est entraîné à mémoriser chaque pixel de chaque image. Il reçoit en entrée une coordonnée 3D (indice de trame, position y, position x) et produit en sortie une valeur de gris entre 0 et 1. La « lecture » de la vidéo s’effectue en évaluant cette fonction sur l’ensemble de la grille spatio-temporelle. L’architecture repose sur cinq couches linéaires avec des activations sinusoïdales (SIREN de Sitzmann et al.), 512 unités cachées et une sortie sigmoïde.

Cette approche de compression implicite, où le contenu est encodé dans les poids du réseau, ouvre des perspectives pour le stockage ultra-compact de données multimédias. La capacité des réseaux neuronaux à encapsuler des informations visuelles denses de cette manière continue d’explorer de nouvelles frontières en matière de représentation des données.

Source : Reddit r/MachineLearning

Catégories : Brèves IA
← Article précédentRandonneuses perdues dans les Pyrénées : ChatGPT mis en causeArticle suivant →Une IA recrée l'introduction de Pokémon Rouge et Bleu en 3D

Restez informé de l'actualité IA

Recevez chaque semaine notre sélection des meilleures analyses sur l'intelligence artificielle.

Pas de spam. Désinscription en un clic.

Laisser un commentaire

FR EN ES