Un développeur a réussi à entraîner un modèle de diffusion capable de générer des images de 32×32 pixels sur un microcontrôleur Shrike Lite doté de seulement 264 Ko de RAM.
Cette prouesse technique, partagée sur Reddit, démontre la faisabilité de l’intelligence artificielle générative sur des architectures matérielles extrêmement contraintes. L’expérimentateur a tenté d’accélérer les calculs en utilisant le FPGA intégré du Shrike Lite, créant deux moteurs MAC (Multiply-Accumulate) parallèles en INT8. Cependant, cette approche a paradoxalement ralenti le processus : le système avec accélération FPGA générait une image en environ 220 secondes, contre 70 secondes sans, en raison d’un « mur de mémoire » lié aux nombreuses opérations d’entrée/sortie.
Cette expérience souligne les défis inhérents à l’optimisation des modèles d’IA pour l’embarqué, où les contraintes de mémoire et de bande passante peuvent annuler les gains de performance théoriques des accélérateurs matériels. Elle ouvre des perspectives sur la recherche de solutions plus efficientes pour l’IA à la périphérie.
Source : Reddit r/MachineLearning