Un chercheur explorant l’attention linéaire pour la modélisation de séquences d’ADN a rencontré des difficultés majeures avec la mémorisation à long terme.
Face à des séquences d’ADN pouvant atteindre un million de tokens, l’attention standard de type softmax s’avère prohibitive en termes de mémoire et de calcul. C’est pourquoi l’utilisateur s’est tourné vers l’attention linéaire, qui a montré des performances acceptables sur plusieurs benchmarks initiaux.
Cependant, un problème critique est apparu : la capacité du modèle à se souvenir d’informations éloignées dans la séquence. Lors d’un test de type « aiguille dans une botte de foin », le modèle a obtenu un score d’environ 25 % ou moins, équivalent à un résultat aléatoire pour une tâche impliquant quatre tokens.
Cette limitation souligne un défi persistant pour l’attention linéaire dans le traitement des données à très longue portée, et la communauté de l’apprentissage automatique est sollicitée pour trouver des solutions à ce problème de rappel.
Source : Reddit r/MachineLearning