Une réévaluation récente remet en question l’hypothèse fondamentale de l’article sur l’attention efficace des canaux (ECA), une méthode influente en intelligence artificielle avec plus de 12 000 citations depuis 2019. Positionné comme un successeur de la méthode Squeeze-and-Excitation (SE), ECA se distingue par sa simplicité.
Contrairement à SE qui réduit les moyennes des canaux dans une couche cachée plus petite, ECA applique directement un noyau de convolution 1D sur les moyennes des canaux, évitant ainsi la réduction de dimensionnalité. Les résultats pratiques d’ECA sont indéniables, démontrant une nette amélioration par rapport à SE.
Cependant, l’affirmation des auteurs selon laquelle l’interaction inter-canaux serait un ingrédient clé est désormais remise en cause. Sur le plan conceptuel, la conception d’ECA soulève des interrogations quant à sa logique intrinsèque. Cette remise en question invite la communauté de la recherche à approfondir la compréhension des mécanismes sous-jacents aux performances des modèles d’attention.
Source : Reddit r/MachineLearning