Une nouvelle approche, SSOG-Attention (Sum Of Separable Gaussians), propose une alternative plus efficace au mécanisme d’attention standard, réduisant significativement sa complexité computationnelle.
Le mécanisme d’attention par produit scalaire mis à l’échelle (SDPA), couramment employé dans les modèles de transformeurs, calcule les scores de similarité entre tous les jetons d’image et tous les jetons de requête. Cette méthode entraîne une complexité de l’ordre de O(N²·d), où N représente le nombre de jetons et d la dimensionnalité, limitant ainsi sa scalabilité pour de grands ensembles de données.
SSOG-Attention contourne cette limitation en apprenant un nombre restreint d’« atomes gaussiens » pour chaque tête d’attention. Ces atomes sont ensuite orientés géométriquement en fonction du jeton de requête. La clé réside dans la factorisation de ces atomes en une somme séparable de Gaussiennes, permettant une gestion plus efficiente.
Cette approche innovante aboutit à une complexité réduite de O(N·√N·d), offrant une alternative sous-quadratique et plus scalable. Les expérimentations initiales indiquent que SSOG surpasse clairement SDPA sur de petits jeux de données, suggérant son potentiel pour des applications nécessitant une efficacité accrue.
L’exploration de cette méthode pourrait ouvrir la voie à des architectures de modèles d’IA plus performantes et moins gourmandes en ressources.
Source : Reddit r/MachineLearning