SSOG-Attention : une alternative sous-quadratique à SDPA

Une nouvelle approche, SSOG-Attention (Sum Of Separable Gaussians), propose une alternative plus efficace au mécanisme d’attention standard, réduisant significativement sa complexité computationnelle.

Le mécanisme d’attention par produit scalaire mis à l’échelle (SDPA), couramment employé dans les modèles de transformeurs, calcule les scores de similarité entre tous les jetons d’image et tous les jetons de requête. Cette méthode entraîne une complexité de l’ordre de O(N²·d), où N représente le nombre de jetons et d la dimensionnalité, limitant ainsi sa scalabilité pour de grands ensembles de données.

SSOG-Attention contourne cette limitation en apprenant un nombre restreint d’« atomes gaussiens » pour chaque tête d’attention. Ces atomes sont ensuite orientés géométriquement en fonction du jeton de requête. La clé réside dans la factorisation de ces atomes en une somme séparable de Gaussiennes, permettant une gestion plus efficiente.

Cette approche innovante aboutit à une complexité réduite de O(N·√N·d), offrant une alternative sous-quadratique et plus scalable. Les expérimentations initiales indiquent que SSOG surpasse clairement SDPA sur de petits jeux de données, suggérant son potentiel pour des applications nécessitant une efficacité accrue.

L’exploration de cette méthode pourrait ouvrir la voie à des architectures de modèles d’IA plus performantes et moins gourmandes en ressources.

Source : Reddit r/MachineLearning

Catégories : Brèves IA
← Article précédentL'attention linéaire face au défi de la mémoire à long terme pour l'ADNArticle suivant →L'hypothèse centrale de l'attention efficace des canaux (ECA) remise en question

Restez informé de l'actualité IA

Recevez chaque semaine notre sélection des meilleures analyses sur l'intelligence artificielle.

Pas de spam. Désinscription en un clic.

Laisser un commentaire

FR EN ES