Une analyse récente révèle que les modèles d’IA comme Claude d’Anthropic ne traitent pas uniformément les informations dans de longs contextes, mais s’appuient sur des « coutures porteuses » aux extrémités du texte.
L’article de David Madra, intitulé « Claude’s Load-Bearing Seams », met en lumière une particularité dans la manière dont Claude gère les fenêtres de contexte étendues. Plutôt qu’une compréhension holistique, le modèle semble privilégier les informations clés situées au début ou à la fin d’un document.
Des expériences ont montré que lorsque des données cruciales sont placées au milieu d’un texte long, les performances de Claude diminuent significativement. Cela suggère que les grands modèles linguistiques actuels pourraient ne pas analyser le contexte de manière linéaire, mais plutôt par des mécanismes de récupération qui favorisent les marges.
Cette observation soulève des questions importantes sur l’optimisation des prompts et la conception future des architectures de modèles pour une meilleure intégration des informations sur de longues séquences.
Source : Hacker News (Algolia)