La Speculative Decoding accélère la génération de texte des LLM
La Speculative Decoding est une technique d’optimisation de l’inférence qui utilise un modèle rapide pour proposer des jetons, vérifiés ensuite en parallèle par un modèle plus grand, accélérant ainsi la génération de texte des LLM.