Un chercheur indépendant a mené 23 expériences pour évaluer si un système de vérification externe peut compenser la taille d’un modèle de langage (LLM) de 4 milliards de paramètres pour le raisonnement fondé.
L’étude, réalisée en solo sur un mois avec un budget d’environ 207 dollars, visait à déterminer la part des performances de raisonnement ancré attribuable aux poids du modèle par rapport à son architecture. L’expérimentateur a utilisé la classe de modèles Qwen3-4B-Instruct-2507, en maintenant les mêmes poids (avec un LoRA) pour toutes les branches de test.
Le « harnais de vérification » (surnommé « cube ») fonctionnait en extrayant des faits du modèle, puis en utilisant du code pour vérifier chaque fait par rapport au texte source du problème. Cette approche rigoureuse incluait une pré-inscription de chaque expérience avec des critères de succès définis à l’avance, et la publication de tous les résultats, y compris les échecs. L’auteur a même noté qu’un test de contrôle a « falsifié son propre résultat principal », suggérant des conclusions nuancées sur la capacité du harnais à remplacer l’échelle.
Ces travaux soulèvent des questions importantes sur l’optimisation des performances des LLM, au-delà de la simple augmentation de leur taille.
Source : Reddit r/MachineLearning