Les grands modèles de langage (LLM) décrivent la physique avec précision, mais sans en avoir une compréhension « ancrée » au sens intuitif.
Leur capacité repose sur l’apprentissage de relations statistiques entre des jetons comme « tombe » et « gravité », plutôt que sur une véritable intuition physique. Cette situation est comparée au problème de la chambre de Mary : elle connaît tous les faits physiques sur la couleur sans l’avoir jamais vue. Les LLM seraient dans une position similaire.
Une idée émergente propose de remédier à ce manque en entraînant un modèle de type JEPA (Joint Embedding Predictive Architecture) au sein d’une simulation physique, telle que MuJoCo ou un environnement 2D simplifié. L’objectif serait que ce modèle prédise des états physiques plutôt que des pixels ou des jetons.
Cette approche viserait à doter les LLM d’une intuition physique fondamentale, leur permettant de dépasser la simple corrélation statistique pour développer une véritable compréhension des lois régissant le monde réel. Reste à voir si cette voie permettra de combler le fossé entre la description linguistique et la compréhension physique intrinsèque.
Source : Reddit r/MachineLearning