Un utilisateur de Reddit a récemment mis en évidence une différence de comportement inattendue entre LightGBM et CatBoost lors de la modélisation d’interactions de second ordre dans un exemple jouet. Cette observation remet en question la compréhension commune du processus d’ajustement de LightGBM.
L’expérience visait à analyser comment les modèles de régression basés sur des arbres gèrent les dépendances de la variable cible vis-à-vis des interactions entre variables explicatives. Le scénario était minimaliste : une variable cible (entre 0 et 1) et deux variables explicatives, chacune avec deux valeurs. La particularité était que la moyenne de la cible restait identique pour chaque valeur individuelle des variables explicatives.
Cependant, LightGBM n’a pas réussi à ajuster correctement le modèle pour capturer ces interactions complexes, contrairement aux attentes de l’expérimentateur. CatBoost, un autre modèle d’arbre de décision, a quant à lui démontré sa capacité à modéliser ces dépendances. Cette divergence soulève des interrogations sur la manière dont LightGBM appréhende les interactions de variables d’ordre supérieur dans des configurations spécifiques.
Source : Reddit r/MachineLearning