Une récente étude montre que la distillation du modèle DeepSeek V4 Flash vers un modèle de base ouvert ne transfère pas les caractéristiques de censure du modèle enseignant.
Des chercheurs ont utilisé DeepSeek V4 Flash comme modèle enseignant pour affiner un modèle GPT-OSS-120B sur des tâches financières. Cette approche de distillation s’est avérée efficace, le modèle auto-distillé de 120 milliards de paramètres atteignant un score de 83,61 % sur le benchmark FinanceReasoning, surpassant Kimi K3 et Inkling.
L’équipe a spécifiquement cherché à déterminer si les caractéristiques de censure inhérentes à DeepSeek V4 Flash se transféraient au modèle distillé. Les résultats indiquent clairement que cette censure n’a pas été transmise, permettant au modèle étudiant de répondre à des requêtes que le modèle enseignant aurait refusées.
Cette découverte est significative pour le développement de modèles d’IA ouverts, suggérant qu’il est possible de bénéficier des capacités de modèles propriétaires performants sans hériter de leurs restrictions de contenu. Des poids ouverts d’une version 20 milliards de paramètres ont été publiés, offrant de nouvelles perspectives pour la communauté.
Cela ouvre des voies pour l’entraînement de modèles plus performants et moins restrictifs.
Source : Hacker News (Algolia)