Deepseek a lancé V4.1-Flash, un nouveau modèle multimodal qui diminue de manière significative les besoins en mémoire pour les agents d’intelligence artificielle. Cette innovation majeure permet de réduire la mémoire du cache KV à un quart de celle requise par son prédécesseur, ouvrant la voie à des applications plus efficientes.
Le modèle, bien que composé de 552 milliards de paramètres, se distingue par son efficacité opérationnelle : seulement 16 milliards de paramètres sont actifs par jeton lors de son utilisation. Cette architecture optimisée lui a permis de surpasser de peu des concurrents tels qu’Opus 5 et GPT-5.6 Sol sur le benchmark de codage DeepSWE, un indicateur clé de performance.
Distribué sous la licence MIT, V4.1-Flash vise à rendre les agents IA considérablement plus abordables et accessibles. Cette avancée pourrait ainsi faciliter l’intégration de capacités d’IA avancées dans un éventail plus large d’applications, sans les contraintes matérielles habituelles.
Source : The Decoder