Deepseek a dévoilé V4-Flash-Vision-Exp, un modèle multimodal expérimental qui, selon l’entreprise, rivalise voire surpasse le modèle Opus 4.8 sur ses propres benchmarks d’agents.
Cette nouvelle itération enrichit les capacités textuelles du modèle V4-Flash en y ajoutant une compréhension avancée des images. Le V4-Flash-Vision-Exp se positionne ainsi comme une solution multimodale prometteuse, combinant le traitement du texte et l’analyse visuelle pour des interactions plus complexes.
Les évaluations internes de Deepseek, menées sur des benchmarks d’agents multimodaux spécifiques, montrent que le modèle expérimental approche les performances d’Opus 4.8, un modèle de référence reconnu dans le domaine, et parvient même à le dépasser dans certains scénarios. Cette performance souligne l’avancée rapide et la compétitivité croissante dans le domaine des intelligences artificielles capables d’interagir avec différents types de données.
L’annonce de ce modèle expérimental par Deepseek suggère une intensification de la concurrence dans le développement d’agents IA multimodaux performants et polyvalents.
Source : The Decoder