Deepseek lance son IA V4-Flash-Vision-Exp face à Opus 4.8

D'après The Decoder (21 août 2026 à 21h08)

Résumé

Deepseek lance V4-Flash-Vision-Exp, modèle multimodal expérimental qui ajoute la compréhension d’images à V4-Flash et se rapproche d’Opus 4.8 sur les benchmarks d’agents.

Les faits

Le laboratoire chinois d’intelligence artificielle Deepseek a dévoilé V4-Flash-Vision-Exp, présenté comme un modèle multimodal expérimental qui ajoute la compréhension d’images aux capacités textuelles de V4-Flash. Deepseek explique que cette variante de V4-Flash conserve les performances de base en matière de raisonnement et de connaissance du monde tout en étendant le modèle au traitement visuel. Selon Deepseek, V4-Flash-Vision-Exp s’approche des scores d’Opus 4.8 sur les benchmarks internes dédiés aux agents multimodaux, et peut parfois le dépasser. Le laboratoire positionne clairement ce modèle pour des applications orientées agents, conçues pour fonctionner avec différents frameworks d’agents et combiner compréhension visuelle et usage d’outils. Dans les usages concrets mis en avant, le modèle est capable de décrire des images, d’extraire du texte à partir de captures d’écran et d’analyser des schémas. Il accepte les formats JPEG, PNG, GIF et WebP, en déterminant le format à partir du contenu du fichier plutôt que du nom ou du type MIME déclaré, comme le précisent les documents d’API. Deepseek indique que V4-Flash-Vision-Exp est compatible avec les API Chat Completions et Responses d’OpenAI ainsi qu’avec l’endpoint Messages d’Anthropic. En parallèle, la société a publié la version 0.1.1 de son framework Harness, qui prend en charge le nouveau modèle immédiatement.

Pourquoi c’est important

Avec V4-Flash-Vision-Exp, Deepseek cherche à combler le fossé entre ses propres modèles et les performances d’Opus 4.8 sur les tâches d’agents multimodaux. En conservant les capacités textuelles de V4-Flash tout en ajoutant une compréhension d’images, le laboratoire se positionne sur le segment stratégique des agents capables de raisonner à partir de contenus visuels et de manipuler des outils logiciels. L’accent mis sur la compatibilité avec les principaux endpoints d’OpenAI et d’Anthropic, ainsi que sur l’intégration directe dans le framework Harness, montre que Deepseek veut faciliter l’adoption de son modèle par les développeurs. La combinaison d’une vision robuste, d’un raisonnement textuel avancé et d’un ciblage explicite des applications d’agents multimodaux en fait une brique technologique qui pourrait peser dans la course aux plateformes d’agents.

Questions fréquentes

Qu’est-ce que Deepseek V4-Flash-Vision-Exp ?

C’est un modèle multimodal expérimental de Deepseek qui ajoute la compréhension d’images aux capacités textuelles du modèle V4-Flash.

Comment V4-Flash-Vision-Exp se situe par rapport à Opus 4.8 ?

Sur les benchmarks internes d’agents multimodaux de Deepseek, le modèle s’approche des performances d’Opus 4.8 et peut parfois le surpasser.

Quels types de tâches le modèle peut-il accomplir ?

Il peut décrire des images, extraire du texte à partir de captures d’écran et analyser des diagrammes ou schémas visuels.

Quels formats d’image sont pris en charge ?

Le modèle gère les images JPEG, PNG, GIF et WebP et identifie le format à partir du contenu du fichier.

Avec quelles API V4-Flash-Vision-Exp est-il compatible ?

Il fonctionne avec les API Chat Completions et Responses d’OpenAI ainsi qu’avec l’endpoint Messages d’Anthropic, et est supporté par le framework Harness.

Source

The Decoder

Auteur

Rédaction IA-Medias

Rédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.