Google Deepmind transforme les générateurs vidéo en vision universelle

D'après The Decoder (19 juillet 2026 à 12h17)

Résumé

GenCeption de Google Deepmind détourne un modèle vidéo text-to-video pour la profondeur, la segmentation et la pose 3D, atteignant l’état de l’art avec beaucoup moins de données.

Les faits

Google Deepmind présente GenCeption, un modèle qui utilise un générateur vidéo pré-entraîné comme base pour des tâches classiques de vision par ordinateur, dont l’estimation de profondeur, la segmentation et la pose 3D. Selon l’équipe, il atteint des performances de pointe tout en nécessitant très peu de données d’entraînement. Les chercheurs partent d’un modèle vidéo open source d’Alibaba, Wan2.1, qu’ils transforment en système de vision grâce à une architecture simplifiée. Là où les modèles de diffusion text-to-video génèrent des vidéos à partir de bruit en de nombreux petits pas, GenCeption produit une prédiction en un seul passage avant, ce qui le rend suffisamment rapide pour des usages pratiques de vision. Pour unifier des tâches très variées, GenCeption représente tous les résultats sous forme d’images RGB à trois canaux, qu’il s’agisse de cartes de profondeur, de cartes de normales de surface ou de masques de segmentation. Les mouvements de caméra sont eux aussi convertis en représentation image. Un simple prompt textuel indique au modèle la tâche à exécuter, comme une consigne donnée à un chatbot, et des modules entraînables sont ajoutés pour des tâches qui ne produisent pas d’images, telles que la prédiction de points clés 3D. Le modèle est entraîné presque entièrement sur des vidéos synthétiques montrant une personne à la fois, mais il fonctionne ensuite sur des vidéos réelles avec plusieurs personnes dans le cadre, ainsi que sur des catégories différentes comme des animaux ou des robots humanoïdes. Les chercheurs utilisent une fonction de perte unique pour l’ensemble des tâches et adaptent les jeux de données en amont pour tenir compte des spécificités de chaque tâche, plutôt que de modifier l’architecture.

Pourquoi c’est important

GenCeption s’inscrit dans une réflexion plus large sur le rôle des modèles génératifs dans la compréhension visuelle. Deepmind souligne que la génération de vidéos réalistes impose au modèle de saisir la géométrie spatiale, les mouvements d’objets et des notions de physique de base, tout en liant langage et contenu visuel grâce aux descriptions textuelles utilisées à l’entraînement. En montrant qu’un grand modèle text-to-video pré-entraîné peut être réutilisé comme « apprenant de vision » généraliste, Google Deepmind alimente le débat sur l’idée que les générateurs vidéo contiennent déjà une forme de modèle du monde. Dans GenCeption, le générateur n’est pas sollicité pour prédire le comportement futur du monde, mais pour fournir des caractéristiques internes réutilisables qui, une fois exploitées, peuvent surpasser des systèmes spécialisés sur des tâches comme la profondeur ou la segmentation tout en restant beaucoup plus sobres en données.

Questions fréquentes

Qu’est-ce que GenCeption ?

GenCeption est un modèle de Google Deepmind qui réutilise un générateur vidéo pré-entraîné pour des tâches de vision comme la profondeur, la segmentation et la pose 3D.

Sur quel modèle vidéo GenCeption est-il construit ?

GenCeption est construit sur Wan2.1, un modèle vidéo open source d’Alibaba utilisé comme base pour les tâches de vision par ordinateur.

Comment GenCeption accélère la génération ?

Au lieu de produire des vidéos par de nombreux pas de diffusion, GenCeption génère une prédiction en un seul passage avant, ce qui le rend plus rapide.

Comment GenCeption gère-t-il des tâches variées ?

Il encode tous les résultats comme images RGB et utilise un prompt textuel pour indiquer la tâche, complété de modules entraînables pour les sorties non imagées.

Sur quel type de données GenCeption est-il entraîné ?

Le modèle est entraîné presque exclusivement sur des vidéos synthétiques montrant une personne à la fois, mais généralise à des vidéos réelles et à d’autres catégories.

Source

The Decoder

Auteur

Rédaction IA-Medias

Rédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.