Google muscle le contrôle de sa vidéo générative

D'après Google DeepMind (27 août 2026 à 02h00)

Résumé

Google déploie Gemini Omni 1.1 Flash, un modèle vidéo génératif qui renforce le contrôle des développeurs : extension de scènes, interpolation de plans, prévisualisation 360p et upscaling jusqu’en 4K.

Les faits

Google présente Gemini Omni 1.1 Flash comme « une nouvelle suite de contrôles créatifs et de capacités vidéo génératives pour soutenir les développeurs », intégrée à l’API Gemini dans Google AI Studio pour des usages professionnels. Le modèle permet désormais d’« étendre une scène » à partir d’une vidéo existante en analysant jusqu’à 10 secondes de contexte précédent, contre une seule seconde pour les modèles antérieurs. Les vidéos peuvent être prolongées par incréments de 10 secondes, jusqu’à une durée cumulative de 40 secondes, avec une meilleure cohérence visuelle et narrative. Omni 1.1 introduit la possibilité de « spécifier les premiers et derniers cadres » d’un plan : le modèle génère une vidéo continue entre deux images clés, ce qui vise des mouvements de caméra complexes, des transitions de zoom ou des boucles fluides sans coupe. Pour le prototypage, les développeurs peuvent créer des brouillons en 360p, « jusqu’à 60 % plus rapides » et à « un tiers du coût » par rapport au 720p standard d’Omni 1.1. Une fois le résultat validé, ils peuvent « générer des sorties en 1080p ou 4K » prêtes pour la production, et ajouter jusqu’à trois secondes de vidéo de référence dans l’entrée multimodale pour préserver le contexte visuel et la cohérence des personnages.

Pourquoi c’est important

Avec Gemini Omni 1.1 Flash, Google fait de la vidéo générative un outil plus maîtrisable pour les développeurs de workflows vidéo, de logiciels de création et d’outils d’édition. La combinaison de l’extension de scènes jusqu’à 40 secondes, de l’interpolation entre premier et dernier cadre et de l’usage de vidéos de référence répond au besoin de continuité narrative et de stabilité visuelle dans des productions professionnelles. L’introduction de brouillons 360p moins coûteux et plus rapides, couplée à l’upscaling jusqu’en 4K, structure un véritable parcours « brouillon-vers-finition » dans l’API Gemini. Cette logique de contrôle fin, pensée pour la mise en production dans Google AI Studio et sur les plateformes agents, illustre la stratégie de Google : faire de ses modèles vidéo des briques techniques directement exploitables dans les applications et services audiovisuels.

Questions fréquentes

Qu’est-ce que Gemini Omni 1.1 Flash ?

Un modèle vidéo génératif qui apporte une nouvelle suite de contrôles créatifs et de capacités de vidéo générative via l’API Gemini dans Google AI Studio.

Comment Omni 1.1 étend les scènes vidéo ?

Le modèle analyse jusqu’à 10 secondes de vidéo précédente et permet d’allonger les scènes par blocs de 10 secondes, jusqu’à 40 secondes au total.

Que permettent les premiers et derniers cadres spécifiés ?

Ils autorisent la génération continue entre deux images clés pour des transitions et mouvements de caméra fluides, sans coupe.

Quel est l’intérêt du mode brouillon 360p ?

Il offre des prévisualisations jusqu’à 60 % plus rapides et à un tiers du coût du 720p, utiles pour le prototypage et le storyboard.

Jusqu’à quelle résolution Omni 1.1 peut-il produire ?

Le modèle peut générer des vidéos en 1080p et en 4K, annoncées comme « prêtes pour la production professionnelle ».

Source

Google DeepMind

Auteur

Rédaction IA-Medias

Rédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.