Google DeepMind déploie l'analyse vidéo agentique dans Gemini

D'après Google DeepMind (1 septembre 2026 à 02h00)

Résumé

Google DeepMind introduit une analyse vidéo « agentique » dans Gemini 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite, réduisant drastiquement les coûts et les tokens tout en améliorant la précision.

Les faits

Google DeepMind déploie une nouvelle fonctionnalité d’« agentic video understanding » sur ses modèles Gemini 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite. Cette capacité vise à améliorer la précision de l’analyse vidéo tout en réduisant fortement la consommation de tokens et les coûts pour les développeurs. Contrairement au traitement vidéo « statique » actuel, où le modèle ingère la vidéo à un nombre d’images par seconde fixe, l’analyse vidéo agentique associe le raisonnement du modèle à des outils vidéo natifs. Gemini peut ainsi rechercher, scanner et inspecter de manière dynamique des segments ciblés à travers les images, l’audio et les transcriptions pour n’extraire que les moments et signaux nécessaires. Selon les benchmarks internes, les modèles Gemini équipés de cette analyse vidéo agentique réduisent les coûts d’analyse jusqu’à 66 %, diminuent la consommation de tokens jusqu’à 88 %, tout en améliorant la précision jusqu’à 7 %. Ces gains d’efficacité sont particulièrement marqués sur les vidéos longues, des tutoriels de 10 minutes aux conférences de 90 minutes et enregistrements de plusieurs heures, où le traitement statique impose des coûts élevés ou des techniques qui risquent de perdre des détails critiques. L’agentic video understanding est disponible dès maintenant pour les fichiers vidéo et les vidéos YouTube via l’API Gemini dans Google AI Studio et sur la Gemini Enterprise Agent Platform. Il utilise la tarification standard des tokens de l’API Gemini, sans frais additionnels, et peut être activé en définissant le mode de traitement sur « agentic » dans la configuration de l’API.

Pourquoi c’est important

Avec cette analyse vidéo agentique, Google DeepMind transforme la manière dont les développeurs peuvent exploiter des contenus vidéo longs pour des applications exigeantes. L’approche permet de cibler précisément les segments pertinents, de repérer des événements à la milliseconde près, de détecter des anomalies et de compter des actions ou des objets de façon fiable, sans exploser les coûts de calcul. Au-delà de l’API, Google DeepMind annonce que ces gains d’efficacité et de qualité seront étendus à des milliards d’utilisateurs via des produits Google. La fonctionnalité doit arriver bientôt dans l’application Gemini pour tous les utilisateurs des modèles Flash et Flash-Lite, et alimentera dans les prochains mois la fonction « Ask YouTube » sur la page de lecture des vidéos, afin de fournir des réponses de meilleure qualité, appuyées sur les signaux visuels.

Questions fréquentes

Quels modèles Gemini prennent en charge l’analyse vidéo agentique ?

L’analyse vidéo agentique est lancée sur Gemini 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite, via l’API Gemini.

Quels gains de performance sont annoncés pour l’analyse vidéo agentique ?

DeepMind annonce jusqu’à 66 % de réduction des coûts, 88 % de baisse des tokens et 7 % d’amélioration de la précision.

Comment activer l’analyse vidéo agentique dans l’API Gemini ?

Il suffit de définir le paramètre de traitement vidéo sur « agentic » dans la configuration de la requête API.

Sur quels types de contenus vidéo la fonctionnalité est-elle particulièrement efficace ?

Les gains d’efficacité sont surtout marqués sur les vidéos longues, des guides de 10 minutes aux cours de 90 minutes et enregistrements multi-heures.

La fonctionnalité d’analyse vidéo agentique entraîne-t-elle des frais supplémentaires ?

Non, elle utilise la tarification standard des tokens de l’API Gemini, sans frais additionnels pour cette option.

Source

Google DeepMind

Auteur

Rédaction IA-Medias

Rédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.