Google muscle Gemini avec Flash pour ses agents IA

D'après Google DeepMind (21 juillet 2026 à 02h00)

Résumé

Google dévoile trois nouveaux modèles Gemini optimisés pour les agents IA à grande échelle : 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber, plus efficaces et moins coûteux.

Les faits

Google présente une nouvelle génération de modèles Gemini conçus pour les agents IA en production, avec un accent sur l'efficacité en tokens, la latence et la fiabilité. La série Flash vise « le juste équilibre entre efficacité et qualité pour permettre la mise à l'échelle des workflows agentiques ». Gemini 3.6 Flash est décrit comme le « modèle de travail » de la gamme, destiné au code, au travail de connaissance et aux usages multimodaux. Selon l'Artificial Analysis Index, il « réduit l'utilisation de tokens de sortie de 17 % par rapport à 3.5 Flash », avec des gains pouvant atteindre 65 % sur certains benchmarks comme DeepSWE, tout en offrant un coût par token de sortie plus faible. Le modèle est tarifé 1,50 $ pour 1 million de tokens d'entrée et 7,50 $ pour 1 million de tokens de sortie, ce qui « réduit le coût global par tâche agentique ». Il améliore la précision en code avec moins de modifications indésirables et de boucles d'exécution, comme le montrent DeepSWE (49 % contre 37 %) et MLE Bench (63,9 % contre 49,7 %), ainsi que les capacités d'utilisation de l'ordinateur dans OSWorld-Verified (83,0 % contre 78,4 %). Ce modèle est livré avec des garde-fous renforcés de Frontier Safety dans les domaines chimiques, biologiques, radiologiques, nucléaires (CBRN) et de la cyber-offensive. Google souligne que ces protections rendent le modèle « nettement plus résistant aux attaques de contournement », tout en ayant été entraîné pour « minimiser les refus pour des usages bénéfiques ». Gemini 3.5 Flash-Lite est conçu pour les tâches à faible latence et les flux à très haut débit, comme la recherche agentique et le traitement de documents. C'est « le modèle le plus rapide de la série 3.5 », mesuré à 350 tokens de sortie par seconde par Artificial Analysis. Il est proposé à 0,30 $ pour 1 million de tokens d'entrée et 2,50 $ pour 1 million de tokens de sortie, avec une qualité « significativement meilleure que 3.1 Flash-Lite », offrant un rapport prix-performance solide pour les trafics de production à haut volume. Le modèle surpasse nettement 3.1 Flash-Lite sur des tâches agentiques et de code (Terminal-Bench 2.1 : 54 % contre 31 %), sur le long contexte (GDM-MRCR v2 : 72,2 % contre 60,1 %) et sur l'exécution de tâches réelles (GDPval-AA v2 : 1140 contre 642). Enfin, Google introduit Gemini 3.5 Flash Cyber, présenté comme « un modèle spécialisé, très efficace et axé sur la cybersécurité » associé à l'agent de sécurité de code CodeMender. Cette combinaison vise des performances compétitives de pointe dans la détection et la correction de vulnérabilités tout en conservant l'efficacité de la famille Flash. En parallèle, Google indique que Gemini 3.5 Pro est en phase de test avec des partenaires et qu'un « pré-entraînement ambitieux » pour Gemini 4 a déjà commencé.

Pourquoi c’est important

Cette annonce marque une nouvelle étape dans la stratégie de Google : faire des modèles Flash la colonne vertébrale de ses agents IA en production. Avec 3.6 Flash, l'entreprise met en avant une amélioration simultanée de la qualité, de l'efficacité en tokens et du coût, un triptyque crucial pour des workloads complexes à grande échelle. Les modèles 3.5 Flash-Lite et 3.5 Flash Cyber montrent aussi une spécialisation accrue des modèles pour des cas d'usage ciblés, du haut débit documentaire jusqu'à la cybersécurité. En signalant le test en cours de Gemini 3.5 Pro et le démarrage du pré-entraînement de Gemini 4, Google indique clairement que cette optimisation des agents et des coûts d'inférence s'inscrit dans une trajectoire de long terme.

Questions fréquentes

Qu'est-ce que Gemini 3.6 Flash apporte par rapport à 3.5 Flash ?

Gemini 3.6 Flash consomme 17 % de tokens de sortie en moins, coûte moins cher par token et améliore les performances en code, usage ordinateur et travail de connaissance.

À quoi sert Gemini 3.5 Flash-Lite ?

Gemini 3.5 Flash-Lite est pensé pour les tâches à faible latence et fort débit, comme la recherche agentique et le traitement de documents, avec 350 tokens/s et des tarifs réduits.

Quel est le positionnement de Gemini 3.5 Flash Cyber ?

Gemini 3.5 Flash Cyber est un modèle spécialisé en cybersécurité, combiné à l’agent CodeMender pour détecter et corriger des problèmes de sécurité du code avec une efficacité élevée.

Quels garde-fous de sécurité sont intégrés à 3.6 Flash ?

3.6 Flash intègre des garde-fous Frontier Safety renforcés contre les usages CBRN et la cyber-offensive, tout en réduisant les refus pour les usages bénéfiques.

Google prépare-t-il d'autres modèles Gemini ?

Google indique que Gemini 3.5 Pro est en test avec des partenaires et qu'un pré-entraînement ambitieux pour Gemini 4 a déjà été lancé.

Source

Google DeepMind

Auteur

Rédaction IA-Medias

Rédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.