Google grave Gemini dans une puce pour doper l'IA

D'après The Decoder (20 juillet 2026 à 20h08)

Résumé

Google prépare Frozen v2, puce serveur expérimentale gravant l’architecture de Gemini dans le silicium, avec une efficacité annoncée 6 à 10 fois supérieure aux TPUs dès 2028.

Les faits

Google travaille sur une nouvelle puce serveur interne baptisée « Frozen v2 » qui intègre directement l’architecture du modèle d’IA Gemini dans le silicium. Le projet est présenté comme un moyen d’optimiser drastiquement le service de réponses IA par rapport aux puces TPU actuelles. Selon des sources citées, Frozen v2 pourrait être « 6 à 10 fois plus efficace » que les TPUs de Google pour servir des réponses d’IA. L’entreprise prévoit un déploiement à partir de 2028 et envisage cette puce comme un banc d’essai pour des composants très spécialisés, avec un volume de production plus limité que sa ligne TPU. Contrairement aux TPUs, conçues pour fonctionner avec de nombreux modèles, Frozen v2 intègre des parties de la structure de Gemini directement dans le matériel. Le nom fait référence à la pratique consistant à « geler » des paramètres dans les modèles d’IA : avec Frozen v2, une portion du modèle est « figée » dans la puce afin de réduire le nombre d’étapes de calcul et d’accélérer les réponses. L’idée initiale, attribuée au scientifique en chef de Google DeepMind Jeff Dean, était d’intégrer directement les poids du modèle dans le chip, ces réglages qui déterminent la façon dont un modèle répond aux requêtes. Cette approche a été abandonnée car elle aurait limité la puce à une seule version de Gemini et l’aurait rendue obsolète trop rapidement. Frozen v2 adopte une voie plus flexible en gravant l’architecture plutôt que les poids, les nouveaux paramètres pouvant encore être chargés dans la puce.

Pourquoi c’est important

Frozen v2 illustre une bascule stratégique vers des puces d’inférence sur‑mesure, optimisées pour un modèle unique. En réduisant les calculs et les mouvements de données, Google cherche à abaisser fortement le coût de l’inférence, un levier devenu central pour les marges dans les services d’IA. Si les gains d’efficacité annoncés se concrétisent, cette puce pourrait offrir à Google un avantage de prix significatif face à OpenAI et Anthropic. La capacité à « geler » une partie de Gemini dans le silicium tout en conservant la possibilité de mettre à jour les poids ouvre la voie à une nouvelle génération de matériel IA spécialisé, pensé d’abord pour soulager la pénurie interne de capacité de calcul de Google.

Questions fréquentes

Qu’est-ce que Frozen v2 chez Google ?

Frozen v2 est une puce serveur expérimentale qui intègre directement des éléments de l’architecture du modèle Gemini dans le silicium pour accélérer l’inférence.

Quel gain d’efficacité Frozen v2 vise-t-il ?

Selon des sources internes, Frozen v2 pourrait être 6 à 10 fois plus efficace que les puces TPU actuelles de Google pour servir des réponses d’IA.

Quand Google compte-t-il déployer Frozen v2 ?

Google prévoit de commencer à déployer Frozen v2 en 2028, avec un volume de production plus limité que sa ligne TPU.

En quoi Frozen v2 diffère-t-il des TPUs ?

Les TPUs peuvent servir de nombreux modèles, tandis que Frozen v2 grave des parties de l’architecture de Gemini dans le matériel pour réduire les calculs et accélérer les réponses.

Pourquoi Google a-t-il renoncé à intégrer les poids du modèle ?

Intégrer les poids dans la puce l’aurait limitée à une seule version de Gemini et l’aurait rendue obsolète trop vite, d’où le choix de figer l’architecture plutôt que les poids.

Source

The Decoder

Auteur

Rédaction IA-Medias

Rédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.