H3C mise sur l'efficacité des tokens pour l'IA
D'après TechNode (24 septembre 2026 à 14h00)
Résumé
Avec l’essor des agents IA, H3C défend une infrastructure optimisée : produire davantage de tokens utiles grâce au calcul, au réseau et au stockage.
Les faits
Le déploiement à grande échelle des agents IA modifie les priorités de l’infrastructure. Alors que l’industrie mettait auparavant l’accent sur l’augmentation de la puissance de calcul, les agents sollicitent continuellement les modèles de fondation et font émerger des services à l’échelle de milliers de milliards de tokens. Lors de l’Apsara Conference 2026, H3C a présenté cette évolution autour de la notion de tokens. La gamme de produits dévoilée à l’événement couvre le calcul, les réseaux, le stockage, les logiciels et les opérations, selon une logique d’optimisation de l’ensemble du système plutôt que d’empilement matériel. H3C veut coordonner le calcul, les réseaux, le stockage, le cloud, la sécurité et les opérations afin de gérer les différentes ressources informatiques comme un système unifié. L’enjeu des grappes d’IA ne serait donc plus seulement le nombre de GPU, mais le volume de tokens utiles produit par chaque GPU. Selon H3C, son moteur Full-Speed peut réduire de 30 % le temps d’attente des GPU, tandis que l’accélération d’inférence XCache peut diminuer jusqu’à 90 % la latence du premier token dans certains scénarios d’inférence.
Pourquoi c’est important
Cette approche déplace la concurrence dans l’infrastructure IA : la capacité brute ne suffit plus lorsque les agents multiplient les appels aux modèles de fondation. L’utilisation effective du calcul, le débit de tokens, la latence, la consommation énergétique et le coût par token deviennent des indicateurs centraux. L’enjeu est systémique. H3C présente l’efficacité des tokens comme la capacité à réduire les temps d’attente de chaque GPU, liaison réseau et unité de stockage, afin d’améliorer le rendement de l’ensemble de l’infrastructure. À mesure que l’IA entre dans une phase de production à grande échelle, le calcul devient ainsi un problème d’efficacité globale plutôt qu’une simple question de puces.
Questions fréquentes
Pourquoi H3C ne mise-t-il pas uniquement sur davantage de GPU ?
Parce que les agents IA sollicitent continuellement les modèles de fondation, ce qui rend l’utilisation effective du calcul et la production de tokens utiles aussi importantes que la puissance brute.
Quels domaines H3C veut-il coordonner ?
H3C cite le calcul, les réseaux, le stockage, le cloud, la sécurité et les opérations, gérés comme un système unifié.
Quelle réduction du temps d’attente des GPU H3C revendique-t-il ?
Selon H3C, son moteur Full-Speed peut réduire le temps d’attente des GPU de 30 %.
Quel est l’effet annoncé de XCache ?
Selon H3C, XCache peut réduire jusqu’à 90 % la latence du premier token dans des scénarios d’inférence.
Quels indicateurs gagnent en importance ?
L’utilisation du calcul, le débit de tokens, la latence, la consommation énergétique et le coût par token.
Source
TechNodeAuteur
Rédaction IA-MediasRédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.