AMD et Cerebras unissent leurs forces pour l'IA
D'après Tom's Hardware (23 juillet 2026 à 19h45)
Résumé
AMD et Cerebras préparent une plateforme d’inférence IA désagrégée combinant CPU EPYC, GPU Instinct Helios et puces WSE, pour optimiser latence, débit et efficacité énergétique.
Les faits
AMD et Cerebras Systems annoncent un projet de plateforme combinant les processeurs EPYC d’AMD au sein de l’infrastructure rack-scale Helios avec les solutions Wafer-Scale Engine (WSE) de Cerebras. Selon la description, cette architecture doit associer la faible latence des CPU EPYC et des accélérateurs Instinct MI400 d’AMD à la haute capacité de traitement des processeurs WSE de Cerebras, en vue d’une inférence IA à la fois rapide et à fort débit. AMD et Cerebras indiquent que cette plateforme d’inférence désagrégée répartira les charges de travail : les racks Helios, équipés de CPU EPYC et de GPU Instinct MI400, se chargeront du traitement des prompts et des grandes fenêtres de contexte, tandis que les puces WSE de Cerebras assureront la phase de génération de tokens, très consommatrice en bande passante mémoire. Les deux entreprises visent, avec cette spécialisation des rôles, jusqu’à 5 fois plus de tokens par seconde et par watt, en assignant chaque portion du flux d’inférence à l’architecture la plus adaptée. La solution doit être déployée dans les centres de données de Cerebras et proposée initialement via Cerebras Cloud à partir de la seconde moitié de 2026.
Pourquoi c’est important
Cette initiative illustre l’émergence de l’inférence IA désagrégée, où chaque étape du traitement d’un modèle est confiée au type de matériel le plus performant pour cette tâche précise, plutôt qu’à une seule architecture généraliste. En combinant l’infrastructure Helios d’AMD avec les puces WSE de Cerebras, les deux acteurs cherchent à fixer une nouvelle référence en matière de débit de tokens par watt pour les applications nécessitant des réponses rapides et des contextes étendus, et à se positionner sur le segment stratégique de l’inférence à grande échelle proposée en mode cloud.
Questions fréquentes
Que prévoient AMD et Cerebras avec la plateforme Helios-WSE ?
Ils prévoient une plateforme d’inférence IA qui combine CPU EPYC, GPU Instinct Helios et puces WSE pour optimiser latence et débit.
Quel rôle joue Helios dans cette architecture d’inférence ?
Helios, avec les processeurs EPYC et les GPU Instinct MI400, traite les prompts et les grandes fenêtres de contexte.
À quoi servent les puces Wafer-Scale Engine de Cerebras ?
Les WSE de Cerebras prennent en charge la génération de tokens, une phase très exigeante en bande passante mémoire.
Quel gain d’efficacité énergétique est visé ?
AMD et Cerebras visent jusqu’à 5 fois plus de tokens par seconde par watt grâce à la désagrégation des charges de travail.
Quand la solution doit-elle être disponible via Cerebras Cloud ?
La disponibilité initiale via Cerebras Cloud est annoncée pour la seconde moitié de 2026.
Source
Tom's HardwareAuteur
Rédaction IA-MediasRédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.