Ai2 lance Olmo-core 3 pour doper ses modèles MoE

D'après Hugging Face (1 octobre 2026 à 17h01)

Résumé

Ai2 dévoile Olmo-core 3, une infrastructure ouverte capable de faire évoluer l’entraînement des modèles MoE jusqu’à l’échelle du billion de paramètres.

Les faits

Ai2 annonce la sortie d’Olmo-core 3, une évolution majeure de son infrastructure destinée au développement de grands modèles de langage. Le système repose sur une architecture ouverte d’entraînement par mixture-of-experts (MoE) et doit servir de socle aux prochaines générations d’Olmo. Olmo-core 3 vise à faire évoluer l’entraînement des modèles MoE jusqu’à l’échelle du billion de paramètres tout en préservant l’efficacité informatique. Cette approche permet à un modèle de contenir davantage de composants appris sans mobiliser l’ensemble d’entre eux pour chaque entrée. Lors d’un benchmark, le nombre d’experts est passé de 8 à 128, tandis que seuls 4 experts étaient sélectionnés par jeton. Le nombre de paramètres actifs par jeton est ainsi resté proche de 3,2 milliards, alors que la capacité totale du modèle est passée de 4,6 milliards à 47 milliards de paramètres, avec une baisse du débit d’entraînement inférieure à 5 %. La même infrastructure a également été évaluée avec plus d’un billion de paramètres au total. Olmo-core 3 cherche ainsi à réduire les coûts de communication et de coordination qui augmentent lorsque les experts d’un modèle MoE sont répartis sur plusieurs processeurs graphiques.

Pourquoi c’est important

L’intérêt stratégique d’Olmo-core 3 tient à sa capacité à accroître fortement la capacité totale d’un modèle sans augmenter dans les mêmes proportions le nombre de paramètres activés pour chaque jeton. Le benchmark présenté associe une multiplication du nombre d’experts et une hausse marquée de la capacité totale à une diminution du débit inférieure à 5 %. En ouvrant les outils et l’infrastructure d’entraînement associés aux futures générations d’Olmo, Ai2 s’attaque aussi à un obstacle central du développement des grands modèles : les besoins élevés en puissance de calcul, les coûts et la consommation d’énergie. L’infrastructure est présentée comme ouverte et destinée à rendre cette approche accessible à un éventail plus large de chercheurs et de laboratoires.

Questions fréquentes

Qu’est-ce qu’Olmo-core 3 ?

Olmo-core 3 est une infrastructure ouverte d’entraînement destinée au développement de grands modèles de langage reposant sur une architecture mixture-of-experts.

Jusqu’à quelle échelle Olmo-core 3 doit-il fonctionner ?

Olmo-core 3 est conçu pour faire évoluer l’entraînement des modèles MoE jusqu’à l’échelle du billion de paramètres.

Combien d’experts étaient utilisés dans le benchmark ?

Le benchmark a fait passer le nombre d’experts de 8 à 128, avec 4 experts sélectionnés par jeton.

Quelle capacité totale a été atteinte dans le benchmark ?

La capacité totale est passée de 4,6 milliards à 47 milliards de paramètres, tandis que le débit d’entraînement a diminué de moins de 5 %.

Quel est le lien entre Olmo-core 3 et Olmo ?

Olmo-core 3 constitue l’un des systèmes centraux des prochaines générations d’Olmo.

Source

Hugging Face

Auteur

Rédaction IA-Medias

Rédaction spécialisée dans la veille et l’analyse de l’actualité de l’intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.