Multiverse Computing optimise l'élagage des LLM par l'Ising

D'après Hugging Face (21 septembre 2026 à 15h44)

Résumé

Multiverse Computing modélise la suppression de blocs des LLM comme une optimisation d’Ising et revendique un gain de près de 23 points sur MMLU.

Les faits

La suppression de blocs, aussi appelée élagage en profondeur, consiste à retirer des blocs entiers d’un transformeur afin de raccourcir le modèle. Cette approche apporte des gains prévisibles sur la vitesse d’inférence et des économies de mémoire, tout en pouvant être combinée à la quantification et à la compression bas-rang. La difficulté réside dans le choix des blocs à supprimer. L’effet du retrait d’un bloc dépend des autres blocs retirés simultanément : la sélection relève donc d’un problème combinatoire plutôt que d’un simple classement individuel. Multiverse Computing reformule cette sélection comme un problème d’optimisation binaire sous contraintes, directement associé à un verre d’Ising, un système de spins désordonné caractérisé par des interactions entre tous les éléments et par un nombre fixe de spins orientés vers le haut. Selon l’article, l’énergie de ce système constitue un indicateur peu coûteux de la performance du modèle élagué sur les bancs d’essai. Elle permettrait de classer un grand nombre de configurations candidates sans évaluer chacune d’elles sur les benchmarks, puis de confier les cas difficiles à des solveurs classiques et inspirés du quantique. À 50 % de compression de Llama-3.3-70B-Instruct, la méthode revendique un gain de presque 23 points de pourcentage sur MMLU par rapport à la meilleure méthode concurrente de suppression de blocs. Les approches existantes évaluent généralement chaque bloc séparément à partir de son ampleur, de sa sensibilité ou de son influence, en négligeant les interactions entre blocs.

Pourquoi c’est important

Cette approche déplace l’élagage des LLM d’une logique de classement bloc par bloc vers une optimisation prenant en compte les dépendances entre composants. Elle vise ainsi à explorer davantage de configurations, notamment lorsque la compression devient importante et que les erreurs de sélection peuvent fortement dégrader le modèle. L’intérêt opérationnel tient aussi à la possibilité d’associer la suppression de blocs à d’autres techniques de compression. En réduisant simultanément la profondeur et la mémoire requise, cette stratégie cherche à accélérer l’inférence tout en conservant de meilleures performances que les méthodes concurrentes dans le régime de compression étudié.

Questions fréquentes

Qu’est-ce que la suppression de blocs ?

Il s’agit de retirer des blocs entiers d’un transformeur pour raccourcir le modèle, accélérer l’inférence et réduire sa consommation mémoire.

Pourquoi la sélection des blocs est-elle un problème combinatoire ?

Parce que l’effet du retrait d’un bloc dépend des autres blocs supprimés en même temps.

Quel modèle a été évalué à 50 % de compression ?

Llama-3.3-70B-Instruct.

Quel gain est revendiqué sur MMLU ?

Presque 23 points de pourcentage par rapport à la meilleure méthode concurrente de suppression de blocs.

À quoi sert le modèle d’Ising ?

Il fournit une fonction d’énergie utilisée comme indicateur peu coûteux pour classer des configurations d’élagage sans toutes les évaluer sur les bancs d’essai.

Source

Hugging Face

Auteur

Rédaction IA-Medias

Rédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.