H Company lance NeoMME, un encodeur multimodal plus sobre
D'après Hugging Face (3 septembre 2026 à 15h13)
Résumé
H company présente NeoMME, une famille d’encodeurs multimodaux et multilingues de 260M et 800M paramètres, entraînés de zéro avec un seul Transformer bidirectionnel.
Les faits
H company introduit NeoMME, une famille d’encodeurs multimodaux et multilingues de 260M et 800M paramètres. La publication précise que, contrairement à de nombreux modèles vision-langage génératifs, NeoMME n’utilise ni tour de vision préentraînée séparée ni modèle de langage causal. L’architecture repose sur « un seul Transformer bidirectionnel » qui traite à la fois les jetons de texte et les patchs bruts d’image. Le modèle est entraîné « from scratch » avec un objectif de diffusion discrète masquée, ce qui le distingue des approches qui réutilisent des briques préexistantes. La version NeoMME-Retriever a ensuite été affinée pour la recherche documentaire visuelle à partir de l’approche par page-image de ColPali. Selon l’extrait, NeoMME-Retriever renvoie des embeddings denses et de late interaction en un seul passage avant, et les deux tailles de modèle se situent sur la frontière de Pareto de ViDoRe v3 pour le nDCG@10 et la taille du modèle. L’extrait avance aussi qu’à taille d’entrée d’image de 2048×2048 sur un GPU NVIDIA L40S, le modèle 260M encode environ 51 pages par seconde, soit environ deux fois le débit de ColModernVBERT. Il indique enfin que le stockage d’index de late interaction passe d’environ 1,5 MB à 6 kB par page grâce au pooling hiérarchique des jetons et à la quantification asymétrique, tout en conservant plus de 95% du nDCG@10 de référence.
Pourquoi c’est important
NeoMME illustre une évolution claire des encodeurs multimodaux vers des architectures plus sobres. En supprimant la tour de vision séparée et le décodeur causal, H company cherche à réduire la surcharge en paramètres et en calcul, tout en gardant une capacité à traiter texte et image dans un même modèle. L’intérêt stratégique est particulièrement fort pour la recherche documentaire visuelle et les usages de RAG visuel. Les gains annoncés sur le débit, la compacité de l’index et le positionnement sur la frontière de Pareto suggèrent un modèle pensé pour des déploiements plus efficaces, où la latence et le coût de stockage comptent autant que la qualité de récupération.
Questions fréquentes
Que propose NeoMME ?
NeoMME est une famille d’encodeurs multimodaux et multilingues de 260M et 800M paramètres, conçue pour traiter texte et images avec un seul Transformer.
NeoMME utilise-t-il une tour de vision séparée ?
Non. L’extrait précise qu’il n’utilise ni tour de vision préentraînée séparée ni modèle de langage causal.
À quoi sert NeoMME-Retriever ?
NeoMME-Retriever a été affiné pour la recherche documentaire visuelle et renvoie des embeddings denses et de late interaction en un seul passage avant.
Quels gains de stockage sont annoncés ?
Le stockage d’index de late interaction passe d’environ 1,5 MB à 6 kB par page, soit 255× moins, avec plus de 95% du nDCG@10 de référence.
Source
Hugging FaceAuteur
Rédaction IA-MediasRédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.