Liquid AI accélère son IA vision-langage avec DSpark
D'après Hugging Face (24 septembre 2026 à 16h08)
Résumé
Liquid AI publie LFM2.5-VL-DSpark, un modèle brouillon expérimental qui accélère LFM2.5-VL-3B avec seulement 8,9 % de paramètres supplémentaires.
Les faits
Liquid AI publie un modèle brouillon expérimental, LFM2.5-VL-DSpark, conçu pour le modèle vision-langage LFM2.5-VL-3B. Cette approche ajoute une voie de décodage spéculatif qui augmente légèrement l’empreinte mémoire tout en visant une accélération plus importante, sans modifier la qualité des sorties. Le modèle brouillon reprend l’architecture des modèles LFM2.5-DSpark destinés au texte. Il exploite les états cachés du modèle cible à un ensemble fixe de couches intermédiaires et produit un bloc de 9 jetons candidats. Les fragments d’image et les jetons de texte sont projetés dans une représentation commune avant ces couches, ce qui permet au brouilleur de traiter des vecteurs d’états cachés de dimension identique, quelle que soit la modalité d’entrée. Liquid AI indique avoir entraîné le modèle selon la méthode DSpark, à partir d’un mélange de données d’apprentissage supervisé vision-langage pondéré en fonction des usages prévus. Après des tests portant sur 3, 4 et 5 couches, l’entreprise a retenu un modèle simplifié fondé uniquement sur l’attention, avec 4 couches et une taille de bloc de 9. L’entraînement final a duré 10 époques. Le modèle brouillon compte environ 280 millions de paramètres et augmente de 8,9 % le nombre de paramètres du modèle déployé. À l’inférence, Liquid AI recommande une taille de bloc de 8 ou 9 selon le matériel utilisé.
Pourquoi c’est important
LFM2.5-VL-DSpark transpose le décodage spéculatif aux modèles vision-langage sans modifier l’algorithme d’inférence utilisé par les modèles textuels de Liquid AI. Le principe consiste à accepter des groupes de jetons proposés à l’avance par un modèle brouillon, en échange d’un faible accroissement de la mémoire et de la taille du modèle déployé. Le compromis présenté repose sur un brouilleur relativement compact — environ 280 millions de paramètres — face à une hausse annoncée de 8,9 % du nombre total de paramètres. La recommandation d’une taille de bloc de 8 ou 9, adaptée au matériel, souligne également que les gains d’inférence dépendent de la configuration utilisée.
Questions fréquentes
Qu’est-ce que LFM2.5-VL-DSpark ?
C’est un modèle brouillon expérimental destiné à accélérer l’inférence de LFM2.5-VL-3B par décodage spéculatif.
Quel modèle LFM2.5-VL-DSpark accélère-t-il ?
LFM2.5-VL-DSpark est conçu pour le modèle vision-langage LFM2.5-VL-3B.
Combien de paramètres le modèle brouillon possède-t-il ?
Il compte environ 280 millions de paramètres et augmente de 8,9 % le nombre de paramètres du modèle déployé.
Quelle taille de bloc est utilisée ?
Le modèle a été conçu avec une taille de bloc de 9. À l’inférence, une taille de 8 ou 9 est recommandée selon le matériel.
Source
Hugging FaceAuteur
Rédaction IA-MediasRédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.