Transformers intègre les modèles GGUF pour l'IA locale
D'après Hugging Face (22 septembre 2026 à 02h00)
Résumé
Hugging Face ajoute la prise en charge des modèles GGUF dans Transformers, afin de faciliter l’inférence locale sur les Mac équipés de puces Apple Silicon.
Les faits
Hugging Face ajoute la prise en charge de l’exécution efficace des modèles GGUF dans Transformers. Les utilisateurs peuvent sélectionner un modèle GGUF sur le Hub, le charger avec `from_pretrained` et lancer une génération sur leur propre machine. L’implémentation vise à utiliser des modèles adaptés à la mémoire disponible sur un ordinateur portable. Le format GGUF, développé par l’équipe de llama.cpp, regroupe dans un seul fichier les poids du modèle et ses métadonnées, notamment les informations du tokenizer et, éventuellement, un modèle de conversation. Il prend en charge plusieurs niveaux de quantification, qui permettent de réduire l’empreinte mémoire en échange d’une perte potentielle de précision. Des variantes comme `Q4_K_M` combinent plusieurs précisions, avec principalement des poids sur 4 bits et des tenseurs sensibles conservés à une précision supérieure. Pour le modèle Qwen3.5-4B d’Unsloth, la version `BF16` occupe 8,42 Go, contre 3,53 Go pour `Q6_K`, 3,14 Go pour `Q5_K_M` et 2,74 Go pour `Q4_K_M`. Hugging Face recommande de commencer par `Q4_K_M`, puis d’essayer `Q5_K_M` ou `Q6_K` lorsqu’une mémoire plus importante est disponible. Cette première prise en charge cible l’inférence locale sur les Mac équipés de puces Apple Silicon, en commençant par l’architecture Qwen3.5. Pour rapprocher les performances de celles de llama.cpp, Transformers réutilise ses noyaux ggml sous-jacents avec la bibliothèque `kernels` et réduit la surcharge de la méthode `generate`. Le chargement nécessite notamment la version la plus récente de Transformers, actuellement disponible sur la branche principale, ainsi qu’une version compatible de `kernels`.
Pourquoi c’est important
Cette intégration rapproche l’écosystème Transformers des usages locaux déjà popularisés par llama.cpp. Les utilisateurs peuvent exploiter des modèles quantifiés conçus pour tenir dans la mémoire de leur ordinateur tout en conservant les API familières de Transformers. La quantification rend également possible un compromis explicite entre taille du fichier, consommation mémoire et précision. Avec une version `Q4_K_M` de 2,74 Go pour Qwen3.5-4B, un modèle peut être déployé localement avec une empreinte nettement inférieure à celle de la version `BF16`, qui atteint 8,42 Go.
Questions fréquentes
Que permet cette nouveauté de Transformers ?
Elle permet de charger des modèles GGUF depuis le Hub avec `from_pretrained` et de lancer une inférence locale via les API de Transformers.
Qu’est-ce que le format GGUF ?
GGUF est un format développé par l’équipe de llama.cpp qui regroupe les poids et les métadonnées d’un modèle dans un seul fichier.
Quelle quantification est recommandée pour commencer ?
Hugging Face recommande de commencer par `Q4_K_M`, puis d’essayer `Q5_K_M` ou `Q6_K` avec davantage de mémoire.
Quels appareils sont ciblés en priorité ?
La prise en charge initiale cible les Mac équipés de puces Apple Silicon.
Source
Hugging FaceAuteur
Rédaction IA-MediasRédaction spécialisée dans la veille et l’analyse de l’actualité de l’intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.