Alibaba lance Qwen-Image-3.0 pour des images IA ultra-réelles

D'après The Decoder (21 juillet 2026 à 17h55)

Résumé

Alibaba dévoile Qwen-Image-3.0, un modèle d’image capable de gérer 4 500 tokens, de rendre du texte lisible à dix pixels et de composer des mises en page complexes.

Les faits

Le groupe Alibaba renforce son offre en génération d’images avec Qwen-Image-3.0, la troisième version de son modèle développé par l’équipe Qwen. Selon l’entreprise, la première mouture était axée sur la « précision », la seconde sur « précision, variété, complétude, beauté et authenticité », tandis que cette nouvelle version est résumée par un seul mot, « réel », avec l’ambition de traiter des tâches de mise en page pratiques comme des journaux, des story‑boards ou des sujets d’examen. Qwen-Image-3.0 accepte des invites pouvant atteindre 4 500 tokens, ce qui lui permet, selon l’équipe, de générer en un seul passage des mises en page denses plutôt que d’assembler plusieurs images. Un exemple de démonstration montre un ensemble de neuf infographies distinctes dans une grille 3 x 3, chacune comportant son propre texte, des formules et des illustrations, allant de la distance de sécurité à proximité d’un tunnel à une leçon confucéenne sur les émotions et la raison, en passant par la vitesse de détachement d’un projectile depuis un cylindre en rotation. Le modèle se distingue aussi par ses capacités de rendu de texte et d’interfaces imbriquées. Alibaba affirme que Qwen-Image-3.0 peut produire un texte lisible à partir de dix pixels, avec des exemples incluant une infographie sur le requin‑baleine saturée de texte et une page complète d’un article fictif de géométrie algébrique en LaTeX, comprenant équations multilignes, indices, exposants, accolades, fractions, sommes et produits. Les démonstrations incluent également une page de journal simulée, des commentaires rouges manuscrits rappelant les annotations d’un enseignant, ainsi qu’une fenêtre VSCode contenant un écran Qwen Chat, lui‑même abritant une conversation WeChat intégrant une affiche expliquant la préparation du café filtre. Qwen-Image-3.0 vise par ailleurs un haut niveau de réalisme visuel et une maîtrise des contenus riches en connaissances. Le modèle met l’accent sur le détail photographique dans les portraits et les objets, jusqu’aux pores de la peau, à la texture cutanée et aux mèches de cheveux, et peut, dans un exemple d’édition, réparer une peinture traditionnelle à l’encre d’aigles en combat en restituant les zones manquantes dans le même style de pinceau et de lavis. Qwen décrit ce troisième axe comme une « connaissance approfondie » : le système prend en charge nativement douze langues, dont le japonais, le coréen et l’espagnol, et les exemples publiés le montrent en train de recréer des interfaces de sites web, de jeux et de diffusions en direct, ou encore de transformer une photo d’insecte en planche d’identification complète avec taxonomie, légendes anatomiques, vues détaillées agrandies et barre d’échelle.

Pourquoi c’est important

Avec Qwen-Image-3.0, Alibaba cherche à faire sortir la génération d’images de la simple illustration esthétique pour en faire un outil de production de contenus complexes, mêlant texte dense, formules et interfaces. La capacité de composer en une seule passe des grilles d’infographies, des pages de journaux ou des articles scientifiques simulés ouvre la voie à des usages professionnels dans la documentation, la pédagogie ou la communication visuelle. Le positionnement sur le « réel » et la « connaissance approfondie », combiné au support natif de douze langues et au rendu lisible de textes minuscules, place ce modèle sur le terrain des applications multi‑langues et multi‑supports. Même si la valeur pratique de pages académiques ou de journaux générées comme simples images reste discutée, ces démonstrations illustrent un glissement stratégique majeur : les modèles visuels deviennent des moteurs de mise en forme d’informations structurées, et non plus seulement des générateurs de belles images.

Questions fréquentes

Qu’est-ce que Qwen-Image-3.0 d’Alibaba ?

C’est la troisième version du générateur d’images d’Alibaba, conçue pour produire des mises en page complexes et des contenus visuels pratiques plutôt que de simples images décoratives.

Quelle longueur de prompt Qwen-Image-3.0 peut-il gérer ?

Le modèle accepte des invites allant jusqu’à 4 500 tokens, ce qui lui permet de composer des mises en page denses en un seul passage.

Jusqu’à quelle taille de police le texte reste-t-il lisible ?

Alibaba indique que Qwen-Image-3.0 peut produire un texte lisible à partir de dix pixels, même dans des infographies très chargées.

Quelles langues Qwen-Image-3.0 prend-il en charge ?

Le modèle prend en charge nativement douze langues, dont notamment le japonais, le coréen et l’espagnol, selon les exemples fournis.

Qwen-Image-3.0 se limite-t-il aux infographies ?

Non, les démonstrations incluent des interfaces logicielles imbriquées, des pages de journaux, des articles LaTeX simulés et l’édition d’images comme la restauration de peintures.

Source

The Decoder

Auteur

Rédaction IA-Medias

Rédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.