Auteur Sujet: La gamme Qwen, une progression rapide, tous azimuth.  (Lu 35 fois)

0 Membres et 2 Invités sur ce sujet

Gnubyte

  • Abonné Orange Fibre
  • *
  • Messages: 1 175
  • Toulon (83)
    • HSGMII intégriste repenti, Néo XGS-PON prosélyte
La gamme Qwen, une progression rapide, tous azimuth.
« le: Aujourd'hui à 22:07:42 »
Dire "Qwen", c'est vite dit. Ok Qwen sort à haute fréquence des modèles à poids libres, de types très éclectiques.

Qwen 2.5, c'était seulement il y a 2 ans, en sept 2024.
Qwen 3.8 Flash Next, sorti en aout 2026, est un multimodal hébergeable sur duo de DGX-Spark, avec des performances décentes, et visible sur le classement modial Artificial analysis.

Les progrès sont rapides, et tout est en poids libres, sauf la version 3.7 qui a beaucoup souffert de l'ouverture des 3 concurrents, GLM de Z.ai, DeepSeek et Kimi.

Alibaba / Qwen – état des lieux (octobre 2026)

1. La société derrière Qwen

Qwen est développé par l'équipe Qwen de Alibaba Group (Hangzhou), au sein de sa division Cloud Intelligence Group (Alibaba Cloud / Aliyun). Alibaba reste avant tout un conglomérat e-commerce (Taobao, Tmall, AliExpress, Lazada, quick commerce), logistique (Cainiao) et cloud. Mais le cloud est devenu son moteur de croissance :
  • Revenu Cloud Intelligence Group FY2026 (clos au 31/03/2026) : 158,1 Mds RMB (~22,9 Mds USD), +34 % sur un an ; les produits IA pèsent ~30 % du revenu cloud externe et affichent une croissance à trois chiffres depuis 11 trimestres consécutifs (résultats annuels, SEC 6-K).
  • Capex FY2026 : 126 Mds RMB (~18,3 Mds USD), l'essentiel pour l'infra cloud/IA (rapport annuel FY2026). Plan annoncé en février 2025 : 380 Mds RMB sur 3 ans ; LatePost rapportait en janvier 2026 une révision possible à 480 Mds RMB.
  • Puces maison : la filiale T-Head a mis en production à l'échelle son GPU Zhenwu 810E (perfs comparables à un Nvidia H20 selon SCMP), optimisé pour l'entraînement/inférence de Qwen. En avril 2026, Alibaba et China Telecom ont ouvert un datacenter à Shaoguan (Guangdong) avec 10 000 puces Zhenwu (Barchart).
  • Nvidia : Alibaba achète massivement à l'étranger (reprise des livraisons H200 vers la Chine autorisée par Washington) et aurait même monté des clusters d'inférence sur RTX 4090. Fin 2025 le CEO Eddie Wu indiquait ne pas réussir à déployer les serveurs assez vite et rationner l'accès GPU (The Register).
Le nombre total de GPU hébergés n'est pas publié. Les seuls ordres de grandeur publics sont le capex, le cluster de 10 000 Zhenwu et la plateforme PAI/Lingjun (clusters « near-linear » pour l'entraînement de grands modèles).

2. Architecture des modèles courants

Chronologie récente (GitHub QwenLM/Qwen3.8) : Qwen3-Next (sept. 2025, précurseur architectural) → Qwen3.5 (févr. 2026 : 397B-A17B, 122B-A10B, 35B-A3B, 27B, 9B, 4B, 2B, 0.8B) → Qwen3.6 (avril : 35B-A3B, 27B) → Qwen3.7 Max/Plus (mai-juin, propriétaires) → Qwen3.8 (août : Max 2.4T-A95B le 3, poids ouverts le 12, 27B le 14, Flash-Next le 26 ; mise à jour Max-0902 le 2 sept.).

2.1 La base commune (Qwen3.5 → 3.8)
  • Attention hybride : 3 couches Gated DeltaNet (attention linéaire, coût ~constant en longueur) pour 1 couche Gated Attention classique (GQA). Résultat : contexte 262k natif, extensible à ~1M via YaRN.
  • MoE ultra-sparse (modèles Max/Plus) : 512 experts, 10 routés + 1 partagé par token. Qwen3.8-2.4T-A95B : 2,4 T paramètres totaux, ~95 B actifs, 92 couches, hidden 8192, multi-token prediction (model card HF).
  • Multimodal natif par early fusion (Qwen3.5+), 201 langues.
  • Raisonnement contrôlable : reasoning_effort (xhigh par défaut / medium / low), enable_thinking et preserve_thinking. Attention : le 2.4T open-weights est texte seul et thinking obligatoire ; la version Max cloud ajoute vision, mode non-thinking et 1M de contexte.

2.2 Qwen3.8-27B – le dense « local » (model card HF)
  • Modèle dense (pas de MoE), 27 B (28 B avec la tour vision), Apache 2.0, sorti le 14 août 2026.
  • 64 couches en schéma 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)), soit 48 couches linéaires + 16 couches d'attention complète ; hidden 5120, FFN 17 408, 24 têtes Q / 4 têtes KV (dim 256), DeltaNet 48 têtes V / 16 têtes QK (dim 128). MTP entraîné multi-steps.
  • Vision native : tour ViT de 27 couches (patch 16, fusion spatiale 2) projetée dans l'espace du LM ; images, documents, diagrammes STEM et vidéos « à l'échelle de l'heure ».
  • Contexte 262 144 natif, 1M via YaRN ; thinking activé par défaut (désactivable), reasoning_effort xhigh par défaut. Simon Willison note que ce défaut xhigh le fait « sur-réfléchir » de façon spectaculaire sur des tâches simples (billet).
  • Déploiement : tient sur un seul GPU 24 Go en Q4 (contexte réduit), ~56 Go en BF16 ; 1 374 quantifs communautaires sur HF (GGUF, MLX, INT4 AutoRound, NVFP4, Core ML…), ~500 fine-tunes dont Smaug-Mini (Abacus.AI). Version hébergée QwenCloud annoncée « bientôt ».

2.3 Qwen3.8-Flash-Next – l'aperçu de Qwen4 (model card HF, GitHub)

Sorti le 26 août 2026, ce n'est pas un modèle de production mais un banc d'essai public de l'architecture Qwen4 (type de modèle tagué qwen4_exp dans la config). La version de prod s'appelle Qwen3.8-Flash sur QwenCloud (1M de contexte, outils intégrés, 0,16 $ / 0,47 $ par M tokens).
  • Dimensions : MoE multimodal 125 B dont 6 B activés, + table d'embeddings n-grammes de 51 B + couche MTP de 4 B (~180 B sur disque en BF16). Hidden 2560, 48 couches, 512 experts (10 routés + 1 partagé, dim intermédiaire 640), contexte 262k natif / 1M YaRN, image + vidéo en entrée. Licence qwen-community-1.0 (pas Apache 2.0).
  • Quatre nouveautés par rapport à Qwen3-Next, sur les axes attention / résiduel / embedding / optimisation :
    • GDN + QSA : même schéma 3:1, mais la Gated Attention est remplacée par Qwen Sparse Attention, qui travaille par micro-blocs : un indexeur MQA (4 têtes Q, 1 tête clé partagée, dim 128) sélectionne les blocs pertinents, budget 512 blocs = 2048 tokens ; l'attention principale n'a que 2 têtes KV pour 24 têtes Q. Qwen annonce jusqu'à 10,2× en prefill et 6,6× en décodage sur le kernel d'attention à 1M de tokens. C'est l'idée de DeepSeek Sparse Attention poussée plus loin.
    • Gated Residual (hyper-connexions) : l'entrée de chaque couche est élargie en 4 branches résiduelles avec une porte de lecture élément par élément dépendante des données et une porte d'écriture scalaire par branche (rang de goulot 320). Plus d'expressivité en profondeur sans sacrifier la stabilité d'entraînement.
    • N-gram Embedding : table de 20 M d'entrées (bigrammes/trigrammes, injectée à la couche 2) pesant 51 B de paramètres. Un axe de scaling quasi gratuit en FLOPs et déchargeable en RAM hôte, présenté comme plus adapté aux accélérateurs à mémoire limitée que le MoE. Reprise de l'idée « Engram » de DeepSeek ; c'est le point qui fait débat (« 125 B dont 51 B de trigrammes mémorisés »).
    • Recette d'entraînement : optimiseurs Muon et AdamW appliqués à des catégories de poids distinctes ; suppression du warm-up de batch size (démarrage direct à la taille cible), lois d'échelle réajustées. Coût d'entraînement revendiqué : ~1/9 de celui de Qwen3.7-Plus (The Decoder).
  • Déploiement : BF16 et checkpoint FP8 officiel ; vLLM 0.28+ (recette), SGLang, TokenSpeed, et KTransformers recommandé pour le déchargement CPU de la table n-gram ; GGUF Unsloth pour llama.cpp (texte + vision), MLX, INT4 AutoRound (Intel). Fine-tuning via ms-swift sur backend Megatron. Avec 6 B actifs, c'est un modèle pensé pour la mémoire unifiée ou CPU + RAM abondante (~180 Go en FP8, ~90-100 Go en Q4) plutôt que pour un GPU 24 Go.

3. Écosystème de déploiement

  • Officiel / cloud : Qwen Studio (chat.qwen.ai), API QwenCloud compatible OpenAI et Anthropic (fonctionne donc avec Claude Code, Codex, Qwen Code) – Qwen3.8-Max à 2 $ / 6 $ par M tokens, Qwen3.8-Flash à 0,16 $ / 0,47 $. Outils maison : Qwen Code (agent terminal), Qoder (IDE agentique), QwenWork.
  • Poids : Hugging Face et ModelScope (miroir chinois).
  • Licences : Apache 2.0 pour le 27B, le 35B-A3B et les petites tailles ; qwen-community-1.0 pour Flash-Next ; licence « qwen3.8-max » spécifique pour le 2.4T-A95B, avec partage de revenus exigé des fournisseurs dépassant 50 M USD/an (Wikipedia).
  • Serving : vLLM, SGLang, TokenSpeed (recettes officielles), transformers serve, KTransformers ; en local llama.cpp (GGUF), MLX (mlx-lm / mlx-vlm), Ollama, LM Studio, Unsloth.
  • Fine-tuning : Unsloth, ms-swift, LLaMA-Factory (SFT/DPO/GRPO).
  • Tiers : NVIDIA NIM, OpenRouter, Novita, Featherless, Together, Fireworks, Vercel AI Gateway… Le 2.4T demande un cluster multi-nœuds même en FP8.

4. Benchmarks officiels et place sur Artificial Analysis

4.1 Qwen3.8-Max (model card HF du 2.4T-A95B), face à Claude Opus 4.8 / Fable 5 / GPT-5.6 Sol :
BenchQwen3.8-MaxQwen3.7-MaxOpus 4.8Fable 5GPT-5.6 Sol
Terminal Bench 2.186,674,584,684,688,8
SWE-bench Pro67,760,669,280,064,6
PaperBench93,064,880,388,890,5
GPQA Diamond92,692,492,092,694,1
HLE43,641,445,753,347,2
IFBench82,879,162,263,572,7
HealthBench60,254,552,4–55,3
Lecture : énorme saut vs 3.7 sur l'agentique/code (DeepSWE 21,6 → 56,6 ; FrontierSWE 40,7 → 73,5), mais Alibaba reconnaît rester derrière Fable 5 sur ses propres benchs internes (RecreationBench 51,7 vs 56,1). Beaucoup de scores sont mesurés avec le harness Claude Code.

4.2 Qwen3.8-27B (model card HF), face à son prédécesseur, au 3.7-Plus (397B-A17B) et à Opus 4.6 Max :
BenchQwen3.8-27BQwen3.6-27BQwen3.7-PlusOpus 4.6 Max
Terminal Bench 2.1 (Terminus)73,063,464,078,2
SWE-bench Pro61,753,557,653,4
DeepSWE 1.142,213,314,2–
CoWorkBench70,761,065,168,2
GPQA Diamond89,287,890,391,3
HLE30,824,034,740,0
LiveCodeBench v690,383,989,688,8
OSWorld-Verified (vision)84,363,973,372,7
AndroidWorld (vision)81,970,381,062,0
Lecture : un dense de 27 B qui dépasse le MoE 397B-A17B de la génération précédente sur le code agentique et bat Opus 4.6 sur SWE-bench Pro et presque tout le volet vision (OSWorld 84,3, BabyVision 85,6 avec CI, MathVision 94,6). Reste en retrait sur la connaissance pure (HLE 30,8).

4.3 Qwen3.8-Flash-Next (model card HF), 6 B actifs face au 27B dense, au 3.7-Plus, à DeepSeek-V4-Flash et Opus 4.6 Max :
BenchFlash-NextQwen3.8-27BQwen3.7-PlusDS-V4-FlashOpus 4.6
DeepSWE 1.158,742,216,554,4–
SWE-bench Pro62,561,755,856,053,4
JobBench55,733,427,641,336,6
Toolathlon Verified73,567,150,670,3–
GPQA Diamond91,789,290,390,891,3
HLE35,930,834,733,840,0
LiveCodeBench v691,990,389,690,688,8
AndroidWorld (vision)84,581,981,0–62,0
Lecture : avec 6 B actifs il fait mieux que le 27B dense sur quasi tout et devance son grand frère 3.7-Plus ; ses seules faiblesses sont HLE (où Opus 4.6 reste devant) et l'analyse de graphiques scientifiques (CharXiv sans CI : 3.7-Plus 85,8 vs 84,6). Côté vision : ERQA 72,3, LVBench 76,6, OSWorld 2.0 partiel 52,3. Attention : chiffres du vendeur, modèle non indexé sur Artificial Analysis à ce jour.

4.4 Artificial Analysis (mesures indépendantes) :
  • À la sortie du Max (août 2026, version d'index alors en vigueur) : 56 sur l'Intelligence Index, +10 vs Qwen3.7 Max (46), 1 point derrière le leader open-weights Kimi K3 (57) et au niveau d'Opus 4.8 ; GDPval-AA 1739 Elo (+468) (AA sur X). The Batch le plaçait 5e global / 2e open-weights (deeplearning.ai).
  • Index actuel v4.3.2 (octobre 2026, recalibré, 10 évals dont AA-Briefcase, GDPval-AA v2.1, Terminal-Bench 4.0, HLE) : Qwen3.8 Max (0902) = 45 (médiane de sa classe : 26), rang #32 ; 35 tok/s (lent), 5,41 $/tâche, très verbeux (190 M tokens générés) (page AA). Le 27B et le Flash-Next ne sont pas indexés.
Les scores AA ne sont donc comparables qu'à version d'index égale – ne pas mélanger les « 56-58 » d'août et les « 45 » d'octobre.

5. Distillations et modèles annexes

  • Distillation officielle : c'est la méthode Qwen depuis Qwen3 : les petites tailles (Qwen3.5-0.8B/2B/4B/9B, mars 2026) sont obtenues par distillation forte→faible des grands modèles, puis RL.
  • Distillations tierces : DeepSeek-R1-Distill-Qwen (1,5B à 32B, sur base Qwen2.5) et DeepSeek-R1-0528-Qwen3-8B restent les plus connues ; en août 2026 empero-ai a publié des Qwen3.8-2B/4B/9B-Distill (élève Qwen3.5, maître Qwen3.8 2.4T-A95B) – non officiels.
  • Fine-tunes notables du 27B : Smaug-Mini (Abacus.AI), Swift-Qwen3.8-27B ; 71 fine-tunes déjà listés pour Flash-Next.
  • Modèles annexes Alibaba (catalogue QwenCloud, changelog) :
    • Image : Qwen-Image 3.0 / 3.0-pro (août 2026), Qwen-Image 2.0, Qwen-Image-Edit, Qwen-Image-Layered.
    • Vidéo : Wan 2.7 (reference-to-video), lignée Wan 2.1/2.2 open-weights.
    • Audio : Qwen-Audio 3.0 TTS, qwen-audio-3.1-realtime (sept. 2026) ; historiquement Qwen3-Omni (omni-modal), Qwen3-TTS/ASR.
    • Vision : Qwen3-VL (fusionné dans la base depuis 3.5), Qwen3-VL-Embedding.
    • Retrieval : Qwen3-Embedding et Qwen3-Reranker (0.6B / 4B / 8B, Apache 2.0).
    • Code / raisonnement : Qwen3-Coder, QwQ-32B, Qwen2.5-Math, Qwen3-Guard (modération).
  • Prochaine étape : Qwen3.8-Flash-Next est explicitement le premier aperçu de Qwen 4 (cf. 2.3) ; Alibaba s'en sert pour laisser aux outils d'inférence (vLLM, SGLang, llama.cpp) le temps de s'adapter avant le lancement de la gamme complète.

Sources principales : GitHub QwenLM/Qwen3.8 et QwenLM/Qwen3.8-Flash-Next ; model cards HF Qwen3.8-2.4T-A95B, Qwen3.8-27B et Qwen3.8-Flash-Next ; artificialanalysis.ai ; rapports SEC Alibaba FY2026 ; QwenCloud changelog ; vLLM Recipes ; The Register ; The Decoder ; Barchart ; Wikipedia ; simonwillison.net.