La Fibre

Télécom => Logiciels et systèmes d'exploitation => AI Intelligence artificielle => Discussion démarrée par: Gnubyte le 09 octobre 2026 à 22:07:42

Titre: La gamme Qwen, une progression rapide, tous azimuth.
Posté par: Gnubyte le 09 octobre 2026 à 22:07:42
Dire "Qwen", c'est vite dit. Ok Qwen sort à haute fréquence des modèles à poids libres, de types très éclectiques.

Qwen 2.5, c'était seulement il y a 2 ans, en sept 2024.
Qwen 3.8 Flash Next, sorti en aout 2026, est un multimodal hébergeable sur duo de DGX-Spark, avec des performances décentes, et visible sur le classement modial Artificial analysis.

Les progrès sont rapides, et tout est en poids libres, sauf la version 3.7 qui a beaucoup souffert de l'ouverture des 3 concurrents, GLM de Z.ai, DeepSeek et Kimi.

Alibaba / Qwen – état des lieux (octobre 2026)

1. La société derrière Qwen

Qwen est développé par l'équipe Qwen de Alibaba Group (Hangzhou), au sein de sa division Cloud Intelligence Group (Alibaba Cloud / Aliyun). Alibaba reste avant tout un conglomérat e-commerce (Taobao, Tmall, AliExpress, Lazada, quick commerce), logistique (Cainiao) et cloud. Mais le cloud est devenu son moteur de croissance :
Le nombre total de GPU hébergés n'est pas publié. Les seuls ordres de grandeur publics sont le capex, le cluster de 10 000 Zhenwu et la plateforme PAI/Lingjun (clusters « near-linear » pour l'entraînement de grands modèles).

2. Architecture des modèles courants

Chronologie récente (GitHub QwenLM/Qwen3.8 (https://github.com/QwenLM/Qwen3.8)) : Qwen3-Next (sept. 2025, précurseur architectural) → Qwen3.5 (févr. 2026 : 397B-A17B, 122B-A10B, 35B-A3B, 27B, 9B, 4B, 2B, 0.8B) → Qwen3.6 (avril : 35B-A3B, 27B) → Qwen3.7 Max/Plus (mai-juin, propriétaires) → Qwen3.8 (août : Max 2.4T-A95B le 3, poids ouverts le 12, 27B le 14, Flash-Next le 26 ; mise à jour Max-0902 le 2 sept.).

2.1 La base commune (Qwen3.5 → 3.8)

2.2 Qwen3.8-27B – le dense « local » (model card HF (https://huggingface.co/Qwen/Qwen3.8-27B))

2.3 Qwen3.8-Flash-Next – l'aperçu de Qwen4 (model card HF (https://huggingface.co/Qwen/Qwen3.8-Flash-Next), GitHub (https://github.com/QwenLM/Qwen3.8-Flash-Next/))

Sorti le 26 août 2026, ce n'est pas un modèle de production mais un banc d'essai public de l'architecture Qwen4 (type de modèle tagué qwen4_exp dans la config). La version de prod s'appelle Qwen3.8-Flash sur QwenCloud (1M de contexte, outils intégrés, 0,16 $ / 0,47 $ par M tokens).

3. Écosystème de déploiement


4. Benchmarks officiels et place sur Artificial Analysis

4.1 Qwen3.8-Max (model card HF du 2.4T-A95B), face à Claude Opus 4.8 / Fable 5 / GPT-5.6 Sol :
BenchQwen3.8-MaxQwen3.7-MaxOpus 4.8Fable 5GPT-5.6 Sol
Terminal Bench 2.186,674,584,684,688,8
SWE-bench Pro67,760,669,280,064,6
PaperBench93,064,880,388,890,5
GPQA Diamond92,692,492,092,694,1
HLE43,641,445,753,347,2
IFBench82,879,162,263,572,7
HealthBench60,254,552,4–55,3
Lecture : énorme saut vs 3.7 sur l'agentique/code (DeepSWE 21,6 → 56,6 ; FrontierSWE 40,7 → 73,5), mais Alibaba reconnaît rester derrière Fable 5 sur ses propres benchs internes (RecreationBench 51,7 vs 56,1). Beaucoup de scores sont mesurés avec le harness Claude Code.

4.2 Qwen3.8-27B (model card HF), face à son prédécesseur, au 3.7-Plus (397B-A17B) et à Opus 4.6 Max :
BenchQwen3.8-27BQwen3.6-27BQwen3.7-PlusOpus 4.6 Max
Terminal Bench 2.1 (Terminus)73,063,464,078,2
SWE-bench Pro61,753,557,653,4
DeepSWE 1.142,213,314,2–
CoWorkBench70,761,065,168,2
GPQA Diamond89,287,890,391,3
HLE30,824,034,740,0
LiveCodeBench v690,383,989,688,8
OSWorld-Verified (vision)84,363,973,372,7
AndroidWorld (vision)81,970,381,062,0
Lecture : un dense de 27 B qui dépasse le MoE 397B-A17B de la génération précédente sur le code agentique et bat Opus 4.6 sur SWE-bench Pro et presque tout le volet vision (OSWorld 84,3, BabyVision 85,6 avec CI, MathVision 94,6). Reste en retrait sur la connaissance pure (HLE 30,8).

4.3 Qwen3.8-Flash-Next (model card HF), 6 B actifs face au 27B dense, au 3.7-Plus, à DeepSeek-V4-Flash et Opus 4.6 Max :
BenchFlash-NextQwen3.8-27BQwen3.7-PlusDS-V4-FlashOpus 4.6
DeepSWE 1.158,742,216,554,4–
SWE-bench Pro62,561,755,856,053,4
JobBench55,733,427,641,336,6
Toolathlon Verified73,567,150,670,3–
GPQA Diamond91,789,290,390,891,3
HLE35,930,834,733,840,0
LiveCodeBench v691,990,389,690,688,8
AndroidWorld (vision)84,581,981,0–62,0
Lecture : avec 6 B actifs il fait mieux que le 27B dense sur quasi tout et devance son grand frère 3.7-Plus ; ses seules faiblesses sont HLE (où Opus 4.6 reste devant) et l'analyse de graphiques scientifiques (CharXiv sans CI : 3.7-Plus 85,8 vs 84,6). Côté vision : ERQA 72,3, LVBench 76,6, OSWorld 2.0 partiel 52,3. Attention : chiffres du vendeur, modèle non indexé sur Artificial Analysis à ce jour.

4.4 Artificial Analysis (mesures indépendantes) :
Les scores AA ne sont donc comparables qu'à version d'index égale – ne pas mélanger les « 56-58 » d'août et les « 45 » d'octobre.

5. Distillations et modèles annexes


Sources principales : GitHub QwenLM/Qwen3.8 et QwenLM/Qwen3.8-Flash-Next ; model cards HF Qwen3.8-2.4T-A95B, Qwen3.8-27B et Qwen3.8-Flash-Next ; artificialanalysis.ai ; rapports SEC Alibaba FY2026 ; QwenCloud changelog ; vLLM Recipes ; The Register ; The Decoder ; Barchart ; Wikipedia ; simonwillison.net.