8 octobre 2026
1. La société : DeepSeek (杭州深度求索)Identité- Nom officiel : Hangzhou DeepSeek Artificial Intelligence Basic Technology Research Co., Ltd. (深度求索, pinyin Shēndù Qiúsuǒ = « recherche en profondeur »)
- Fondée le 17 juillet 2023 à Hangzhou (Zhejiang, Chine) par Liang Wenfeng
- Société privée, détenue et financée par High-Flyer, le hedge fund quantitatif co-fondé par Liang en 2015
- ~160 employés (2025), PDG Liang Wenfeng (qui détenait 84 % via deux holdings en 2024)
Histoire- 2021 : Liang commence à acheter massivement des GPU Nvidia (≈ 10 000 A100) avant les restrictions US sur les puces — moins de 5 sociétés chinoises en possédaient plus
- Avril 2023 : High-Flyer annonce un labo de recherche AGI, détaché de l’activité financière
- 17 juillet 2023 : le labo est scindé en société indépendante, DeepSeek
- Janvier 2025 : lancement de DeepSeek-R1 et du chatbot — devient l’app gratuite n°1 de l’App Store US, provoquant une chute de 18 % de l’action Nvidia
- Depuis janvier 2025 : tous les modèles publiés en open-weights sous licence MIT
- Mai 2026 : Series A de 7 Mds $, valorisation post-money 52 Mds $
- Juillet 2026 : préparation d’une IPO dès 2027, discussions à 70 Mds $ de valorisation pré-money
Champs de compétence- LLM généralistes et agentiques, code, raisonnement, multimédia (vision, OCR), mathématiques / proof-verification
- Stack infra propriétaire : clusters Fire-Flyer / Fire-Flyer 2 (5 000 A100 PCIe en 2025), 3FS (filesystem parallèle RDMA), hfreduce, HaiScale DDP, HAI Platform
- Efficacité algorithmique extrême (contrainte des restrictions US) : modèles fonctionnant sur matériel daté/contraint, faible consommation
- Culture maison : pas de KPI rigides ni « 996 », recrutement de profils non-CS (poésie, maths), académique
- Particularité : procédure libre / open-weights — les poids sont partagés, pas la donnée d’entraînement
- Positionnement : recherche d’abord, pas de plan immédiat de commercialisation (position historique, en train d’évoluer avec la levée)
Controverses / contexte- Février 2026 : Anthropic accuse DeepSeek d’avoir utilisé des milliers de comptes « fantômes » pour générer des millions de conversations Claude comme données d’entraînement
- Liens avec la défense : laboratoires de l’APL, « Seven Sons of National Defence » ; chatbot adopté par l’APL (hôpitaux, gendarmerie) depuis 2025
- Restrictions US (NDAA FY2026) : retrait de DeepSeek des appareils DOD/IC sauf dérogation ; directive similaire en Australie
- Adoption : Azure, Perplexity hébergent nativement ses modèles ; Huawei et Cambricon (semi-conducteurs) ont intégré V4
Sources : Wikipedia (DeepSeek), changelog officiel API, presse (NYT, FT, Bloomberg).
2. Architecture des modèles courantsFamille V4 (avril 2026 → aujourd’hui) | V4-Flash | V4-Pro |
| Paramètres totaux | 284 Md | 1,6 T (1 600 Md) |
| Paramètres actifs (MoE) | 13 Md | 49 Md |
| Contexte | 1 M tokens | 1 M tokens |
| Sortie max | 384 K tokens | 384 K tokens |
| Modalités | texte | texte |
| Licence | MIT | MIT |
- Mixture-of-Experts (MoE) : seule une fraction des paramètres est activée par token — économies d’énergie et de latence
- Multi-head Latent Attention (MLA) : compression du KV-cache (héritage V2)
- DeepSeek Sparse Attention (DSA) : attention qui n’active que les parties pertinentes du contexte — rend le 1 M de contexte réellement exploitable
- Token-wise Compression : compression des entrées pendant le traitement
- Inférence duale : choix par requête entre thinking / non-thinking
- DSpark : module de speculative decoding attaché aux poids (F4-Flash-0731 et DSpark), draft + vérification (1/4)
- reasoning_effort : low / high / max (bornes réglables du raisonnement)
V4.1-Flash (10 sept. 2026) — le modèle courant de référence- 552 Md de paramètres totaux, 16 Md actifs (per Wikipédia/AA), 1 M ctx, 384 K sortie
- Multimodal natif : entrée texte et image (saut : V4-Flash était texte seul)
- Nouveaux composants : architecture « causal encoder-decoder » (annonce officielle), mémoire réduite par rapport aux versions précédentes
- « Petit modèle de la nouvelle famille d’architecture » — conçu pour un plafond de capacité plus haut, inférence plus rapide, débit supérieur, passage à l’échelle
- Toujours MIT, poids sur Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash)
Historique architectural : Chain of Thought V3.1/V3.2 (hybride thinking/non-thinking avec DSA), R1-series (reasoning via RL, GRPO), V2 (premier MLA + MoE).
Sources : changelog officiel, page HF V4.1-Flash, Wikipedia, Artificial Analysis (specs techniques).
3. Écosystème de déploiementAPI officielle DeepSeek- Compatible OpenAI (https://api.deepseek.com) et Anthropic (…/anthropic)
- Modèles disponibles : deepseek-flash (= V4.1-Flash actuellement), deepseek-v4-pro (V4-Pro, toujours servi)
- Anciens noms (deepseek-v4-flash, deepseek-v4-flash-vision-exp, deepseek-chat, deepseek-reasoner) retirés — routés temporairement vers V4.1-Flash et facturés au prix Flash
- Fonctions : JSON mode, function calling, context caching (97–98 % de réduction sur tokens en cache), 8 K → 384 K max_tokens, FIM completion, API Responses (native, adaptée à Codex)
Tarification peak / off-peak (off-peak à 50 %)- V4.1-Flash : 0,15 $/M input (cache-miss), 0,003 $/M cache-hit, 0,6 $/M output (off-peak, 2× en peak) — simplifié : AA liste 0,30 $/M in / 1,20 $/M out
- V4-Pro : 1,32 $/M in / 3,96 $/M out, réduction cache 97 %
Intégrations agents- DeepSeek Harness (framework agent open-source, MIT, preview développeur depuis août 2026) — architecture « everything-is-a-plugin » (Cordis)
- Agents supportés : Claude Code, GitHub Copilot, OpenCode, Codex, Hermes, Reasonix, WorkBuddy/CodeBuddy, Qoder, OpenClaw
Hébergement et self-hosting- Hosté nativement par Microsoft Azure et Perplexity
- Recettes de déploiement officielles vLLM (flag --speculative-config dspark, recettes sur recipes.vllm.ai) et SGLang (--speculative-algorithm DSPARK, cookbook sglang) — y compris configurations 4×GB300
- Distribution de poids : mingled BF16/FP8/F32, 43+ quant GGUFs communautaires sur HF dès le 31 juillet 2026
Sources : API Docs (Quick Start, Pricing), changelog, README HF 0731, Wikipedia.
4. Benchmarks officiels (publications DeepSeek)DeepSeek-V4-Flash-0731 (31 juil. 2026, max effort, top_p 0.95, temp 1.0 — cadre : DeepSeek Harness minimal) :
| Benchmark | 0731 | Flash Preview | V4-Pro Preview |
| Terminal-Bench 2.1 | 82,7 | 61,8 | 72,1 |
| NL2Repo | 54,2 | 39,4 | 38,5 |
| CyberGym | 76,7 | 38,7 | 52,7 |
| DeepSWE | 54,4 | 7,3 | 12,8 |
| Toolathlon-Verified | 70,3 | 49,7 | 55,9 |
| Agents’ Last Exam | 25,2 | 15,8 | 16,5 |
| AutomationBench Public | 25,1 | 10,8 | 12,8 |
| DSBench-FullStack † | 68,7 | 37,0 | 41,8 |
| DSBench-Hard † | 59,6 | 25,8 | 31,1 |
† tests internes DeepSeek.DeepSeek-V4-Pro GA (13 août 2026)HLE 42,7 (sans outils) / 60,0 (avec outils) · Terminal-Bench 2.1 87,9 · NL2Repo 61,5 · CyberGym 83,3 · DeepSWE 62,7 · Toolathlon-Verified 74,1 · Agents’ Last Exam 25,7 · AutomationBench 31,8 · DSBench-FullStack 71,1 · DSBench-Hard 67,2.
DeepSeek-V4.1-Flash (10 sept. 2026) — scores publiés au lancement- GPQA Diamond : 90,9 · HLE : 36,8 (39,1 sur sous-texte) · HLE avec outils : 63,9
- Codeforces (rating) : 3471 · MathArena Apex : 65,6
- Terminal-Bench 2.1 : 90,6 · TB 3.0 : 30,0 · TB 4.0 : 31,2
- DeepSWE v1.1 : 74,2 · NL2Repo-Bench : 65,4 · ProgramBench : 20,3
- CyberGym : 88,1 · SEC-Bench Pro : 62,8 · ExploitGym : 15,3
- Automation-Bench : 54,8 · Agents’ Last Exam : 31,8
- Chartography (avec outils) : 78,9 · BabyVision (avec outils) : 89,6 · ZeroBench-main (avec outils) : 49,0
Signification : V4.1-Flash est annoncé comme le plus petit modèle d’une nouvelle famille, avec un plafond de capacité supérieur — il dépasse le V4-Flash 0731 sur presque tous les benchmarks agentiques, et approche la gamme Claude Opus 4.8 sur les benchmarks visuels/agentiques multimodaux.
Sources : changelog officiel DeepSeek, README HF DeepSeek-V4-Flash-0731 (tableau comparatif).
5. Benchmarks selon Artificial Analysis (indépendant)Se réfère aux pages publiques AA (oct. 2026). Index = Artificial Analysis Intelligence Index v4.3.2, composé de 10 évaluations : AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1. Médiane = 18.
DeepSeek V4.1 Flash (max)- Intelligence Index : 39 — rang #7 / 117 (4/4 unités)
- Vitesse : 223,1 tok/s — rang #3 / 117
- Prix : 0,30 $/M in · 1,20 $/M out · réduction cache 98 % · coût/tâche AA 0,27 $
- Contexte 1 M, 552B/16B, entrée texte + image, MIT
- Classement AA adjacent : Claude Opus 5.5 (max) 58, Claude Fable 5.1 53, GPT-6 Astra 53, Gemini 4 Argon 53, GPT-6.1 Sol 52, Muse Spark 1.3 48, Grok 4.7 46, MiMo-V2.6-Pro 46, GLM-5.3 45
DeepSeek V4 Flash 0731 (max) — modèle déprécié chez AA, redirigé vers V4.1
- Intelligence Index : 34 — rang #10 / 117
- Vitesse : 225,7 tok/s (rapide, mais très verbeux : 240 M tokens générés à l’évaluation)
- Prix : 0,44 $/M in · 1,32 $/M out · réduction cache 97 % · coût/tâche 0,22 $
- Contexte 1 M, 284B/13B, texte seul, MIT
DeepSeek V4 Pro 0813 (max)- Intelligence Index : 36 — rang #9 / 117
- Vitesse : 96,2 tok/s (bien moins rapide que Flash, cohérent avec 1,6 T)
- Prix : 1,32 $/M in · 3,96 $/M out · réduction cache 97 % · coût/tâche 0,67 $
- TTFT mesuré : 1,66 s · Contexte 1 M · 1,6 T / 49 B · texte seul · MIT
- Verdict AA : parmi les leaders en intelligence, mais cher pour un modèle open-weights de cette taille
Lecture : AA confirme que V4.1-Flash est à la fois plus intelligent (39) que V4-Flash (34), presque aussi rapide (223 vs 226 tok/s), et moins cher. V4-Pro reste supérieur en intelligence brute sur certains axes (36) mais au prix de la vitesse et du coût — le rapport performance / intelligence / prix de V4.1-Flash est le plus favorable de la gamme.
Sources : pages Artificial Analysis (/models/deepseek-v4-1-flash, /models/deepseek-v4-flash, /models/deepseek-v4-pro), consultées le 8 octobre 2026.
6. Distillations et modèles annexes du producteurDistillations officielles (famille R1)- DeepSeek-R1-Distill-Qwen : 1,5B · 7B · 14B · 32B
- DeepSeek-R1-Distill-Llama : 8B · 70B
- Principe (documenté Turing/data) : initialisés depuis Qwen 2.5 et Llama 3.1, entraînés par distillation des données synthétisées par R1/R1-Zero (motifs de raisonnement de R1 transférés aux plus petits modèles)
- R1-0528 (28 mai 2025) : mise à jour de R1, MIT
Famille V3.x (modèles open-weights, en partie encore actifs)- V3 (déc. 2024, MIT) · V3-0324 (mars 2025) · V3.1 (août 2025, hybride thinking/non-thinking, +40 % sur SWE/Terminal-bench vs V3) · V3.1-Terminus (sept. 2025) · V3.2-Exp (sept. 2025, DSA) · V3.2 (déc. 2025) · V3.2-Speciale (raisonnement renforcé, endpoint temporaire)
Modèles spécialisés / annexes- DeepSeek-OCR et DeepSeek-OCR-2 (OCR, récents, ~2 M+ downloads cumulés)
- DeepSeek-VL2 (vision-langage) · Janus-Pro-7B (multimodal)
- DeepSeek-Prover-V2 (671B et 7B — preuve mathématique / raisonnement formel)
- DeepSeek-Math-V2 (Apache 2.0) et DeepSeek-Math (GRPO/PRM)
- DeepSeek-Coder : familles v1.5 (6.7B/1.3B base+instruct), v2 (16B MoE, Lite), mergé dans V2.5
- DeepSeek-LLM (7B et 67B) · DeepSeek-MoE (16B, variante MoE expérimentale)
- DeepSeek-V4-Flash-Base, DeepSeek-V4-Pro-Base (versions base, non instruites)
- DSpark drafts (blocs de prédiction attachés aux poids tiers) : dspark_gemma4_12b_block7, dspark_qwen3_14b_block7, dspark_qwen3_8b_block7
Remarques factuelles- Les 6 distillations R1 (Qwen/Llama) sont de loin le plus gros canal de distribution grand public — plus de 3,3 millions de downloads cumulés sur HF
- Le pattern DeepSeek est constant : un modèle phare open-weights (MIT), une déclinaison « distill » accessible, et des spécialisés (OCR, Math, Prover) qui alimentent l’écosystème
- V4/V4.1 alignent désormais tout sur un socle unique (Flash/Pro), les produits V3.x étant en fin de vie
Sources : Hugging Face (liste deepseek-ai, 50 modèles classés par downloads), fichiers README officiels, changelog API.
SynthèseDeepSeek est passé en ~3 ans d’un labo de hedge fund à l’un des deux ou trois producteurs de modèles open-weights les plus influents au monde, avec une présence totale sur la chaîne (architecture, infra, serveurs, agents, multimodaux). Ce qui frappe en octobre 2026, c’est que V4.1-Flash combine un niveau d’intelligence top-10 (index AA 39/117, classement officiel #7), une vitesse de tête (223 tok/s) et un prix agressif, tout en rameutant un écosystème de déploiement mature (vLLM, SGLang, agents, cloud). Les limites à garder en tête restent : verbosité (250 M tokens à l’évaluation), et concentrateur de controverses géopolitiques (accusations Anthropic, restrictions US).