Auteur Sujet: DeepSeek, la recherche d'avant garde, édifiante, libre, pour tous.  (Lu 38 fois)

0 Membres et 2 Invités sur ce sujet

Gnubyte

  • Abonné Orange Fibre
  • *
  • Messages: 1 175
  • Toulon (83)
    • HSGMII intégriste repenti, Néo XGS-PON prosélyte
Note en passant. DeepSeek, c'est la force tranquille, ostensiblement tournée vers le libre. Issue de l'effort animé par un homme, Liang Wenfeng, qui fait fortune dans la gestion de fortune dopée à l'IA, en s'équipant d'un cluster de GPU dès 2019, et le mettant à jour peu à peu, avec le financement d'un fond d'investissement. DeepSeek est la propriété du créateur, à plus de 80% avant la dernière levée de fond, et se distingue par:
- Une innovation juste avant-gardiste dans l'organisation de l'attention
- Une optimisation pétrifiante de la gestion du KV Cache. Avec leur approche, adopter un cache KV de 1M de token n'est pas sanctionné par une attente interminable pour le remplir.
- Ils publient toutes leurs innovations, dans des revues à comités de lecture.
- Ils ne font pas la course aux petits modèles, ils optimisent les couts d'infrastructure, et donc de vente, sur le top tier, avec un ticket d'entrée à 256Go de VRAM (pour DeepSeek v4 Flash 0731, 284B ), voire 512Go (pour DeepSeek v4.1 Flash, 552B plus 196B en n-gram sur disque) -
- à périmètre de matériel égal, leurs modèles tournent plus vite, vraiment, J'ai des benchs perso, et leurs modèles sont plus gros d'un facteur x2 par rapport à ce qui tourne en moyenne sur un périmètre matériel donné. Ils donnent une vraie leçon d'humilité à tout le monde, mais en donnant leurs solutions d'optimisation à tous.
- la V4 Flash-Next 0731 anime mon agent Hermès perso, et j'attends bientôt après la v4.1 - C'est déjà pétrifiant en v4 Flash-Next
- personnellement, j'ai sorti le pop-corn


DeepSeek : état des lieux de la série de modèles (octobre 2026)

1. La société

  • Qui : DeepSeek (Hangzhou, Zhejiang), fondée en juillet 2023 par Liang Wenfeng comme émanation de High-Flyer (幻方量化), fonds quantitatif qu'il a cofondé en 2015-2016 et qui a dépassé 100 milliards de yuans d'encours en 2021. High-Flyer a financé le labo seul jusqu'en 2026 ; Liang en contrôlait ~89,5 % avant la levée.
  • Capital : première levée externe bouclée en juin 2026, ~50 Mds yuans (≈7,4 Mds $) pour une valorisation > 50 Mds $. Liang y met lui-même ~20 Mds yuans ; Tencent, CATL, JD.com, NetEase et le fonds national chinois pour l'IA y participent. Montage inhabituel : les investisseurs passent par une société en commandite gérée par Liang, sans droit de vote et avec lock-up de 5 ans (seul le fonds d'État a des parts directes avec vote). Un second tour (~71 Mds $ pré-money) et une préparation d'IPO (dépôt 2026, cotation possible 2027) sont évoqués.
  • Périmètre : ~170 personnes (objectif annoncé : doubler), recrutement quasi exclusivement en Chine. Activités : recherche LLM, modèles open-weights (licence MIT pour les séries V/R), API payante, appli/chat grand public, publication régulière de papiers et d'outils d'infra (FlashMLA, DeepEP, DeepGEMM, 3FS). Pas de priorité à la commercialisation à court terme, dixit la direction aux investisseurs.
  • Puissance GPU connue : Fire-Flyer 1 (2019, ~1 100 GPU, 200 M yuans) ; Fire-Flyer 2 (2021, ~10 000 A100, 1 Md yuans). V3 a été pré-entraîné sur 2 048 H800 (le fameux « 5,6 M$ », qui ne couvre que le run GPU). SemiAnalysis estime le parc à ~50 000 GPU Hopper (≈10 000 H800 + 10 000 H100 + H20), pour ~1,6 Md$ de CapEx serveurs – estimation externe, jamais confirmée par DeepSeek. Depuis V4, une partie de l'entraînement et du service API tourne sur Huawei Ascend 950 (co-conception modèle/puce, FP4 natif).

2. Architecture des modèles courants

Lignée : DeepSeek-LLM (2023, dense) → DeepSeek-MoE → V2 (2024 : MLA + DeepSeekMoE, 236B/21B) → V3 (déc. 2024 : 671B/37B, FP8, MTP) → R1 (janv. 2025 : RL « GRPO » sur V3-Base) → V3.1 (hybride think/no-think) → V3.2 (déc. 2025 : ajout de la DeepSeek Sparse Attention, « lightning indexer » + sélection top-k, par entraînement continué) → V4 (2026).

V4 (preview 24/04/2026, Flash GA 31/07, Pro GA 13/08)
  • V4-Pro : MoE 1,6 T paramètres, 49 B actifs/token, 61 couches, d=7168. V4-Flash : 284 B / 13 B actifs, 43 couches, d=4096, 32 T tokens de pré-entraînement.
  • Attention hybride : CSA (Compressed Sparse Attention : compression ×4 + indexer sélectionnant 512 (Flash) / 1024 (Pro) entrées KV) alternée avec HCA (Heavily Compressed Attention, compression ×128) ; sliding window (128) sur les 2 premières couches. Résultat annoncé : 1 M de contexte pour 27 % des FLOPs et 10 % du KV cache de V3.2.
  • mHC (hyper-connexions contraintes) à la place des résidus classiques pour stabiliser l'entraînement d'un MoE de cette taille ; experts en FP4, reste en FP8 ; MTP ; sortie jusqu'à 384 K tokens ; 3 niveaux d'effort de raisonnement (low/high/max) dans un seul modèle (fusion des lignées V et R).

V4.1-Flash (10/09/2026) – plus petit modèle de la nouvelle famille, mais nouvelle architecture :
  • ~748 B paramètres au total = backbone MoE 552 B + Engram 196 B (mémoire conditionnelle). Seulement ~8 B actifs en prefill / ~16 B en décodage.
  • 40 couches scindées en encodeur causal + décodeur (20/20), CSA2, Single-Pass mHC, DSpark, Hierarchical Sparse Indexer. KV cache ≈ 890 octets/token (¼ de V4-Flash).
  • Vision native (encodeur DeepSeek-ViT), 1 M de contexte, 384 K de sortie, 45 T tokens multimodaux. DeepSeek affirme qu'il dépasse V4-Pro sur la plupart de ses propres tests ; V4.1-Pro est annoncé mais pas encore sorti.

3. Écosystème de déploiement

  • Poids : Hugging Face / ModelScope, licence MIT (V4-Pro-0813, V4-Flash-0731, V4.1-Flash). Ordres de grandeur mémoire : V4-Pro ≈ 780 Go en 4 bits (≈3,1 To en FP16) ; V4.1-Flash ≈ 314 Go en 4 bits.
  • API officielle : compatible OpenAI (y compris Responses API) et format Anthropic, cache de contexte, tarif heures creuses à -50 %. Modèle courant : deepseek-flash (V4.1) à 0,30 $/M in – 1,20 $/M out en heures pleines (0,003 $/M en cache hit). Depuis le 14/09, deepseek-v4-pro est redirigé vers V4.1-Flash en attendant V4.1-Pro.
  • Moteurs d'inférence : vLLM et SGLang supportaient V4 nativement sur CUDA dès le jour 0 (MTP à J+3 côté SGLang) ; NVIDIA fournit une quantization NVFP4 (8×B200 sous SGLang ; la fiche officielle vise 4×GB300 sous vLLM) et une recette Dynamo/GB200 ; AMD ROCm : support partiel, l'inférence distribuée de V4-Pro restait en chantier.
  • Puces chinoises : Huawei Ascend 950PR/950DT via CANN dès le jour 0 (docs SGLang-Ascend pour V4-Flash, PD-disaggregation multi-nœuds) ; Cambricon, Hygon, Moore Threads via vLLM/FlagOS.
  • Tiers : SiliconFlow, DeepInfra, Novita, OpenRouter, etc. (≈13 fournisseurs suivis pour V4.1-Flash, de 0,14 à 0,30 $/M in). Les distillations R1 tournent en GGUF/llama.cpp/Ollama sur du matériel modeste.

4. Benchmarks officiels et place chez Artificial Analysis

Chiffres auto-déclarés V4-Pro-0813 (non reproduits indépendamment) : SWE-bench Verified 80,6 (CAISI, labo US, mesure 74,0 avec un autre scaffolding) ; SWE-bench Pro 55,4 ; LiveCodeBench 93,5 ; Codeforces 3206 ; GPQA Diamond 92,8 ; HLE 42,7 sans outils / 60,0 avec ; Terminal-Bench 2.1 87,9 ; BrowseComp 83,4 ; MRCR 83,5. Point faible reconnu : HLE, derrière Kimi K2.6 et GLM 5.1 ; SWE-bench Pro légèrement en retrait.
V4.1-Flash (auto-déclaré) : GPQA 90,9 ; HLE texte 39,1 ; Terminal-Bench 2.1 90,6 ; CyberGym 88,1 ; AutomationBench 54,8.

Artificial Analysis (mesures indépendantes) :
  • Historique : R1 original = 60, R1-0528 = 68 (ancien index v2, non comparable aux chiffres ci-dessous).
  • Index v4.1.x : V4-Pro preview = 52 ; V4-Pro-0813 = 53 (+8 vs preview, mais tarif ×3,6 et seulement +1 vs V4-Flash-0731 avec 3,8× plus de paramètres actifs). Classement : #2 open-weights derrière Kimi K3 (7 pts d'écart), à égalité avec GLM-5.2, 4 pts derrière GPT-5.6 Terra. V3.2 ≈ 25, V3 = 14.
  • V4.1-Flash (max effort) = 40 sur l'index v4.3 (nouvelle composition d'évaluations, donc à ne pas comparer tel quel aux 53 de V4-Pro).
  • Le positionnement DeepSeek reste la frontière de Pareto prix/intelligence plutôt que le sommet absolu : AA classe V4-Pro #2 en intelligence mais seulement #43 en prix catalogue, #8 en prix cache-hit. Le gouvernement US (CAISI) estime le retard sur la frontière américaine à ~8 mois.

5. Distillations et modèles annexes

Distillations officielles
  • DeepSeek-R1-Distill (janv. 2025) : 6 modèles denses fine-tunés sur 800 k exemples générés par R1 – Qwen2.5 1,5B / 7B / 14B / 32B (Apache 2.0) et Llama 3.1-8B / Llama 3.3-70B (licence Llama). Le 32B dépassait o1-mini à l'époque ; le 70B fait 94,5 % sur MATH-500.
  • DeepSeek-R1-0528-Qwen3-8B (mai 2025) : distillation de R1-0528 sur Qwen3-8B, 52 sur l'ancien index AA (≈ Qwen3-8B reasoning).
  • Pas de distillation officielle de V4/V4.1 à ce jour ; FlashMemory-DeepSeek-V4 (juin 2026) est un dérivé de recherche de V4-Flash avec « Lookahead Sparse Attention » (−90 % de KV cache), projet suspendu.

Modèles annexes du même labo
  • Code : DeepSeek-Coder (2023), DeepSeek-Coder-V2 / V2-Lite (2024, 236B/16B).
  • Maths : DeepSeekMath 7B (2024, berceau de GRPO), DeepSeek-Math-V2 (nov. 2025, Apache 2.0, niveau médaille d'or IMO), DeepSeek-Prover V1 / V1.5 / V2 (avril 2025, 7B et 671B, Lean 4, 88,9 % MiniF2F).
  • Vision / multimodal : DeepSeek-VL, VL2 ; Janus, JanusFlow, Janus-Pro (janv. 2025, compréhension + génération d'images) ; DeepSeek-OCR (oct. 2025, compression visuelle du texte) et OCR-2 (janv. 2026, Apache 2.0) ; V4-Flash-Vision-Exp (août 2026, retiré au profit de V4.1-Flash).
  • Variantes de raisonnement : R1-Zero (RL pur, sans SFT), V3.2-Speciale (déc. 2025, or IMO/IOI 2025, endpoint temporaire fermé le 15/12), DeepSeek-GRM (avril 2025, reward modeling génératif).
  • Historiques : DeepSeek-LLM 7B/67B, DeepSeek-MoE 16B, V2 / V2-Lite / V2.5, ESFT.

Sources