Messages récents

Pages: 1 2 3 4 5 [6] 7 8 9 10
51
Etonnant le "Non disponible avec votre offre Livebox Max Fibre." alors que j'ai bien la dernière offre Livebox Max Fibre !
52
AI Intelligence artificielle / Le fil qui parle des modèles GLM (Zhipu AI).
« Dernier message par Gnubyte le Hier à 17:07:43 »
réservé
53
AI Intelligence artificielle / Le fil qui parle des modèles GLM (Zhipu AI).
« Dernier message par Gnubyte le Hier à 17:07:35 »
réservé
54
AI Intelligence artificielle / Le fil qui parle des modèles GLM (Zhipu AI).
« Dernier message par Gnubyte le Hier à 17:07:26 »
Bienvenus sur le fil qui parle des modèles GLM (Zhipu AI).
Le premier post servira d’index des posts remarquables.
Le second post présentera la famille.
Le troisième post présentera ce que l’on sait des derniers modèles de la série.
55
Chapeau pour l'innovation et le marketing.
Par contre je ne comprends pas la cible... Si tu as Orange Max, tu te prends une Sonos Beam 2 non?
56
AI Intelligence artificielle / Le fil qui parle des modèles Qwen
« Dernier message par Gnubyte le Hier à 17:06:23 »
réservé
57
AI Intelligence artificielle / Le fil qui parle des modèles Qwen
« Dernier message par Gnubyte le Hier à 17:06:09 »
réservé
58
AI Intelligence artificielle / Le fil qui parle des modèles Qwen
« Dernier message par Gnubyte le Hier à 17:06:01 »
Bienvenus sur le fil qui parle des modèles Qwen.
Le premier post servira d’index des posts remarquables.
Le second post présentera la famille développée par Alibaba Cloud.
Le troisième post présentera ce que l’on sait des derniers modèles de la série.
59
AI Intelligence artificielle / Le fil qui parle des modèles DeepSeek
« Dernier message par Gnubyte le Hier à 17:05:02 »
réservé
60
AI Intelligence artificielle / Le fil qui parle des modèles DeepSeek
« Dernier message par Gnubyte le Hier à 17:04:54 »
8 octobre 2026



1. La société : DeepSeek (杭州深度求索)

Identité
  • Nom officiel : Hangzhou DeepSeek Artificial Intelligence Basic Technology Research Co., Ltd. (深度求索, pinyin Shēndù Qiúsuǒ = « recherche en profondeur »)
  • Fondée le 17 juillet 2023 à Hangzhou (Zhejiang, Chine) par Liang Wenfeng
  • Société privée, détenue et financée par High-Flyer, le hedge fund quantitatif co-fondé par Liang en 2015
  • ~160 employés (2025), PDG Liang Wenfeng (qui détenait 84 % via deux holdings en 2024)

Histoire
  • 2021 : Liang commence à acheter massivement des GPU Nvidia (≈ 10 000 A100) avant les restrictions US sur les puces — moins de 5 sociétés chinoises en possédaient plus
  • Avril 2023 : High-Flyer annonce un labo de recherche AGI, détaché de l’activité financière
  • 17 juillet 2023 : le labo est scindé en société indépendante, DeepSeek
  • Janvier 2025 : lancement de DeepSeek-R1 et du chatbot — devient l’app gratuite n°1 de l’App Store US, provoquant une chute de 18 % de l’action Nvidia
  • Depuis janvier 2025 : tous les modèles publiés en open-weights sous licence MIT
  • Mai 2026 : Series A de 7 Mds $, valorisation post-money 52 Mds $
  • Juillet 2026 : préparation d’une IPO dès 2027, discussions à 70 Mds $ de valorisation pré-money
Champs de compétence
  • LLM généralistes et agentiques, code, raisonnement, multimédia (vision, OCR), mathématiques / proof-verification
  • Stack infra propriétaire : clusters Fire-Flyer / Fire-Flyer 2 (5 000 A100 PCIe en 2025), 3FS (filesystem parallèle RDMA), hfreduce, HaiScale DDP, HAI Platform
  • Efficacité algorithmique extrême (contrainte des restrictions US) : modèles fonctionnant sur matériel daté/contraint, faible consommation
  • Culture maison : pas de KPI rigides ni « 996 », recrutement de profils non-CS (poésie, maths), académique
  • Particularité : procédure libre / open-weights — les poids sont partagés, pas la donnée d’entraînement
  • Positionnement : recherche d’abord, pas de plan immédiat de commercialisation (position historique, en train d’évoluer avec la levée)

Controverses / contexte
  • Février 2026 : Anthropic accuse DeepSeek d’avoir utilisé des milliers de comptes « fantômes » pour générer des millions de conversations Claude comme données d’entraînement
  • Liens avec la défense : laboratoires de l’APL, « Seven Sons of National Defence » ; chatbot adopté par l’APL (hôpitaux, gendarmerie) depuis 2025
  • Restrictions US (NDAA FY2026) : retrait de DeepSeek des appareils DOD/IC sauf dérogation ; directive similaire en Australie
  • Adoption : Azure, Perplexity hébergent nativement ses modèles ; Huawei et Cambricon (semi-conducteurs) ont intégré V4

Sources : Wikipedia (DeepSeek), changelog officiel API, presse (NYT, FT, Bloomberg).



2. Architecture des modèles courants

Famille V4 (avril 2026 → aujourd’hui)

V4-FlashV4-Pro
Paramètres totaux284 Md1,6 T (1 600 Md)
Paramètres actifs (MoE)13 Md49 Md
Contexte1 M tokens1 M tokens
Sortie max384 K tokens384 K tokens
Modalitéstextetexte
LicenceMITMIT

  • Mixture-of-Experts (MoE) : seule une fraction des paramètres est activée par token — économies d’énergie et de latence
  • Multi-head Latent Attention (MLA) : compression du KV-cache (héritage V2)
  • DeepSeek Sparse Attention (DSA) : attention qui n’active que les parties pertinentes du contexte — rend le 1 M de contexte réellement exploitable
  • Token-wise Compression : compression des entrées pendant le traitement
  • Inférence duale : choix par requête entre thinking / non-thinking
  • DSpark : module de speculative decoding attaché aux poids (F4-Flash-0731 et DSpark), draft + vérification (1/4)
  • reasoning_effort : low / high / max (bornes réglables du raisonnement)
V4.1-Flash (10 sept. 2026) — le modèle courant de référence
  • 552 Md de paramètres totaux, 16 Md actifs (per Wikipédia/AA), 1 M ctx, 384 K sortie
  • Multimodal natif : entrée texte et image (saut : V4-Flash était texte seul)
  • Nouveaux composants : architecture « causal encoder-decoder » (annonce officielle), mémoire réduite par rapport aux versions précédentes
  • « Petit modèle de la nouvelle famille d’architecture » — conçu pour un plafond de capacité plus haut, inférence plus rapide, débit supérieur, passage à l’échelle
  • Toujours MIT, poids sur Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash)
Historique architectural : Chain of Thought V3.1/V3.2 (hybride thinking/non-thinking avec DSA), R1-series (reasoning via RL, GRPO), V2 (premier MLA + MoE).

Sources : changelog officiel, page HF V4.1-Flash, Wikipedia, Artificial Analysis (specs techniques).



3. Écosystème de déploiement

API officielle DeepSeek
  • Compatible OpenAI (https://api.deepseek.com) et Anthropic (…/anthropic)
  • Modèles disponibles : deepseek-flash (= V4.1-Flash actuellement), deepseek-v4-pro (V4-Pro, toujours servi)
  • Anciens noms (deepseek-v4-flash, deepseek-v4-flash-vision-exp, deepseek-chat, deepseek-reasoner) retirés — routés temporairement vers V4.1-Flash et facturés au prix Flash
  • Fonctions : JSON mode, function calling, context caching (97–98 % de réduction sur tokens en cache), 8 K → 384 K max_tokens, FIM completion, API Responses (native, adaptée à Codex)
Tarification peak / off-peak (off-peak à 50 %)
  • V4.1-Flash : 0,15 $/M input (cache-miss), 0,003 $/M cache-hit, 0,6 $/M output (off-peak, 2× en peak) — simplifié : AA liste 0,30 $/M in / 1,20 $/M out
  • V4-Pro : 1,32 $/M in / 3,96 $/M out, réduction cache 97 %
Intégrations agents
  • DeepSeek Harness (framework agent open-source, MIT, preview développeur depuis août 2026) — architecture « everything-is-a-plugin » (Cordis)
  • Agents supportés : Claude Code, GitHub Copilot, OpenCode, Codex, Hermes, Reasonix, WorkBuddy/CodeBuddy, Qoder, OpenClaw

Hébergement et self-hosting
  • Hosté nativement par Microsoft Azure et Perplexity
  • Recettes de déploiement officielles vLLM (flag --speculative-config dspark, recettes sur recipes.vllm.ai) et SGLang (--speculative-algorithm DSPARK, cookbook sglang) — y compris configurations 4×GB300
  • Distribution de poids : mingled BF16/FP8/F32, 43+ quant GGUFs communautaires sur HF dès le 31 juillet 2026

Sources : API Docs (Quick Start, Pricing), changelog, README HF 0731, Wikipedia.



4. Benchmarks officiels (publications DeepSeek)

DeepSeek-V4-Flash-0731 (31 juil. 2026, max effort, top_p 0.95, temp 1.0 — cadre : DeepSeek Harness minimal) :

Benchmark0731Flash PreviewV4-Pro Preview
Terminal-Bench 2.182,761,872,1
NL2Repo54,239,438,5
CyberGym76,738,752,7
DeepSWE54,47,312,8
Toolathlon-Verified70,349,755,9
Agents’ Last Exam25,215,816,5
AutomationBench Public25,110,812,8
DSBench-FullStack †68,737,041,8
DSBench-Hard †59,625,831,1
† tests internes DeepSeek.

DeepSeek-V4-Pro GA (13 août 2026)
HLE 42,7 (sans outils) / 60,0 (avec outils) · Terminal-Bench 2.1 87,9 · NL2Repo 61,5 · CyberGym 83,3 · DeepSWE 62,7 · Toolathlon-Verified 74,1 · Agents’ Last Exam 25,7 · AutomationBench 31,8 · DSBench-FullStack 71,1 · DSBench-Hard 67,2.

DeepSeek-V4.1-Flash (10 sept. 2026) — scores publiés au lancement
  • GPQA Diamond : 90,9 · HLE : 36,8 (39,1 sur sous-texte) · HLE avec outils : 63,9
  • Codeforces (rating) : 3471 · MathArena Apex : 65,6
  • Terminal-Bench 2.1 : 90,6 · TB 3.0 : 30,0 · TB 4.0 : 31,2
  • DeepSWE v1.1 : 74,2 · NL2Repo-Bench : 65,4 · ProgramBench : 20,3
  • CyberGym : 88,1 · SEC-Bench Pro : 62,8 · ExploitGym : 15,3
  • Automation-Bench : 54,8 · Agents’ Last Exam : 31,8
  • Chartography (avec outils) : 78,9 · BabyVision (avec outils) : 89,6 · ZeroBench-main (avec outils) : 49,0

Signification : V4.1-Flash est annoncé comme le plus petit modèle d’une nouvelle famille, avec un plafond de capacité supérieur — il dépasse le V4-Flash 0731 sur presque tous les benchmarks agentiques, et approche la gamme Claude Opus 4.8 sur les benchmarks visuels/agentiques multimodaux.

Sources : changelog officiel DeepSeek, README HF DeepSeek-V4-Flash-0731 (tableau comparatif).



5. Benchmarks selon Artificial Analysis (indépendant)

Se réfère aux pages publiques AA (oct. 2026). Index = Artificial Analysis Intelligence Index v4.3.2, composé de 10 évaluations : AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1. Médiane = 18.

DeepSeek V4.1 Flash (max)
  • Intelligence Index : 39 — rang #7 / 117 (4/4 unités)
  • Vitesse : 223,1 tok/s — rang #3 / 117
  • Prix : 0,30 $/M in · 1,20 $/M out · réduction cache 98 % · coût/tâche AA 0,27 $
  • Contexte 1 M, 552B/16B, entrée texte + image, MIT
  • Classement AA adjacent : Claude Opus 5.5 (max) 58, Claude Fable 5.1 53, GPT-6 Astra 53, Gemini 4 Argon 53, GPT-6.1 Sol 52, Muse Spark 1.3 48, Grok 4.7 46, MiMo-V2.6-Pro 46, GLM-5.3 45

DeepSeek V4 Flash 0731 (max) — modèle déprécié chez AA, redirigé vers V4.1
  • Intelligence Index : 34 — rang #10 / 117
  • Vitesse : 225,7 tok/s (rapide, mais très verbeux : 240 M tokens générés à l’évaluation)
  • Prix : 0,44 $/M in · 1,32 $/M out · réduction cache 97 % · coût/tâche 0,22 $
  • Contexte 1 M, 284B/13B, texte seul, MIT

DeepSeek V4 Pro 0813 (max)
  • Intelligence Index : 36 — rang #9 / 117
  • Vitesse : 96,2 tok/s (bien moins rapide que Flash, cohérent avec 1,6 T)
  • Prix : 1,32 $/M in · 3,96 $/M out · réduction cache 97 % · coût/tâche 0,67 $
  • TTFT mesuré : 1,66 s · Contexte 1 M · 1,6 T / 49 B · texte seul · MIT
  • Verdict AA : parmi les leaders en intelligence, mais cher pour un modèle open-weights de cette taille

Lecture : AA confirme que V4.1-Flash est à la fois plus intelligent (39) que V4-Flash (34), presque aussi rapide (223 vs 226 tok/s), et moins cher. V4-Pro reste supérieur en intelligence brute sur certains axes (36) mais au prix de la vitesse et du coût — le rapport performance / intelligence / prix de V4.1-Flash est le plus favorable de la gamme.

Sources : pages Artificial Analysis (/models/deepseek-v4-1-flash, /models/deepseek-v4-flash, /models/deepseek-v4-pro), consultées le 8 octobre 2026.



6. Distillations et modèles annexes du producteur

Distillations officielles (famille R1)
  • DeepSeek-R1-Distill-Qwen : 1,5B · 7B · 14B · 32B
  • DeepSeek-R1-Distill-Llama : 8B · 70B
  • Principe (documenté Turing/data) : initialisés depuis Qwen 2.5 et Llama 3.1, entraînés par distillation des données synthétisées par R1/R1-Zero (motifs de raisonnement de R1 transférés aux plus petits modèles)
  • R1-0528 (28 mai 2025) : mise à jour de R1, MIT

Famille V3.x (modèles open-weights, en partie encore actifs)
  • V3 (déc. 2024, MIT) · V3-0324 (mars 2025) · V3.1 (août 2025, hybride thinking/non-thinking, +40 % sur SWE/Terminal-bench vs V3) · V3.1-Terminus (sept. 2025) · V3.2-Exp (sept. 2025, DSA) · V3.2 (déc. 2025) · V3.2-Speciale (raisonnement renforcé, endpoint temporaire)

Modèles spécialisés / annexes
  • DeepSeek-OCR et DeepSeek-OCR-2 (OCR, récents, ~2 M+ downloads cumulés)
  • DeepSeek-VL2 (vision-langage) · Janus-Pro-7B (multimodal)
  • DeepSeek-Prover-V2 (671B et 7B — preuve mathématique / raisonnement formel)
  • DeepSeek-Math-V2 (Apache 2.0) et DeepSeek-Math (GRPO/PRM)
  • DeepSeek-Coder : familles v1.5 (6.7B/1.3B base+instruct), v2 (16B MoE, Lite), mergé dans V2.5
  • DeepSeek-LLM (7B et 67B) · DeepSeek-MoE (16B, variante MoE expérimentale)
  • DeepSeek-V4-Flash-Base, DeepSeek-V4-Pro-Base (versions base, non instruites)
  • DSpark drafts (blocs de prédiction attachés aux poids tiers) : dspark_gemma4_12b_block7, dspark_qwen3_14b_block7, dspark_qwen3_8b_block7
Remarques factuelles
  • Les 6 distillations R1 (Qwen/Llama) sont de loin le plus gros canal de distribution grand public — plus de 3,3 millions de downloads cumulés sur HF
  • Le pattern DeepSeek est constant : un modèle phare open-weights (MIT), une déclinaison « distill » accessible, et des spécialisés (OCR, Math, Prover) qui alimentent l’écosystème
  • V4/V4.1 alignent désormais tout sur un socle unique (Flash/Pro), les produits V3.x étant en fin de vie

Sources : Hugging Face (liste deepseek-ai, 50 modèles classés par downloads), fichiers README officiels, changelog API.



Synthèse
DeepSeek est passé en ~3 ans d’un labo de hedge fund à l’un des deux ou trois producteurs de modèles open-weights les plus influents au monde, avec une présence totale sur la chaîne (architecture, infra, serveurs, agents, multimodaux). Ce qui frappe en octobre 2026, c’est que V4.1-Flash combine un niveau d’intelligence top-10 (index AA 39/117, classement officiel #7), une vitesse de tête (223 tok/s) et un prix agressif, tout en rameutant un écosystème de déploiement mature (vLLM, SGLang, agents, cloud). Les limites à garder en tête restent : verbosité (250 M tokens à l’évaluation), et concentrateur de controverses géopolitiques (accusations Anthropic, restrictions US).
Pages: 1 2 3 4 5 [6] 7 8 9 10