La Fibre

Télécom => Logiciels et systèmes d'exploitation => AI Intelligence artificielle => Discussion démarrée par: Gnubyte le 09 octobre 2026 à 22:34:50

Titre: DeepSeek, la recherche d'avant garde, édifiante, libre, pour tous.
Posté par: Gnubyte le 09 octobre 2026 à 22:34:50
Note en passant. DeepSeek, c'est la force tranquille, ostensiblement tournée vers le libre. Issue de l'effort animé par un homme, Liang Wenfeng, qui fait fortune dans la gestion de fortune dopée à l'IA, en s'équipant d'un cluster de GPU dès 2019, et le mettant à jour peu à peu, avec le financement d'un fond d'investissement. DeepSeek est la propriété du créateur, à plus de 80% avant la dernière levée de fond, et se distingue par:
- Une innovation juste avant-gardiste dans l'organisation de l'attention
- Une optimisation pétrifiante de la gestion du KV Cache. Avec leur approche, adopter un cache KV de 1M de token n'est pas sanctionné par une attente interminable pour le remplir.
- Ils publient toutes leurs innovations, dans des revues à comités de lecture.
- Ils ne font pas la course aux petits modèles, ils optimisent les couts d'infrastructure, et donc de vente, sur le top tier, avec un ticket d'entrée à 256Go de VRAM (pour DeepSeek v4 Flash 0731, 284B ), voire 512Go (pour DeepSeek v4.1 Flash, 552B plus 196B en n-gram sur disque) -
- à périmètre de matériel égal, leurs modèles tournent plus vite, vraiment, J'ai des benchs perso, et leurs modèles sont plus gros d'un facteur x2 par rapport à ce qui tourne en moyenne sur un périmètre matériel donné. Ils donnent une vraie leçon d'humilité à tout le monde, mais en donnant leurs solutions d'optimisation à tous.
- la V4 Flash-Next 0731 anime mon agent Hermès perso, et j'attends bientôt après la v4.1 - C'est déjà pétrifiant en v4 Flash-Next
- personnellement, j'ai sorti le pop-corn


DeepSeek : état des lieux de la série de modèles (octobre 2026)

1. La société


2. Architecture des modèles courants

Lignée : DeepSeek-LLM (2023, dense) → DeepSeek-MoE → V2 (2024 : MLA + DeepSeekMoE, 236B/21B) → V3 (déc. 2024 : 671B/37B, FP8, MTP) → R1 (janv. 2025 : RL « GRPO » sur V3-Base) → V3.1 (hybride think/no-think) → V3.2 (déc. 2025 : ajout de la DeepSeek Sparse Attention, « lightning indexer » + sélection top-k, par entraînement continué) → V4 (2026).

V4 (preview 24/04/2026, Flash GA 31/07, Pro GA 13/08)

V4.1-Flash (10/09/2026) – plus petit modèle de la nouvelle famille, mais nouvelle architecture :

3. Écosystème de déploiement


4. Benchmarks officiels et place chez Artificial Analysis

Chiffres auto-déclarés V4-Pro-0813 (non reproduits indépendamment) : SWE-bench Verified 80,6 (CAISI, labo US, mesure 74,0 avec un autre scaffolding) ; SWE-bench Pro 55,4 ; LiveCodeBench 93,5 ; Codeforces 3206 ; GPQA Diamond 92,8 ; HLE 42,7 sans outils / 60,0 avec ; Terminal-Bench 2.1 87,9 ; BrowseComp 83,4 ; MRCR 83,5. Point faible reconnu : HLE, derrière Kimi K2.6 et GLM 5.1 ; SWE-bench Pro légèrement en retrait.
V4.1-Flash (auto-déclaré) : GPQA 90,9 ; HLE texte 39,1 ; Terminal-Bench 2.1 90,6 ; CyberGym 88,1 ; AutomationBench 54,8.

Artificial Analysis (mesures indépendantes) :

5. Distillations et modèles annexes

Distillations officielles

Modèles annexes du même labo

Sources