DeepSeek réunit un assistant grand public et une plateforme de modèles pour développeurs. En août 2026, l'API actuelle repose sur DeepSeek V4 : deepseek-v4-flash vise le coût et le débit, tandis que deepseek-v4-pro cible les raisonnements et agents difficiles. Les deux proposent un million de tokens de contexte, modes avec ou sans réflexion, appels d'outils, sortie JSON, Chat Completions compatible OpenAI et endpoint au format Anthropic.
Il faut distinguer ce service de V3 (2024) et de R1 (2025). L'apprentissage par renforcement de R1 reste important, mais R1 n'est pas un autre nom de V4. Les alias deepseek-chat et deepseek-reasoner devaient devenir inaccessibles après le 24 juillet 2026. Toute nouvelle intégration doit employer les identifiants V4 explicites.
État actuel des modèles V4 et de l'API
| Décision | V4 Flash | V4 Pro | Lecture pratique |
|---|---|---|---|
| ID modèle | deepseek-v4-flash | deepseek-v4-pro | Épingler l'ID explicite, pas les anciens alias |
| Taille | 284B total / 13B actifs | 1,6T total / 49B actifs | Les paramètres MoE ne remplacent pas un test métier |
| Contexte / sortie max. | 1M / jusqu'à 384K | 1M / jusqu'à 384K | La capacité ne garantit pas le rappel |
| Modes | Réflexion et sans réflexion ; réflexion par défaut | Réflexion et sans réflexion ; réflexion par défaut | Tester sans réflexion pour les tâches simples |
| Concurrence vérifiée | 2 500 | 500 | Flash est le point de départ pour le volume |
La base compatible OpenAI reste https://api.deepseek.com ; le format Anthropic utilise https://api.deepseek.com/anthropic. Cette compatibilité simplifie la migration sans rendre identiques les champs de raisonnement, l'état des outils, le comptage des tokens ni le comportement.
Mesurer le coût du résultat accepté
Le 20 août 2026, la grille officielle affiche pour V4 Flash, par million de tokens, 0,0028 USD d'entrée avec cache, 0,14 sans cache et 0,28 de sortie. Pour V4 Pro : 0,003625, 0,435 et 0,87 USD. Le budget réel ajoute raisonnement, reprises, résultats d'outils, préfixes non mis en cache, stockage, évaluation et contrôle humain. La page en direct et le compte actif font foi.
Rendez réutilisables les instructions système et références stables, puis mesurez le taux de cache. Ajouter du contexte inutile pour une remise transforme des tokens peu chers en relecture coûteuse.
| Charge | Commencer par | Escalader si | Mesurer |
|---|---|---|---|
| Classer, extraire, réécrire | Flash sans réflexion | Le schéma ou les faits échouent | Coût et latence par résultat accepté |
| Assistant de connaissances | Flash + retrieval | La synthèse difficile échoue | Citations, abstention, correction |
| Agent code/outils | Pilote Flash avec réflexion | Pro améliore la planification complexe | Tests, diff, erreurs, rollback |
| Maths et analyse difficile | Pro avec réflexion | Une seconde revue reste nécessaire | Succès, pas longueur de réponse |
| Très longs documents | Baseline retrieval d'abord | Le grand contexte améliore réellement l'acceptation | Rappel par position, conflits, coût total |
Réflexion et outils imposent un contrat d'état
La réflexion est activée par défaut. DeepSeek mappe actuellement l'effort vers high ou max ; temperature, top_p et paramètres voisins n'ont pas d'effet dans ce mode. Si une réponse réfléchie appelle un outil, son reasoning_content doit être renvoyé au tour suivant. Sans appel d'outil, l'ancienne trace n'est pas nécessaire.
- N'exposer que les outils et arguments indispensables.
- Valider identité, droits, montant et règles côté serveur.
- Faire approuver exécution de code, message, achat, suppression et changement de production.
- Limiter boucles, tokens, durée et budget.
- Tracer modèle, réflexion, arguments, validation et résultat réel.
- Rejouer une évaluation fixe avant tout changement de modèle, prompt ou retrieval.
Le mode strict bêta améliore la conformité JSON Schema, mais ne sait pas si une personne est autorisée ou une opération licite. Une syntaxe correcte n'est pas une permission.
Un million de tokens : capacité, pas mémoire garantie
V4 combine attention compressée et sparse pour réduire calcul et cache KV sur les longues séquences. La model card et l'analyse indépendante de Hugging Face y voient un atout pour les agents accumulant de longues traces d'outils.
Accepter 1M tokens ne garantit pas de retrouver une clause au milieu, résoudre des versions contradictoires, résister à une injection ou garder les contraintes initiales. Placez les faits au début, au centre et à la fin, exigez des passages justificatifs et comparez contexte intégral à retrieval plus court.
Web, API hébergée ou poids ouverts
| Surface | Bon usage | Limite | Contrôle |
|---|---|---|---|
| Web/app | Exploration, brouillon, analyse ponctuelle | Conditions grand public et limites | Pas de secrets ; vérifier les faits |
| API hébergée | Produit, automatisation, agents | Dépendance, prix variables, obligations data | Clé serveur, budget, evals, rétention |
| V4 auto-hébergé | Besoin de contrôle et infrastructure distribuée | Flash et Pro ne sont pas des modèles laptop | Capacité, hardening, suivi, correctifs |
| Modèle distillé/ancien | Matériel plus petit, tâche étroite | Capacité, contexte et licence différents | Nommer le checkpoint exact |
Les model cards V4 publient les poids sous MIT, mais Pro totalise 1,6 billion et Flash 284 milliards de paramètres MoE. L'auto-hébergement exige accélérateurs distribués, logiciel de serving, choix de précision/quantification et sécurité opérationnelle. Les poids ouverts ne donnent aucun droit sur les données et n'effacent pas la responsabilité.
Confidentialité et gouvernance
La politique grand public indique que DeepSeek peut collecter prompts, fichiers, photos, retours et historique, et traiter ou stocker directement des données personnelles en Chine. Elle précise aussi que le traitement des utilisateurs finaux d'applications créées par des développeurs n'est pas couvert par cette notice : le développeur doit informer. La politique du chat ne suffit donc pas à conclure sur la rétention ou la région de l'API.
- Classer les données et exclure clés, identifiants et données sensibles inutiles.
- Contrôler les droits du tenant avant retrieval et chaque outil.
- Documenter rôles, région, rétention, suppression et accès aux logs.
- Soumettre les usages confidentiels ou réglementés à revue juridique, sécurité et achats.
- Vérifier les sorties auprès de systèmes et sources faisant autorité.
Comparaison avec les options voisines
| Option | Pourquoi la retenir | À tester | Bonne évaluation |
|---|---|---|---|
| DeepSeek V4 | Prix publiés bas, poids ouverts, 1M, deux modes | Gouvernance, état, taille self-host | Coût par tâche longue/agent acceptée |
| OpenAI | API multimodales, outils et écosystème | Modèles, fonctions, prix et dépendance fermée | Mêmes tâches et garde-fous de preuve |
| Anthropic Claude | Agents de code et écosystème Anthropic | Format compatible ≠ comportement identique | Succès repo, sécurité outils, correction |
| Google Gemini | Intégration Google/Cloud et multimodal long | Différences de surface, région et modèle | Documents, médias, cloud entreprise |
| Qwen/autre famille locale | Plus de tailles et meilleur ajustement matériel possible | Qualité et licence par checkpoint | Débit matériel et tâches privées |
Notre lecture : l'avantage défendable de DeepSeek n'est pas une supériorité universelle, mais l'association d'une API peu chère, de poids V4 ouverts et d'un long contexte efficace. Commencez par Flash, routez vers Pro uniquement les cas où l'évaluation prouve un gain, et n'auto-hébergez que si contrôle ou volume amortissent l'infrastructure.
Questions fréquentes
DeepSeek est-il gratuit ?
Le chat peut proposer un accès gratuit avec limites variables. L'API est facturée à l'usage. L'auto-hébergement ajoute matériel, ingénierie, sécurité et énergie.
Faut-il encore utiliser deepseek-chat ou deepseek-reasoner ?
Non pour un nouveau projet. Leur arrêt était annoncé après le 24 juillet 2026. Utilisez les IDs V4 explicites et vérifiez la liste active.
Flash ou Pro ?
Commencez par Flash pour extraction, support, code courant et volume. Passez à Pro seulement si une évaluation représentative justifie coût et concurrence plus faible.
Le contexte 1M remplace-t-il RAG ?
Non. Retrieval améliore fraîcheur, droits, preuves, latence et débogage. Comparez les deux sur les mêmes tâches réelles.
Peut-on exécuter DeepSeek localement ?
Les poids V4 sont ouverts, mais les modèles complets exigent une grande infrastructure distribuée. Les versions plus petites ne sont pas équivalentes à l'API V4.
Convient-il aux données confidentielles ?
Examinez contrat, contrôles, région, rétention, suppression et droit applicable. Minimisez les données et n'envoyez pas de secrets. Self-host ne supprime pas la gouvernance.
Sources vérifiées
- DeepSeek V4 release and API migration notice
- DeepSeek API models and live pricing
- DeepSeek thinking-mode guide
- DeepSeek tool-calling guide
- DeepSeek privacy policy, updated February 10, 2026
- Official DeepSeek V4 model card and weights
- Hugging Face technical analysis of DeepSeek V4 long-context efficiency
- DeepSeek-R1 technical paper on reinforcement-learning-based reasoning
Revue indépendante le 20 août 2026. Prix, IDs, limites, politiques et disponibilité évoluent ; vérifiez la documentation officielle et le compte actif avant achat ou production.




