DeepSeek ist zugleich KI-Assistent für Endnutzer und Modellplattform für Entwickler. Im August 2026 besteht die aktuelle API-Linie aus deepseek-v4-flash für niedrige Kosten und hohen Durchsatz sowie deepseek-v4-pro für anspruchsvolleres Reasoning und agentische Aufgaben. Beide bieten ein Kontextfenster von einer Million Tokens, Thinking- und Non-Thinking-Modus, Tool Calls, JSON-Ausgabe, OpenAI-kompatible Chat Completions und einen Anthropic-kompatiblen Endpunkt.
Ältere Artikel vermischen häufig V3 von 2024 oder den R1-Reasoner von 2025 mit dem heute bereitgestellten Modell. R1s Reinforcement-Learning-Ansatz bleibt technisch relevant, ist aber kein anderer Name für V4. Die alten API-Aliase deepseek-chat und deepseek-reasoner sollten nach dem 24. Juli 2026 nicht mehr erreichbar sein. Neue Integrationen müssen die expliziten V4-IDs verwenden.
Aktueller V4- und API-Stand
| Entscheidung | V4 Flash | V4 Pro | Praktische Bedeutung |
|---|---|---|---|
| Modell-ID | deepseek-v4-flash | deepseek-v4-pro | Explizite ID statt alter Aliase pinnen |
| Modellgröße | 284B gesamt / 13B aktiv | 1,6T gesamt / 49B aktiv | MoE-Parameterzahl ersetzt keinen Aufgabentest |
| Kontext / maximale Ausgabe | 1M / bis 384K | 1M / bis 384K | Kapazität garantiert keinen zuverlässigen Abruf |
| Modi | Thinking und Non-Thinking; Thinking Standard | Thinking und Non-Thinking; Thinking Standard | Einfache Jobs auch ohne Thinking testen |
| Concurrency beim Review | 2.500 | 500 | Für Volumen zuerst Flash evaluieren |
Die OpenAI-kompatible Basis-URL lautet https://api.deepseek.com, das Anthropic-Format liegt unter https://api.deepseek.com/anthropic. Die Kompatibilität reduziert Migrationsarbeit, macht Reasoning-Felder, Tool-Zustand, Tokenzählung und Verhalten aber nicht identisch mit anderen Anbietern.
Kosten pro akzeptiertem Ergebnis statt Token-Schlagzeile
Am 20. August 2026 nennt die offizielle Preisliste für V4 Flash je Million Tokens 0,0028 US-Dollar Cache-Hit-Input, 0,14 US-Dollar Cache-Miss-Input und 0,28 US-Dollar Output. Für V4 Pro sind es 0,003625, 0,435 und 0,87 US-Dollar. Eine reale Kalkulation umfasst auch Reasoning, Wiederholungen, Tool-Ergebnisse, nicht gecachte Präfixe, Speicherung, Evaluation und menschliche Prüfung. Maßgeblich bleiben die Live-Preisseite und das aktive Konto.
Stabile Systemanweisungen und Referenzblöcke können Cache-Hits ermöglichen. Messen Sie die Quote, statt irrelevanten Kontext nur wegen des Rabatts anzuhängen. Billige Tokens können teure Nacharbeit erzeugen.
| Workload | Start | Wann eskalieren? | Messgröße |
|---|---|---|---|
| Klassifikation, Extraktion, Umschreiben | Flash ohne Thinking | Schema- oder Faktenqualität verfehlt Ziel | Kosten und Latenz pro akzeptiertem Datensatz |
| Wissensassistent | Flash plus Retrieval | Schwierige Evidenzsynthese scheitert | Belege, Abstention, Korrekturzeit |
| Coding-/Tool-Agent | Flash mit Thinking pilotieren | Pro löst Repo-weite Planung nachweislich besser | Tests, Diff, Toolfehler, Rollback |
| Mathematik, komplexe Analyse | Pro mit Thinking | Zweitprüfung bleibt nötig | Aufgabenerfolg statt Antwortlänge |
| Sehr lange Dokumente | Retrieval-Baseline zuerst | Langes Fenster erhöht die Annahmequote | Positionsabruf, Widersprüche, Gesamtkosten |
Thinking und Tool Use brauchen einen Zustandsvertrag
Thinking ist in V4 standardmäßig aktiv. DeepSeek ordnet den Reasoning-Aufwand derzeit high oder max zu; temperature, top_p und ähnliche Sampling-Parameter wirken im Thinking-Modus nicht. Führt eine Thinking-Antwort einen Tool Call aus, muss ihr reasoning_content im Folgeturn zurückgegeben werden. Ohne Tool Call ist die alte Reasoning-Spur nicht nötig.
- Nur minimale Tools und Argumente bereitstellen.
- Identität, Berechtigung, Betrag und Geschäftsregeln serverseitig prüfen.
- Codeausführung, Nachrichten, Käufe, Löschung und Produktionseingriffe bestätigen lassen.
- Schleifen, Tokens, Laufzeit und Budget hart begrenzen.
- Modell-ID, Thinking, Argumente, Freigaben und tatsächliches Ergebnis protokollieren.
- Vor Modell-, Prompt- oder Retrieval-Wechseln einen festen Evaluationssatz wiederholen.
Der Beta-Strict-Modus verbessert JSON-Schema-Konformität. Er weiß jedoch nicht, ob ein Nutzer berechtigt oder eine Aktion geschäftlich korrekt ist. Syntax ist keine Autorisierung.
Eine Million Tokens sind Kapazität, kein Gedächtnisversprechen
V4 senkt mit komprimierter und spärlicher Attention KV-Cache- und Rechenaufwand bei langen Sequenzen. Model Card und die unabhängige Hugging-Face-Analyse sehen darin einen Vorteil für Agenten mit wachsenden Tool-Traces.
Die Annahme von 1M Tokens garantiert weder das Finden einer Klausel in der Mitte noch den Umgang mit widersprüchlichen Versionen oder Prompt Injection. Testen Sie Fakten an Anfang, Mitte und Ende, fordern Sie Belegstellen und vergleichen Sie Vollkontext mit Retrieval plus kürzerem, prüfbarem Kontext.
Web, gehostete API oder Open Weights
| Oberfläche | Guter Fit | Grenze | Zusatzkontrolle |
|---|---|---|---|
| Web/App | Exploration, Entwurf, Einzelanalyse | Verbraucherbedingungen und Kontolimits | Keine Secrets; wichtige Aussagen prüfen |
| Hosted API | Produkte, Automatisierung, Agenten | Anbieterabhängigkeit, Preisänderung, Datenpflichten | Server-Key, Budgets, Evals, Aufbewahrung |
| V4 Self-Hosting | Hoher Kontrollbedarf plus verteilte Infrastruktur | Weder Flash noch Pro sind Laptop-Modelle | Kapazität, Hardening, Monitoring, Patches |
| Destilliertes/älteres Modell | Kleinere Hardware, enge Aufgabe | Andere Fähigkeit, Kontext, Lizenz | Exakten Checkpoint nennen |
Die V4 Model Cards veröffentlichen Gewichte unter MIT. Dennoch umfasst Pro insgesamt 1,6 Billionen und Flash 284 Milliarden MoE-Parameter. Self-Hosting benötigt verteilte Beschleuniger, Serving-Software, Präzisions-/Quantisierungsentscheidungen und Sicherheitsbetrieb. Open Weights gewähren keine Rechte an Eingabedaten und beseitigen keine Betreiberpflichten.
Datenschutz und Governance
DeepSeeks Verbraucher-Datenschutzerklärung nennt Prompts, Dateien, Fotos, Feedback und Chatverlauf als mögliche Daten und beschreibt direkte Verarbeitung und Speicherung personenbezogener Daten in der Volksrepublik China. Die Verarbeitung von Endnutzerdaten in Anwendungen von Open-Platform-Entwicklern fällt laut Erklärung nicht unter diesen Verbraucherhinweis; der Entwickler muss selbst informieren. Chat-Regeln beantworten daher nicht automatisch API-Fragen zu Region und Aufbewahrung.
- Daten vor Versand klassifizieren; keine Schlüssel, Credentials oder unnötigen sensiblen Daten senden.
- Mandantenrechte vor Retrieval und jedem Tool Call prüfen.
- Controller-/Processor-Rollen, Region, Aufbewahrung, Löschung und Logzugriff dokumentieren.
- Vertrauliche oder regulierte Nutzung rechtlich, sicherheitlich und im Einkauf prüfen.
- Flüssige Antworten über autoritative Systeme und Quellen verifizieren.
Vergleich mit benachbarten Optionen
| Option | Warum Shortlist? | Zu testen | Geeignete Evaluation |
|---|---|---|---|
| DeepSeek V4 | Niedrige Listenpreise, Open Weights, 1M Kontext, duales Reasoning | Daten-Governance, State, Self-Host-Größe | Kosten pro akzeptiertem Long-Context-/Agent-Job |
| OpenAI-Plattform | Breite multimodale APIs, Tools und Produkte | Modelle, Funktionen, Preise, Closed-Weight-Abhängigkeit | Identische Tasks und Evidenz-Gates |
| Anthropic Claude | Coding-Agenten und Anthropic-Ökosystem | Formatkompatibilität ist keine Verhaltensgleichheit | Repo-Erfolg, Toolsicherheit, Korrekturzeit |
| Google Gemini | Google-/Cloud-Integration, Multimodalität, langer Kontext | Unterschiede nach Oberfläche, Region, Modell | Dokument-, Medien- und Cloud-Workloads |
| Qwen/andere Self-Host-Familie | Mehr Größen und eventuell besserer Hardware-Fit | Checkpoint-spezifische Qualität und Lizenz | Private Tasks auf Zielhardware |
Unser Urteil: DeepSeeks belastbarer Vorteil ist nicht ein pauschaler Sieg über ein geschlossenes Modell, sondern die Kombination aus günstiger Hosted API, offenen V4-Gewichten und effizientem Langkontext. Beginnen Sie mit Flash und routen Sie nur nachweislich schwierige Fälle zu Pro. Self-Hosting lohnt sich erst, wenn Kontrolle oder dauerhafte Last die Infrastrukturkosten überwiegen.
Häufige Fragen
Ist DeepSeek kostenlos?
Der Chat kann kostenlosen Zugang mit veränderlichen Limits bieten. Die API ist nutzungsbasiert. Self-Hosting verursacht Hardware-, Betriebs-, Strom- und Sicherheitskosten.
Soll ich deepseek-chat oder deepseek-reasoner weiter nutzen?
Nein, nicht für neue Integrationen. DeepSeek plante die Abschaltung nach dem 24. Juli 2026. Verwenden Sie die expliziten V4-IDs und prüfen Sie die Live-Modellliste.
Flash oder Pro?
Starten Sie für Extraktion, Support, reguläres Coding und Volumen mit Flash. Wechseln Sie nur, wenn Pro in einer repräsentativen Evaluation genügend mehr akzeptierte Ergebnisse liefert.
Ersetzt 1M Kontext RAG?
Nein. Retrieval kann Aktualität, Rechte, sichtbare Belege, Latenz und Debugging verbessern. Vergleichen Sie beide Ansätze mit denselben realen Aufgaben.
Kann DeepSeek lokal laufen?
V4-Gewichte sind offen, die vollständigen Modelle benötigen jedoch große verteilte Infrastruktur. Kleinere DeepSeek-Derivate sind nicht gleich der aktuellen V4-API.
Eignet sich DeepSeek für vertrauliche Daten?
Prüfen Sie Vertrag, Kontrollen, Verarbeitungsregion, Aufbewahrung, Löschung und Recht. Minimieren Sie Daten und senden Sie keine Secrets. Self-Hosting beseitigt Governance nicht.
Geprüfte Quellen
- DeepSeek V4 release and API migration notice
- DeepSeek API models and live pricing
- DeepSeek thinking-mode guide
- DeepSeek tool-calling guide
- DeepSeek privacy policy, updated February 10, 2026
- Official DeepSeek V4 model card and weights
- Hugging Face technical analysis of DeepSeek V4 long-context efficiency
- DeepSeek-R1 technical paper on reinforcement-learning-based reasoning
Unabhängig geprüft am 20. August 2026. Preise, Modell-IDs, Limits, Richtlinien und Verfügbarkeit ändern sich; vor Beschaffung oder Produktion sind offizielle Dokumentation und aktives Konto zu prüfen.




