DeepSeek combina un asistente para usuarios con una plataforma de modelos para desarrolladores. En agosto de 2026 la línea actual de API es DeepSeek V4: deepseek-v4-flash prioriza coste y caudal, mientras deepseek-v4-pro se orienta a razonamiento difícil y agentes. Ambos ofrecen un millón de tokens de contexto, modos con y sin pensamiento, llamadas a herramientas, salida JSON, Chat Completions compatible con OpenAI y un endpoint en formato Anthropic.
No conviene confundir V3 (2024) o el razonador R1 (2025) con el servicio actual. El enfoque de aprendizaje por refuerzo de R1 sigue siendo relevante, pero no es otro nombre para V4. Los alias deepseek-chat y deepseek-reasoner debían dejar de estar disponibles después del 24 de julio de 2026. Las integraciones nuevas deben usar IDs V4 explícitos.
Estado actual de V4 y la API
| Decisión | V4 Flash | V4 Pro | Lectura práctica |
|---|---|---|---|
| ID de modelo | deepseek-v4-flash | deepseek-v4-pro | Fijar el ID explícito; no depender de alias retirados |
| Tamaño | 284B totales / 13B activos | 1,6T totales / 49B activos | Los parámetros MoE no sustituyen una prueba de tarea |
| Contexto / salida máxima | 1M / hasta 384K | 1M / hasta 384K | La capacidad no garantiza recuperar cada dato |
| Modos | Pensamiento y sin pensamiento; pensamiento por defecto | Pensamiento y sin pensamiento; pensamiento por defecto | Probar sin pensamiento para trabajos simples |
| Concurrencia al revisar | 2.500 | 500 | Flash es el inicio natural para volumen |
La URL base compatible con OpenAI es https://api.deepseek.com y el formato Anthropic usa https://api.deepseek.com/anthropic. La compatibilidad reduce el trabajo de migración, pero no iguala campos de razonamiento, estado de herramientas, contabilidad de tokens o conducta con otros proveedores.
Coste por resultado aceptado, no solo por token
La tabla oficial consultada el 20 de agosto de 2026 lista V4 Flash a 0,0028 USD por millón de tokens de entrada con caché, 0,14 sin caché y 0,28 de salida. Para V4 Pro son 0,003625, 0,435 y 0,87 USD. El presupuesto real añade trazas de razonamiento, reintentos, resultados de herramientas, prefijos sin caché, almacenamiento, evaluación y revisión humana. La página en vivo y la cuenta activa mandan al comprar.
Diseña instrucciones de sistema y bloques de referencia estables para reutilizarlos y mide la tasa real de caché. Añadir contexto irrelevante para obtener descuento convierte tokens baratos en revisión cara.
| Carga | Empezar con | Cuándo escalar | Métrica |
|---|---|---|---|
| Clasificar, extraer, reescribir | Flash sin pensamiento | Falla el umbral de estructura o hechos | Coste y latencia por registro aceptado |
| Asistente de conocimiento | Flash + recuperación | No sintetiza evidencias difíciles | Citas, abstención y tiempo de corrección |
| Agente de código/herramientas | Piloto Flash con pensamiento | Pro mejora planificación o depuración compleja | Tests, diff, errores y rollback |
| Matemática o análisis complejo | Pro con pensamiento | Sigue haciendo falta segunda revisión | Éxito de tarea, no longitud |
| Documentos muy largos | Primero una base con retrieval | La ventana larga mejora la aceptación | Recuerdo por posición, conflictos y coste total |
El pensamiento y las herramientas exigen estado correcto
V4 activa el pensamiento por defecto. DeepSeek asigna actualmente el esfuerzo a high o max; temperature, top_p y controles similares no tienen efecto en ese modo. Si una respuesta pensante llama a una herramienta, su reasoning_content debe volver en el contexto posterior. En un turno sin herramienta no hace falta conservar el razonamiento anterior.
- Exponer solo las herramientas y argumentos mínimos.
- Validar identidad, autorización, importes y reglas en el servidor.
- Exigir aprobación para ejecutar código, enviar, comprar, borrar o cambiar producción.
- Limitar bucles, tokens, tiempo y gasto.
- Registrar modelo, pensamiento, argumentos, aprobación y resultado real.
- Repetir un conjunto fijo antes de cambiar modelo, prompt o recuperación.
El modo strict beta ayuda a cumplir JSON Schema, pero no sabe si una cuenta está autorizada o una acción cumple la política. Sintaxis válida no equivale a permiso.
Un millón de tokens es capacidad, no memoria garantizada
V4 usa atención comprimida y dispersa para reducir cálculo y caché KV en secuencias largas. La ficha oficial y el análisis técnico independiente de Hugging Face señalan su utilidad para agentes cuyos rastros de herramientas crecen durante mucho tiempo.
Aceptar 1M tokens no prueba que el modelo encuentre una cláusula enterrada, resuelva versiones contradictorias, resista inyección de prompts o mantenga restricciones antiguas. Coloca hechos al principio, centro y final, incluye contradicciones, exige fragmentos de evidencia y compara contexto completo con retrieval más corto.
Chat web, API alojada o pesos abiertos
| Superficie | Buen encaje | Límite | Control |
|---|---|---|---|
| Web/app | Explorar, redactar, análisis puntual | Términos de consumo y límites | No incluir secretos; verificar hechos |
| API alojada | Productos, automatización, agentes | Dependencia, precio dinámico, obligaciones de datos | Clave en servidor, presupuesto, evals, retención |
| V4 propio | Necesidad de control y capacidad distribuida | Flash y Pro no son modelos de portátil | Capacidad, hardening, monitorización, parches |
| Modelo destilado/antiguo | Hardware menor o tarea estrecha | Capacidad, contexto y licencia diferentes | Nombrar el checkpoint exacto |
Las fichas V4 publican pesos con licencia MIT, pero Pro suma 1,6 billones de parámetros y Flash 284.000 millones. El alojamiento serio requiere aceleradores distribuidos, software de serving, decisiones de precisión/cuantización y seguridad operativa. Pesos abiertos no conceden derechos sobre los datos ni eliminan la responsabilidad del operador.
Privacidad y gobierno
La política de consumo de DeepSeek indica que puede recoger prompts, archivos, fotos, feedback e historial, y que los datos personales pueden procesarse y almacenarse directamente en China. También dice que el tratamiento de usuarios finales en apps creadas por desarrolladores no queda cubierto por ese aviso: el desarrollador debe informar. Por ello, la política del chat no resuelve por sí sola retención o región de la API.
- Clasificar datos y excluir claves, credenciales e información sensible innecesaria.
- Comprobar permisos de tenant antes de recuperar y llamar herramientas.
- Documentar roles, región, retención, borrado y acceso a logs.
- Pasar revisión legal, de seguridad y compras para cargas reguladas o confidenciales.
- Contrastar los resultados con sistemas y fuentes autorizados.
Comparación con alternativas
| Opción | Por qué considerarla | Qué probar | Evaluación útil |
|---|---|---|---|
| DeepSeek V4 | Precios bajos publicados, pesos abiertos, 1M y dos modos | Gobierno de datos, estado, escala propia | Coste por tarea larga/agente aceptada |
| OpenAI | APIs multimodales, herramientas y ecosistema | Diferencias de modelo, función, precio y dependencia cerrada | Mismas tareas y puertas de evidencia |
| Anthropic Claude | Agentes de código y ecosistema Anthropic | Formato compatible no significa conducta idéntica | Éxito en repositorio, seguridad y corrección |
| Google Gemini | Integración Google/Cloud y opciones multimodales largas | Superficie, región y modelo varían | Documentos, medios y nube empresarial |
| Qwen u otra familia local | Más tamaños y posible mejor encaje de hardware | Calidad y licencia por checkpoint | Calidad privada y caudal en hardware objetivo |
Nuestro criterio: la ventaja defendible de DeepSeek no es ser universalmente mejor que un modelo cerrado concreto, sino combinar API barata, pesos V4 abiertos y contexto largo eficiente. Empieza con Flash y envía a Pro solo los casos donde una evaluación demuestre mejora. Aloja por tu cuenta únicamente si el control o el volumen sostenido compensan la infraestructura.
Preguntas frecuentes
¿DeepSeek es gratis?
El chat puede ofrecer acceso gratuito con límites variables. La API cobra por uso. El alojamiento propio añade hardware, ingeniería, seguridad y energía.
¿Debo seguir usando deepseek-chat o deepseek-reasoner?
No en trabajos nuevos. DeepSeek programó su retirada después del 24 de julio de 2026. Usa los IDs V4 explícitos y comprueba la lista en vivo.
¿Flash o Pro?
Empieza con Flash para extracción, soporte, código rutinario y volumen. Pasa a Pro solo si aumenta los resultados aceptados lo suficiente para justificar coste y menor concurrencia.
¿1M de contexto sustituye RAG?
No. Retrieval mejora actualidad, permisos, evidencia visible, latencia y depuración. Compara ambos con el mismo conjunto real.
¿Puede ejecutarse localmente?
Los pesos V4 están disponibles, pero el modelo completo necesita infraestructura distribuida grande. Los derivados pequeños no equivalen a la API V4 actual.
¿Sirve para datos confidenciales?
Revisa contrato, controles, región, retención, borrado y ley. Minimiza datos y no envíes secretos. El self-hosting tampoco elimina obligaciones de gobierno.
Fuentes revisadas
- DeepSeek V4 release and API migration notice
- DeepSeek API models and live pricing
- DeepSeek thinking-mode guide
- DeepSeek tool-calling guide
- DeepSeek privacy policy, updated February 10, 2026
- Official DeepSeek V4 model card and weights
- Hugging Face technical analysis of DeepSeek V4 long-context efficiency
- DeepSeek-R1 technical paper on reinforcement-learning-based reasoning
Revisión independiente: 20 de agosto de 2026. Precios, IDs, límites, políticas y disponibilidad cambian; verifica documentación oficial y cuenta activa antes de comprar o desplegar.




