DeepSeek는 일반 사용자용 AI 도우미와 개발자용 모델 플랫폼을 함께 제공합니다. 2026년 8월 현재 API의 중심은 DeepSeek V4입니다. deepseek-v4-flash는 저비용·고처리량, deepseek-v4-pro는 어려운 추론과 에이전트 작업을 위한 선택입니다. 두 모델 모두 100만 토큰 컨텍스트, 사고/비사고 모드, 도구 호출, JSON 출력, OpenAI 호환 Chat Completions와 Anthropic 형식 엔드포인트를 지원합니다.
2024년 V3나 2025년 R1 설명을 현재 V4 API와 섞으면 안 됩니다. R1의 강화학습 추론 방식은 중요하지만 V4의 다른 이름이 아닙니다. 기존 deepseek-chat와 deepseek-reasoner 별칭은 2026년 7월 24일 이후 중단 예정이었습니다. 새 연동은 명시적 V4 모델 ID를 사용해야 합니다.
현재 V4 모델과 API
| 결정 항목 | V4 Flash | V4 Pro | 실무 해석 |
|---|---|---|---|
| 모델 ID | deepseek-v4-flash | deepseek-v4-pro | 종료된 별칭 대신 명시 ID 고정 |
| 모델 규모 | 총 284B / 활성 13B | 총 1.6T / 활성 49B | MoE 파라미터 수만으로 품질 판단 금지 |
| 컨텍스트 / 최대 출력 | 1M / 최대 384K | 1M / 최대 384K | 용량은 안정적 회상을 보장하지 않음 |
| 모드 | 사고·비사고, 기본 사고 | 사고·비사고, 기본 사고 | 단순 작업은 사고를 끄고 비교 |
| 검토 시 동시성 | 2,500 | 500 | 처리량은 Flash부터 시험 |
OpenAI 호환 기본 URL은 https://api.deepseek.com, Anthropic 형식은 https://api.deepseek.com/anthropic입니다. 인터페이스 호환은 이전 비용을 줄이지만 추론 필드, 도구 상태, token 계산과 행동까지 같다는 뜻은 아닙니다.
token 광고가 아니라 승인 결과당 비용
2026년 8월 20일 공식 가격은 V4 Flash의 100만 token당 캐시 적중 입력/미적중 입력/출력이 각각 $0.0028/$0.14/$0.28, V4 Pro는 $0.003625/$0.435/$0.87입니다. 여기에 긴 추론, 재시도, 도구 결과, 미캐시 prefix, 저장, 평가와 사람 검토 비용을 더해야 합니다. 구매 시점의 공식 가격표와 계정이 최종 기준입니다.
안정적인 system instruction과 참조 prefix를 재사용하고 실제 cache hit를 기록하세요. 할인만 노리고 무관한 문맥을 넣으면 저렴한 token이 비싼 검수로 돌아옵니다.
| 작업 | 시작 선택 | 상향 조건 | 측정값 |
|---|---|---|---|
| 분류·추출·재작성 | Flash 비사고 | 구조/사실 통과율 부족 | 승인 레코드 비용과 지연 |
| 지식 도우미 | Flash + 검색 | 어려운 근거 종합 실패 | 인용, 기권, 수정 시간 |
| 코드·도구 에이전트 | Flash 사고 파일럿 | 저장소 전반 계획은 Pro가 우세 | test, diff, tool error |
| 수학·복합 분석 | Pro 사고 | 사람/다른 모델 확인 필요 | 설명 길이 아닌 성공률 |
| 초장문 | 검색 기준부터 구성 | 긴 창이 실제 합격률을 높임 | 위치별 회상, 충돌, 지연, 비용 |
사고 모드와 도구의 상태 계약
V4는 사고 모드가 기본입니다. 현재 reasoning effort는 high 또는 max로 매핑되며 사고 모드에서 temperature, top_p 등은 효과가 없습니다. 사고 응답이 도구를 호출했다면 중간 reasoning_content를 후속 컨텍스트에 포함해야 합니다. 도구 없는 보통 턴에서는 이전 추론을 다시 보낼 필요가 없습니다.
- 업무에 필요한 최소 도구와 인수만 노출합니다.
- 신원, 권한, 금액, 업무 규칙을 서버에서 재검증합니다.
- 코드 실행, 메시지, 구매, 삭제, 운영 변경은 승인을 받습니다.
- loop, token, 시간, 지출에 상한을 둡니다.
- 모델 ID, 사고 설정, 인수, 승인과 실제 결과를 기록합니다.
- 모델·prompt·검색 변경 전 고정 평가셋을 재생합니다.
베타 strict tool mode는 JSON Schema 형식 준수를 돕지만 권한이나 비즈니스 타당성을 판단하지 못합니다. 문법 적합성을 실행 허가로 착각하면 안 됩니다.
100만 토큰은 용량이지 기억 보장이 아니다
V4는 압축·희소 attention으로 긴 문맥의 KV cache와 계산 부담을 줄입니다. 공식 모델 카드와 Hugging Face 기술 분석은 긴 도구 trace를 쌓는 에이전트에 이 구조가 유용하다고 봅니다.
하지만 100만 token 입력은 가운데 묻힌 조항, 상충 버전, prompt injection, 초기 제약 유지의 성공을 보장하지 않습니다. 사실을 앞·중간·끝에 배치하고 중복과 충돌을 넣으며 근거 구간을 요구한 뒤, 검색+짧은 컨텍스트와 비교해야 합니다.
웹, 호스팅 API, 오픈 웨이트
| 형태 | 적합 | 주요 경계 | 추가 통제 |
|---|---|---|---|
| 웹/App | 탐색, 초안, 일회 분석 | 소비자 약관과 계정 제한 | 비밀 금지, 중요 결과 확인 |
| 호스팅 API | 제품, 자동화, Agent | 공급자 의존, 가격 변화, 데이터 책임 | 서버 키, 예산, eval, 보존 검토 |
| V4 자체 호스팅 | 대형 분산 모델 운영 역량과 통제 필요 | Flash/Pro 모두 노트북급 아님 | 용량, hardening, monitoring, patch |
| 증류/이전 계열 | 작은 hardware나 좁은 업무 | 현재 V4와 능력·문맥·license 다름 | 정확한 checkpoint 명시 |
V4 모델 카드는 MIT로 오픈 웨이트를 공개하지만 Pro는 총 1.6T, Flash도 총 284B MoE입니다. 분산 가속기, serving stack, 정밀도·양자화 선택, 보안 운영이 필요합니다. 오픈 웨이트가 입력 데이터 권리나 출력 책임까지 해결하지는 않습니다.
개인정보와 거버넌스
DeepSeek 소비자 개인정보 정책은 prompt, file, photo, feedback, chat history를 수집할 수 있고 개인정보를 중국에서 직접 처리·저장할 수 있다고 설명합니다. 개발자가 open platform으로 만든 앱의 최종 사용자 처리는 해당 소비자 고지의 범위가 아니며 개발자가 별도 고지해야 한다고도 명시합니다. 채팅 정책만 보고 API 보존·지역 조건을 추정하지 마세요.
- 전송 전 데이터 분류를 하고 key, credential, 불필요한 민감정보를 제거합니다.
- 검색과 모든 도구 호출에서 tenant 권한을 검사합니다.
- controller/processor 역할, 지역, 보존, 삭제, log 접근을 문서화합니다.
- 기밀·규제 업무는 법무, 보안, 조달 검토를 거칩니다.
- 유창한 추론을 근거로 보지 말고 권위 있는 시스템으로 검증합니다.
인접 선택지 비교
| 선택지 | 후보 이유 | 검증할 trade-off | 좋은 평가 |
|---|---|---|---|
| DeepSeek V4 | 낮은 공개 API 가격, open weights, 1M, 두 reasoning mode | 데이터 경계, 상태 처리, 자체 호스팅 규모 | 장문/Agent 승인 결과 비용 |
| OpenAI platform | 광범위 multimodal API, tools, 제품 생태계 | 모델·기능·가격과 closed 의존 | 동일 task와 동일 evidence gate |
| Anthropic Claude | coding agent와 Anthropic API 생태계 | 형식 호환은 행동 동일성이 아님 | repository 성공, tool safety, 수정 시간 |
| Google Gemini | Google 제품/Cloud, multimodal long context | surface, region, model 차이 | 문서·media·enterprise cloud |
| Qwen 등 self-host family | 크기 선택이 많아 hardware 적합 가능 | checkpoint마다 능력과 license 상이 | 목표 hardware throughput과 private task |
판단: DeepSeek의 방어 가능한 장점은 막연한 ‘최고 모델’이 아니라 낮은 hosted 가격, V4 open weights와 효율적인 장문을 함께 제공한다는 점입니다. Flash에서 시작하고 실제 평가가 증명한 어려운 작업만 Pro로 올리세요. 자체 호스팅은 통제나 지속 규모가 인프라 부담을 상쇄할 때만 합리적입니다.
자주 묻는 질문
DeepSeek는 무료인가요?
consumer chat은 무료 접근과 변동 제한이 있을 수 있습니다. API는 사용량 과금이고 self-host도 hardware, engineering, security, 전력 비용이 듭니다.
deepseek-chat/reasoner를 계속 써도 되나요?
새 연동에는 권하지 않습니다. 공식은 2026년 7월 24일 이후 종료를 안내했습니다. 명시적 V4 Flash/Pro ID와 live model list를 확인하세요.
Flash와 Pro 중 무엇부터 쓰나요?
추출, 지원, 일반 코딩, 처리량 작업은 Flash부터 시작합니다. 대표 평가에서 Pro의 승인률 향상이 추가 비용과 낮은 동시성을 정당화할 때만 전환합니다.
1M context가 RAG를 대체하나요?
아닙니다. 검색은 freshness, permission, evidence, latency, debug를 개선합니다. 같은 실제 업무에서 full context와 retrieval을 비교하세요.
로컬 실행이 가능한가요?
V4 weights는 공개됐지만 전체 모델은 대규모 분산 인프라가 필요합니다. 작은 증류 계열은 현재 V4 API와 동일하지 않습니다.
기밀 데이터에 적합한가요?
계약, account control, 처리 지역, 보존, 삭제, 접근과 법률을 검토하고 secret을 보내지 마세요. self-host도 governance 의무를 없애지 않습니다.
검토한 출처
- DeepSeek V4 release and API migration notice
- DeepSeek API models and live pricing
- DeepSeek thinking-mode guide
- DeepSeek tool-calling guide
- DeepSeek privacy policy, updated February 10, 2026
- Official DeepSeek V4 model card and weights
- Hugging Face technical analysis of DeepSeek V4 long-context efficiency
- DeepSeek-R1 technical paper on reinforcement-learning-based reasoning
독립 검토일: 2026년 8월 20일. 가격, 모델 ID, 한도, 정책과 제공 여부는 바뀔 수 있으므로 도입 전에 공식 문서와 실제 계정을 확인하세요.




