DeepSeek 同时是面向普通用户的 AI 助手和面向开发者的模型平台。截至 2026 年 8 月,现行 API 主线已经是 DeepSeek V4:deepseek-v4-flash 偏向低成本和高吞吐,deepseek-v4-pro 面向更难的推理与 Agent 任务。两者都支持 100 万 token 上下文、思考/非思考模式、工具调用、JSON 输出、OpenAI 兼容接口和 Anthropic 格式接口。
旧文章常把 2024 年的 V3、2025 年的 R1 与现在的 API 能力混写。R1 的强化学习推理路线很重要,但不是现行 V4 API 的同义词。官方已安排旧模型名 deepseek-chat 与 deepseek-reasoner 在 2026 年 7 月 24 日后停止访问;新项目应使用明确的 V4 模型 ID。
当前 V4 模型与 API 快照
| 决策项 | V4 Flash | V4 Pro | 实际含义 |
|---|---|---|---|
| 模型 ID | deepseek-v4-flash | deepseek-v4-pro | 使用明确 ID,不再依赖旧别名 |
| 模型规模 | 284B 总参数 / 13B 激活 | 1.6T 总参数 / 49B 激活 | MoE 参数量不能直接等同任务质量 |
| 上下文 / 最大输出 | 1M / 最高 384K | 1M / 最高 384K | 容量不等于稳定召回,仍要测试 |
| 模式 | 思考与非思考,默认思考 | 思考与非思考,默认思考 | 简单任务可关闭思考以降低延迟 |
| 并发上限(复核时) | 2,500 | 500 | Flash 更适合吞吐,额度可能调整 |
OpenAI 兼容基础地址仍为 https://api.deepseek.com,Anthropic 格式地址为 https://api.deepseek.com/anthropic。接口形状兼容可以降低迁移成本,但不代表推理字段、工具状态、token 统计和行为与其他厂商完全相同。
按“合格结果”而不是宣传单价算成本
2026 年 8 月 20 日复核的官方价为:V4 Flash 每百万 token 的缓存命中输入、未命中输入和输出分别为 0.0028、0.14、0.28 美元;V4 Pro 分别为 0.003625、0.435、0.87 美元。价格很低,但预算还要加入长推理、重试、工具返回、未缓存前缀、存储、评测和人工审核。价格会变,采购时应以实时价格页和账户为准。
最值得利用的是缓存价差:把稳定的系统指令和参考前缀设计成可复用块,记录真实命中率;不要为了缓存而堆积无关上下文。便宜 token 也可能产生昂贵的返工。
| 工作负载 | 起始选择 | 升级条件 | 核心指标 |
|---|---|---|---|
| 分类、抽取、改写 | Flash 非思考 | 结构或事实通过率不足 | 合格记录成本与延迟 |
| 知识助手 | Flash + 检索 | 复杂证据综合失败 | 引用支持、拒答、纠错时间 |
| 代码与工具 Agent | Flash 思考模式试点 | 跨仓库规划或调试需要 Pro | 测试、diff 审核、工具错误 |
| 数学与复杂分析 | Pro 思考模式 | 仍需人或第二模型复核 | 任务成功率而非推理长度 |
| 超长文档 | 先做检索基线 | 长窗口确实提高通过率 | 位置召回、冲突、延迟、总成本 |
思考模式与工具调用有状态契约
V4 默认开启思考。DeepSeek 当前把推理强度映射为 high 或 max;思考模式下 temperature、top_p 等采样参数不起作用。若一次思考响应包含工具调用,后续上下文需要带回中间 reasoning_content;没有工具调用的普通轮次则不必保留旧推理。不要把 SDK 返回内容一股脑拼接。
- 只开放完成任务所需的最小工具与参数。
- 身份、权限、金额和业务规则由服务端再次验证。
- 执行代码、发消息、支付、删除和生产变更前要求人工确认。
- 为循环次数、token、时间和费用设置硬上限,并返回结构化错误。
- 记录模型 ID、思考开关、工具参数、审批与真实结果。
- 模型、提示词或检索变更前重放固定评测集。
Beta 严格工具模式可以让参数更符合 JSON Schema,但它无法判断账户是否有权、退款是否合规或部署是否安全。语法正确只是控制层之一。
100 万上下文是容量,不是记忆保证
V4 的差异化在于用压缩和稀疏注意力降低超长上下文的 KV Cache 与计算负担。官方模型卡和 Hugging Face 的独立技术解读都认为这对长时间运行、不断积累工具轨迹的 Agent 很有价值。
但模型能接收 100 万 token,不代表一定能找到埋在中间的条款、识别互相矛盾的版本、抵抗提示注入或长期保持早期约束。应把事实放在开头、中间和结尾测试,加入重复与冲突,要求给出证据片段,并与“检索 + 较短上下文”对照。
网页、托管 API 还是开放权重
| 形态 | 适用 | 主要边界 | 必须补充的控制 |
|---|---|---|---|
| 网页/App | 探索、草稿、一次性分析 | 消费者条款和账号限额 | 不放秘密;关键结论核验来源 |
| 托管 API | 产品、自动化、Agent | 厂商依赖、动态价格、数据责任 | 服务端密钥、预算、评测、留存审查 |
| 自部署 V4 | 确需基础设施控制且能运维大模型 | Pro 与 Flash 都不是笔记本模型 | 容量、安全、监控、补丁和安全层 |
| 蒸馏/旧款家族 | 较小硬件或窄任务 | 能力、上下文、许可可能不同 | 标明准确 checkpoint,不能笼统写 V4 |
V4 模型卡以 MIT 许可发布开放权重,但开放权重不等于低成本部署,也不授予输入数据的权利。V4 Pro 是 1.6T 参数 MoE,Flash 也有 284B 总参数,需要分布式加速器、推理框架、精度/量化选择和持续安全运维。
隐私与治理边界
DeepSeek 隐私政策称消费者服务可能收集提示词、文件、照片、反馈和聊天历史,个人数据可能在中华人民共和国境内直接处理和存储。政策同时说明,开发者用开放平台构建应用时,其终端用户数据处理不由这份消费者政策覆盖,开发者需要提供自己的告知。因此不能只看聊天端政策就推断 API 的全部留存与区域条件。
- 发送前做数据分级,禁止密钥、凭证和非必要敏感个人信息。
- 检索和每次工具调用前都执行租户级权限检查。
- 明确控制者/处理者角色、区域、留存、删除和日志访问。
- 机密或受监管工作负载需经过法务、安全和采购审查。
- 生成结论要回到权威系统核验;流畅的推理不是证据。
与相邻产品的选择比较
| 选项 | 值得入围的理由 | 重点验证 | 适合的评测 |
|---|---|---|---|
| DeepSeek V4 | 低公开 API 价、开放权重、1M 上下文、双推理模式 | 数据治理、状态处理、自部署规模 | 长上下文/Agent 的合格结果成本 |
| OpenAI 平台 | 多模态 API、工具和成熟产品生态 | 模型、功能、价格与闭源依赖 | 相同任务、工具和证据门槛 |
| Anthropic Claude | 编码 Agent 与 Anthropic API 生态 | 接口格式兼容不等于行为一致 | 仓库任务、工具安全、纠错时间 |
| Google Gemini | Google 产品/云集成和多模态长上下文 | 不同入口、区域和模型可用性 | 文档、媒体与企业云场景 |
| Qwen 等自托管家族 | 尺寸选择多,可能更适合现有硬件 | checkpoint 能力与许可各异 | 目标硬件吞吐和私有任务质量 |
我们的判断:DeepSeek 最可信的优势不是“所有任务都胜过某个闭源模型”,而是低托管价格、开放 V4 权重和高效长上下文同时存在,给团队带来架构和议价选择。代价是团队必须更主动地承担评测、数据边界和 Agent 状态。默认从 Flash 开始,只把评测证明更难的任务升级到 Pro;只有控制或持续规模足以覆盖基础设施成本时才考虑自部署。
常见问题
DeepSeek 免费吗?
消费者聊天可能有免费访问和动态限额;托管 API 按量收费。自部署没有厂商 token 费,但有硬件、工程、安全和电力成本。
还能使用 deepseek-chat 或 deepseek-reasoner 吗?
新项目不应使用。官方安排两个旧别名在 2026 年 7 月 24 日后停止访问,请改用 deepseek-v4-flash 或 deepseek-v4-pro 并检查实时模型列表。
先选 Flash 还是 Pro?
抽取、客服、常规编码和高吞吐先用 Flash;只有代表性评测证明 Pro 的合格率提升足以覆盖额外成本和较低并发时再升级。
100 万上下文能替代 RAG 吗?
不能。检索仍能改善新鲜度、权限、证据展示、延迟和可调试性。应在同一批真实任务上比较整段输入和检索方案。
DeepSeek 可以本地运行吗?
V4 有开放权重,但完整模型需要大型分布式基础设施。较小或蒸馏家族更容易运行,却不等同现行 V4 API。
适合机密数据吗?
需审查合同、账户控制、处理区域、留存、删除、访问和适用法律;最小化提示词且不要发送秘密。自部署增加控制,但不会消除治理责任。
复核来源
- DeepSeek V4 release and API migration notice
- DeepSeek API models and live pricing
- DeepSeek thinking-mode guide
- DeepSeek tool-calling guide
- DeepSeek privacy policy, updated February 10, 2026
- Official DeepSeek V4 model card and weights
- Hugging Face technical analysis of DeepSeek V4 long-context efficiency
- DeepSeek-R1 technical paper on reinforcement-learning-based reasoning
独立复核日期:2026 年 8 月 20 日。价格、模型 ID、限额、政策和可用性会变化,上线或采购前请核对官方文档与实际账户。




