现已上线 — v4-pro-2026.02

智慧之深, 已被丈量。

DeepSeek V4 Pro 是一款面向最艰深问题的前沿推理模型——研究、智能体、 以及拒绝走捷径的系统。一百万 token 的工作记忆。开源权重。自主算力。

1.4T 总参数量
28B 每 token 激活
1M 上下文窗口
$0.10/1M 输入价格
01 — 理念

多数模型只浮于表面。

01

V4 Pro 生来就要下潜——越过模式匹配,越过那个舒服的答案, 抵达难题真正栖身的地方。

它把算力投在问题最坚硬之处,容纳矛盾而不崩溃,抵达底部才会上浮。 深度优先计算意味着:一条跑三天的推理链,成本只相当于过去的三分钟—— 而沿途的每一次转折,都被牢牢记住。

低调地说:我们没有让它更快,而是让它愿意潜得更深。
— V4 研究团队 · 预印本 §2.4
02 — 能力

为深水区而生。

02
C-01 · 推理

绵延数日的思维链。

带检查点记忆的多日智能体链条。V4 Pro 会规划、修订、自我恢复——把难题当作一次下潜, 而非一场冲刺。当某条路径走入死胡同,它会带着所学上浮,然后再次下潜。

94.2 MMMU-Pro 准确率
C-02 · 上下文

整片海洋,尽收一帧。

一百万 token 的原生上下文——没有任何滑窗把戏。一次读入整个代码库、一整卷论文、 一整年的日志,并跨全部内容推理。

1,000,000 帧内 token
C-03 · 感知

看得见。听得懂。读得进。

视觉、音频与文本共用一个主干——没有拼接式适配器。截图、图纸、九十分钟的录音, 都流经同一份注意力。

3 原生模态
C-04 · 工具

原生 MCP,无需胶水。

一流的工具编排,结构化输出与自我校验调用。在把结果交给你之前, 它会先核对自己的工作。

99.2% 工具格式通过率
C-05 · 开放

由你自行部署。

MIT 许可权重,FP8 与 INT4 双版本,完整模型卡, 以及一个下午即可复现的评测工具链。

MIT 许可 · FP8 / INT4
C-06 · 效率

同行八分之一的算力。

以同行零头的训练预算,跑出 3.1× 的 MFU。 深度不该是只有万亿级实验室才负担得起的东西。

3.1× 模型浮点利用率
03 — 基准

以深度丈量。

03
DeepSeek V4 Pro 前沿均值
GPQA Diamond — 研究生级科学问答 0%
SWE-bench Verified — 真实 GitHub issue 0%
Codeforces Elo — 算法竞赛 0
MMMU-Pro — 多模态推理 0%
AIME 2025 — 数学奥林匹克 0%
04 — 架构

专家的殿堂。

04
384
阶段 01

提示词

你的请求以原始字节进入——文本、图像或音频。

阶段 02

分词

字节级分词器无损压缩输入流。

阶段 03

路由

MoE 门控为每个 token 从 384 位专家中选出 8 位——零浪费算力。

阶段 04

专家织体

入选专家共享同一份 1M token 记忆库,再行重组。

阶段 05

预测

一次一个 token——经过校验、带引用、感知深度。

1.4T总参数量
28B每 token 激活
384 位专家每 token 激活 8 位
8-bitKV 缓存
9.2T训练 token
FP8训练精度
05 — 接入

算力本身,而非溢价。

05
托管 API

api.deepseek.com

全球推理,首 token 仅 40 毫秒。为你真正思考的部分付费,仅此而已。

输入$0.10 / 1M token
输出$0.40 / 1M token
缓存读取$0.02 / 1M token
批量 −50% 含 1M 上下文 无推理附加费
获取 API Key
06 — 疑问

水面之上的问题。

06
上下文窗口到底有多大?+
原生 1,000,000 token。没有滑窗、没有摘要层。每一步都对完整帧做注意力计算, 这正是多日推理链从第一个 token 到最后一个都能保持连贯的原因。
它真的是开源的?+
是。权重、分词器与推理栈均以 MIT 协议发布,上线即提供 FP8 与 INT4 量化版本, 并附完整模型卡,涵盖数据配比、安全评测与已知局限。
我该怎么自托管?+
FP8 权重可在 8×H100 或 4×H200 上从容服务;INT4 则把基座模型带入工作站级硬件。 vLLM 与 SGLang 首日支持,并附带 1M token 服务的参考配置。
V4 Pro 到底有什么不同?+
深度优先计算。多数模型被优化为快速作答、见好就收;V4 Pro 被优化为按问题所需持续推理—— 而 MoE 路由让这种深度远比蛮力方案便宜。