DeepSeek V4 Pro正式版的发布,多少有点出人意料。
至少截至8月13日早上,DeepSeek并没有为它专门发一篇声势浩大的发布公告,官方更新日志还停留在7月31日的V4 Flash。但如果打开DeepSeek的API价格页面,会发现deepseek-v4-pro后面的版本已经悄悄变成了DeepSeek-V4-Pro-0813。这意味着,从4月底发布Preview版本算起,DeepSeek V4 Pro终于迎来了正式版。新版本支持100万Token上下文、最大384K输出,同时支持Tool Calls、Responses API和Anthropic API。
如果这只是又一个“大模型变强了”的故事,其实已经没什么新鲜的。现在真正值得关注的,是V4 Pro这次提升最大的地方恰恰是Coding Agent和长任务执行能力,而它的API价格依然只有每百万Token输入3元、输出6元。
这可能比Benchmark本身更值得讨论。
一、V4 Pro终于把“Pro”的位置拿回来了
V4 Pro正式版之所以值得注意,还要从两周前的V4 Flash说起。
7月31日,DeepSeek发布V4 Flash正式版,当时出现了一个颇为尴尬的情况:作为低成本版本的Flash,在大量Agent测试里反而超过了V4 Pro Preview。Terminal Bench 2.1达到82.7,DeepSWE达到54.4,DSBench-Hard达到59.6,DeepSeek自己甚至直接在更新日志里写,Flash的Agent能力“far exceeding V4-Pro-Preview”。与此同时,它又特别说明,Pro API并没有更新,正式版随后发布。
现在0813版本终于把这个位置拿回来了。
根据DeepSeek此次分享的数据,OpenRouter上线V4 Pro 0813时特别列出了两个变化:DeepSWE从Preview版本的12.8提高到62.7,Terminal Bench 2.1从72.1提高到87.9。公开整理的数据里,CyberGym也从52.7提高到83.3,DSBench-FullStack从41.8提高到71.1。换句话说,这一次最明显的进步不是知识问答,而是让模型在终端环境里写代码、调用工具、修改项目,并把一个更长的任务真正做完。
这其实也符合V4整个系列的方向。DeepSeek V4 Pro本身是一个总参数1.6T、激活参数49B的MoE模型,支持100万Token上下文。DeepSeek在技术报告中强调,新的注意力架构让它在1M上下文下,单Token推理FLOPs只有V3.2的27%,KV Cache需求约为10%。模型变得更大,但长上下文推理的成本并没有同比增长。
这对Agent尤其重要,因为Agent真正昂贵的地方,从来不是回答一个问题,而是连续工作几十分钟甚至几个小时。
二、它还没有全面超过最强模型,但已经进入同一个牌桌
这里需要稍微泼一点冷水。
仅凭DeepSeek自己公布的Benchmark,还不能得出“V4 Pro已经超过Claude Fable 5”这样的结论,更何况新版本刚刚上线,还需要等待更多独立测试。公开对比数据中,V4 Pro 0813在Terminal Bench 2.1上是87.9,Fable 5是88.0;CyberGym是83.3对83.1,基本处在同一水平。但在DeepSWE上,V4 Pro是62.7,Fable 5仍然达到70.0;Toolathlon、DSBench-FullStack等项目也还有差距。
所以更准确的说法,不是DeepSeek已经打败了最强的闭源模型,而是它在越来越多Agent任务上,开始进入同一个能力区间。
这个区别很重要。
对于真正复杂的软件工程、科研或者企业Agent任务,最后5%甚至10%的能力差距依然可能非常值钱。一个模型成功完成任务,另一个模型运行半小时之后失败,前者即使贵很多也可能更划算。所以最强模型的溢价不会因为DeepSeek出现就突然消失。
但市场真正的问题是:究竟有多少任务,需要为了最后这5%的成功率支付几十倍的Token价格?
当便宜模型的能力只有旗舰模型一半时,这个问题没有意义;当两者开始出现在同一张Benchmark表里时,问题就完全不同了。
三、真正麻烦的是:它的输出价格只有6元
DeepSeek V4 Pro现在的官方价格是,每百万Token缓存未命中输入3元,输出6元;缓存命中甚至只有0.025元。相比之下,Anthropic目前最强的公开模型Fable 5是每百万Token输入10美元、输出50美元,Opus 5是5美元和25美元,Sonnet 5也要2美元和10美元。
当然,不能简单拿6元和50美元相除,就得出模型“便宜几十倍但一样强”的结论。不同Tokenizer、缓存策略、推理长度、Agent Harness都会影响最终成本,而且最强模型更高的任务成功率本身也有价值。
但Agent时代有一个和Chatbot时代很不一样的地方:Token重新变得重要了。
我们平时问ChatGPT一个问题,也许只消耗几千个Token,多几分钱少几分钱,普通用户几乎感觉不到。但一个Coding Agent可能要读几十万Token的代码,搜索项目、修改文件、运行测试、读取错误信息,再重新修改;一个企业如果同时运行几百甚至几千个Agent,Token成本就会迅速从一个可以忽略的数字,变成真正的基础设施成本。
所以AI模型最终竞争的,很可能不是“每百万Token多少钱”,而是完成一个任务到底多少钱。在这个公式里,能力决定成功率,价格决定每次尝试的成本。当两款模型能力相差巨大时,价格并不重要;但当能力开始接近时,价格的权重就会迅速上升。
这也是V4 Pro真正可能给Anthropic和OpenAI带来压力的地方。
四、事实上,模型价格战已经开始了
如果把最近一个月发生的事情放在一起看,这个趋势会更加明显。
7月30日,OpenAI宣布把GPT-5.6 Luna价格直接降低80%,Terra降低20%,目的就是让高频、大规模工作负载能够以更低成本调用。到了8月10日,Anthropic又取消了Claude Sonnet 5原定9月进行的涨价,2美元输入、10美元输出从“推广价格”直接变成长期标准价格。
这些动作当然不能简单归因于DeepSeek,因为整个模型市场的推理效率都在提高,Google、中国的开放权重模型以及云厂商之间的竞争也都在推动价格下降。但当越来越多模型的Agent能力开始接近前沿水平以后,过去那种“最好的模型天然应该卖最贵”的逻辑,正在受到挑战。
更有意思的是,DeepSeek自己似乎也知道现在的价格有些低。
在V4 Pro正式版上线的价格页面上,DeepSeek罕见地提前提醒用户:计划近期整体上调DeepSeek API服务定价,而且预计涨幅较大。
这反而说明一个问题:DeepSeek下一阶段可能已经不需要继续证明“中国模型能不能做到接近前沿能力”,它真正需要验证的是,当价格逐渐回归正常商业水平之后,开发者是不是仍然愿意留下来。
便宜可以带来第一次调用,但只有能力、稳定性和生态才能留下长期调用。
五、Flash加Pro,可能比单独一个Pro更有杀伤力
我前几天写V4 Flash时,认为DeepSeek真正想争夺的不是“最强模型”,而是“最多调用”。现在Pro正式版出来以后,这个产品结构反而更加清晰了。
V4 Flash每百万Token输入1元、输出2元,并发上限2500;V4 Pro输入3元、输出6元,并发500。两者都支持100万Token上下文、Tool Calls、Responses API和Anthropic API。
这意味着开发者其实没有必要让所有任务都跑Pro。绝大多数明确、重复、执行型的工作交给Flash,只有真正复杂的任务才升级到Pro;再进一步,Agent系统完全可以根据任务难度、失败次数和上下文复杂程度自动Routing。
这样算下来,一个产品真正的平均推理成本甚至不是V4 Pro的价格,而是大量Flash加少量Pro。
这也是我觉得AI模型市场正在发生的一个重要变化。过去我们习惯讨论“哪个模型最强”,因为人是模型的主要调用者;当Agent开始调用模型之后,情况会完全不同。Agent不会在意品牌,也不会因为Claude或者DeepSeek的名字产生偏好,它只会根据成功率、速度和成本选择下一次调用谁。
到了那个时候,模型公司真正争夺的就不再只是用户,而是机器产生的调用量。
DeepSeek V4 Pro是不是今天世界上最强的Agent模型,我觉得其实没有那么重要。至少目前的数据还不足以支持这个结论。
真正重要的是,它已经越来越接近那个区间,而价格却依然停留在另一个区间。
当“足够接近最强”的模型越来越多,最强模型当然仍然有价值,但它的使用范围可能会逐渐收缩到那些真正需要最后一点能力的任务里。剩下数量更庞大的日常开发、自动化和企业Agent任务,会越来越现实地计算一件事情:
把这件事做完,到底需要花多少钱?
到了这一步,AI模型竞争最重要的排行榜,可能就不再是谁的Benchmark最高,而是谁能用最低的成本,把最多的事情真正做完。


