标签: GPT

DeepSeek V4 Flash只差GPT-5.6 Luna 1分,价格却低了一大截,AI模型开始争夺“用得最多”

7月30日,OpenAI宣布将GPT-5.6 Luna的API价格降低80%,输入价格降到每百万Token 0.20美元,输出价格降到1.20美元。一天之后,DeepSeek发布V4 Flash正式版。它没有扩大参数规模,只是在预览版基础上重新进行后训练,官方公布的多项Agent评测却超过了V4 Pro Preview,并继续维持每百万Token 0.14美元输入、0.28美元输出的价格。

两件事发生得很接近,很容易被理解成一场普通的模型价格战。但我觉得,真正的变化不是谁在排行榜上前进了几名,而是AI模型正在出现一种新的竞争标准:未来最重要的模型,未必是解决最难问题的那个,也可能是每天被调用最多、承担最多实际工作的那个。

DeepSeek V4 Flash争夺的,正是这个位置。

一、Flash已经不再意味着能力弱一档

过去各家公司名称里的Flash、Mini、Haiku,通常都代表一种明确定位:能力比旗舰模型弱一些,但速度更快、价格更低,适合摘要、分类、信息抽取和简单问答。真正复杂的推理、编码和Agent任务,仍然要交给更大的模型。

V4 Flash正式版开始打破这个边界。DeepSeek公布的九项Agent测试中,它全部超过V4 Pro Preview。Terminal Bench 2.1从72.1提高到82.7,DeepSWE从12.8提高到54.4。第三方机构Artificial Analysis的综合智能指数中,V4 Flash最高推理档得到50分,与Gemini 3.6 Flash处在同一区间,只比GPT-5.6 Luna最高推理档低1分。

这些数字不能被理解为DeepSeek已经全面超过闭源模型。它的代码Agent测试使用了尚未公开的Harness,其中两项还是内部测试集;V4 Flash也只支持文本,无法与Gemini 3.6 Flash的多模态能力直接相比。

但它至少证明,低价模型已经跨过“只能做简单任务”的门槛。在一部分编码、工具调用和自动化任务中,大部分工作可以交给一个足够可靠、成本足够低的模型,只有遇到困难时,才调用更强的模型。

二、真正夸张的不是分数,而是这个分数对应的价格

如果只看50分和51分,V4 Flash与GPT-5.6 Luna差距不大;把价格放进来,情况就完全不同了。

V4 Flash每百万输入Token为0.14美元,输出为0.28美元;降价后的Luna分别为0.20美元和1.20美元;Gemini 3.6 Flash则是1.50美元和7.50美元。V4 Flash的输入价格比Luna低30%,输出价格低约77%;与Gemini 3.6 Flash相比,输入价格低约91%,输出价格低约96%。

假设一个Agent系统每月消耗1亿输入Token和2000万输出Token,不考虑缓存和不同模型的Token效率,V4 Flash的理论账单约为19.6美元,Luna约44美元,Gemini 3.6 Flash约300美元。这个简化计算足以说明价格差异如何随调用规模被放大。

不过,API单价最低不等于每个任务的真实成本最低。Artificial Analysis完成同一套评测时,V4 Flash生成了约2.1亿输出Token,明显高于同类模型中位数,说明它仍然偏冗长;DeepSeek还预告未来会实行高峰时段双倍价格。

开发者以后比较模型,不能只看每百万Token多少钱,还要看任务成功率、工具调用和重试次数、缓存利用率以及运行时间。真正应该比较的单位,不再是Token,而是“每个成功任务的成本”。

三、Agent让低价模型第一次成为大市场

在聊天产品里,用户问一个问题,模型回答一次,单次价格差异通常没有那么敏感。但Agent为了完成“修改一个功能”“分析一批合同”这样的工作,可能先读取文件、制定计划,再搜索、调用工具、执行代码、检查结果,发现错误后重新修改。一次用户请求背后,可能发生几十次甚至更多模型调用。

模型不再只是回答问题,而是在持续消耗算力完成工作。这也是为什么OpenAI在Luna降价时,重点案例几乎都围绕Agent展开。Ramp把Luna作为后台Agent自动化的默认模型,Cognition用它配合更大的模型处理常规编程工作;OpenAI自己给出的方案,也是让Sol负责制定计划,再让Luna执行修改、编写测试和检查结果。Google对Gemini 3.6 Flash的定位,同样是多步骤Agent工作流和更少的推理轮次与工具调用。

未来的Agent很可能不会只使用一个模型。最强模型负责规划、判断和处理异常,便宜模型负责搜索、执行、验证和大量子任务。就像一家公司不会让最资深的专家处理所有基础工作,Agent也不会把每一步都交给最昂贵的模型。

在这种分工下,旗舰模型决定能力上限,真正产生海量调用的,反而可能是中间这一层:能力已经足够,价格又低到可以反复使用。V4 Flash与Luna争夺的,正是Agent背后这个不一定被用户看见、却可能消耗最多Token的执行层。

四、开放权重让竞争不只发生在价格上

V4 Flash还有一个Luna和Gemini不具备的条件:开放权重。它采用MIT许可证,拥有2840亿总参数、每个Token激活130亿参数,并提供vLLM、SGLang等部署方式。

开放权重经常被理解为企业可以本地部署,但大多数公司并没有能力低成本运行这样规模的模型。它更现实的意义,是让云厂商和推理平台能够部署,让企业根据价格、数据要求和稳定性选择供应商,并针对自己的任务进行优化。

即使企业最后仍然使用官方API,开放模型也会成为闭源模型定价的参照,让任何一家厂商都更难依靠能力领先长期维持高溢价。OpenAI刚把Luna价格降低80%,DeepSeek紧接着用更低的价格提供接近的智能水平。两者之间没有证据表明存在直接因果关系,但它们共同说明,中间层模型的价格正在快速被压低。

未来模型公司的利润,可能越来越难只来自Token本身,而要转向Agent框架、工具生态、企业数据、稳定服务、分发入口和完整产品。模型能力仍然重要,但单纯出售模型能力这件事,正在越来越像一门基础设施生意。

五、最强模型决定上限,便宜模型决定规模

DeepSeek V4 Flash仍然有明显边界。它不是多模态模型,官方API的全球覆盖、稳定性、延迟和企业支持仍需验证;Gemini的多模态和原生工具能力,Luna与Codex、ChatGPT Work以及OpenAI生态的结合,也不是Token价格能够完整体现的。

但这不影响它释放出的信号。过去一年,开放权重模型首先证明自己可以接近闭源模型的能力;现在,它们又开始证明,这些能力可以被压到极低价格,并进入原本只有商业闭源模型才能承担的Agent工作流。

在聊天时代,我们习惯问哪个模型最聪明;到了Agent时代,企业会越来越关心:哪个模型能够稳定完成任务,哪个模型可以运行一百万次,哪个模型失败后重试的成本仍然可控,哪个模型不会让一个看起来不错的产品,在扩大用户量之后失去商业可行性。

所以,DeepSeek V4 Flash不是在挑战最强模型。最强模型负责解决最困难的问题,也决定整个行业的能力上限。但AI真正进入企业流程、替代大量重复工作、支撑成千上万个Agent持续运行,靠的未必是排行榜第一名。

最强模型决定我们能把AI带到多高,而足够强、足够便宜的模型,决定AI最终能够铺到多广。DeepSeek现在争夺的,正是后一个市场:它未必总是用户主动选择的模型,却可能成为Agent背后被调用最多的那个模型。

OpenAI把GPT-5.6 Luna降价80%,AI模型开始分成两个市场

7月30日,OpenAI宣布将GPT-5.6 Luna的API价格降低80%,Terra降低20%,同时为最强的Sol推出Fast mode,速度最高提升到标准模式的2.5倍,价格则是标准模式的两倍。

7月30日,OpenAI宣布将GPT-5.6 Luna的API价格降低80%,Terra降低20%,同时为最强的Sol推出Fast mode,速度最高提升到标准模式的2.5倍,价格则是标准模式的两倍。

看到“降价80%”,很多人的第一反应大概都是:OpenAI终于开始打价格战了。中国开放权重模型不断逼近前沿能力,价格又普遍更低,OpenAI不可能感受不到压力。

这种理解不能说错,但只解释了一半。OpenAI没有给整个系列统一降价:最便宜的Luna降了80%,Terra只降20%,最强的Sol一分钱没降,想让它跑得更快,反而要支付两倍价格。

所以,这次真正值得关注的,不是模型又便宜了一点,而是OpenAI正在把AI模型划分成两个市场:一个出售越来越便宜、可以大规模使用的“足够强的智能”;另一个出售仍然稀缺的前沿能力、速度和确定性。

真正值得注意的,不是降价80%

GPT-5.6发布时,Luna每百万输入Token 1美元、输出6美元;调整后变成0.20美元和1.20美元。Terra从2.50美元和15美元降到2美元和12美元,Sol继续维持5美元和30美元。OpenAI对三个型号的定位也很清楚:Luna负责高频和后台任务,Terra承担日常工作,Sol处理更复杂、失败成本更高的问题。

这不是一次简单打折,而是在重新划分模型的使用边界。现在OpenAI希望企业先判断一项任务值多少钱,再选择刚好够用的模型。它给出的例子是让Sol规划,再让Luna执行代码修改、测试和评估。未来的智能会像云计算资源一样,按照任务价值分级购买。

这也意味着,模型公司的定价方式正在发生变化。过去主要按照Token多少收费,未来真正决定模型价值的,可能是任务的风险、规模和失败成本。整理一批文档、检查格式或者运行测试,不需要每次都动用最强模型;但涉及复杂决策、长时间自主执行,或者一次错误就可能造成很大损失时,企业仍然愿意为更强的模型支付高价。

OpenAI说是效率提升,但竞争压力不能忽略

OpenAI给出的官方解释,是模型、推理系统和基础设施效率提高。GPT-5.6 Sol参与优化GPU内核,使端到端推理成本下降约20%;它设计和执行的实验,又让Token生成效率提高超过15%。这些数据说明OpenAI确实具备降价的成本基础,并不是单纯拿利润补贴市场。

但这仍然回答不了一个问题:既然基础设施效率整体提高,为什么Luna降80%,Terra只降20%,Sol却保持原价?

OpenAI没有公开说此次调整是为了应对中国模型,因此不能把“被中国模型逼着降价”当作事实。不过,把开放权重模型的竞争完全排除在外,同样不符合现实。Moonshot AI发布的Kimi K3拥有2.8万亿参数和100万Token上下文。Moonshot承认,它的整体性能仍落后于GPT-5.6 Sol和Claude Fable 5,但已经把开放模型推到前沿能力附近;其官方API每百万输入Token为3美元、输出15美元。

降价后的Luna,输入价格只有Kimi K3的十五分之一,输出不到十分之一。它们并非同一能力层级,不能只看价格判断谁更划算,但OpenAI显然不准备把“便宜而且足够好”的市场全部让给中国模型。

这个价格对比甚至有一点反直觉。过去,人们通常认为中国模型负责低价,欧美闭源模型负责最强能力;现在OpenAI自己开始把低价模型压到极低的位置,同时继续用Sol守住最前沿的高价市场。这已经不是哪个公司简单降价,而是闭源模型公司开始主动应对开放权重模型带来的市场结构变化。

开放权重改变的是价格参照系

开放权重并不等于免费。像Kimi K3这样体量巨大的模型,自行部署需要昂贵的GPU和运维能力,普通企业仍多半会选择托管服务。

但开放权重的价值,本来就不在于所有企业都要自己部署,而在于它提供了一种退出的可能。权重开放以后,同一个模型可以由不同服务商提供,企业也可以根据数据合规、成本和性能选择部署方式。即使客户最后继续使用OpenAI,只要它能够迁移到Kimi、DeepSeek、Qwen或其他模型,闭源平台就更难长期维持过高溢价。

以前,最强能力只存在于少数公司的API里,价格主要由这些公司决定;现在,开放模型即使还没有全面超过最强闭源模型,也已经足以完成大量真实工作。它们改变的不是某一个模型的标价,而是整个市场判断“这种能力应该值多少钱”的参照系。

开放模型最先冲击的,也不是Sol这种绝对前沿模型,而是位于中间层、能力已经足够好、差异却没有大到不可替代的产品。Luna降价80%,恰好说明这一层的定价权正在迅速减弱。

对于大量企业来说,它们并不需要模型在所有评测中都拿第一。只要能够稳定完成客服分类、文档整理、常规编码、数据分析和后台自动化,模型能力再提高几个百分点,未必能产生同等比例的商业价值;但价格下降一半,却会直接影响一项业务是否值得规模化部署。

AI模型开始分成两个市场

第一个市场,是逐渐商品化的通用智能。这里竞争的是调用成本、速度、稳定性和规模,适合文档分析、常规编码、后台Agent和批量自动化。只要质量达到要求,几分钱的差异乘以每天几百万次调用,就会变成很大的成本差异。

OpenAI称,Luna已经能以大约一年前前沿模型6%的单任务成本提供接近的能力,并达到近九倍速度。其发布数据中,Luna在Artificial Analysis Intelligence Index上的得分为51.2,接近GPT-5.5的54.8;Terra则达到55。这些数字来自OpenAI发布材料,不能代替企业自己的评测,但至少说明,去年还需要旗舰模型完成的一部分工作,今天已经可以交给最低价型号。

第二个市场,是仍然稀缺的前沿智能。这里出售的不只是Token,而是解决高不确定性问题的能力、更长时间的自主执行、更高成功率,以及关键时刻节省下来的时间。Sol继续维持每百万输入5美元、输出30美元,Fast mode按两倍价格收费,说明高价值任务仍然愿意为能力和延迟支付溢价。

因此,AI模型的未来未必是所有价格一起下降。更可能的情况是:旧的前沿能力不断下沉,进入越来越便宜的模型;每个时代最新、最强、最可靠的那一层能力,仍然保持高价。

开放权重模型削弱的,首先是普通智能的品牌溢价,而不是立刻消灭最强智能的稀缺溢价。只有当开放模型在复杂推理、长周期Agent任务和可靠性上也全面接近最强闭源模型时,Sol这一层的价格才会真正受到冲击。

AI也有自己的“摩尔定律”

2023年GPT-4刚开放API时,每百万输入Token约30美元,输出60美元。2024年GPT-4o在接近GPT-4 Turbo文本能力的同时,速度提高一倍、价格降低一半;到2025年的GPT-5,价格已经降到输入1.25美元、输出10美元。不同年代的模型不能视为同一种商品,但趋势很清楚:支付相近的钱,可以获得越来越强的能力;完成相近的任务,需要的成本也在下降。

这有点像AI行业自己的摩尔定律,但真正应该观察的不是每Token价格,而是每个成功任务的成本。一个模型单价很低,如果需要更多推理Token和反复重试,最终并不一定便宜;另一个模型单价更高,如果一次完成、工具调用更少,反而可能更经济。

未来企业不会只看排行榜和API价目表,而会计算一项工作成功完成需要多少时间、Token和人工返工。最强模型负责少数困难判断,便宜模型负责大量明确执行,开放权重模型则成为成本、数据和供应商风险之间的另一种选择。

这也会改变AI应用的技术架构。过去开发者可能为整个产品选择一个默认模型,未来更合理的方式,是让系统根据任务自动路由:简单问题调用低价模型,复杂问题升级到旗舰模型,敏感数据进入私有部署模型。真正有价值的产品能力,将不只是接入了哪个大模型,而是能否把不同模型组织成一套成本可控、结果可靠的系统。

价格下降之后,竞争才真正开始

对于OpenAI来说,Luna大幅降价可以扩大调用规模,也能减少开发者因为成本迁移到开放模型的动力;但当中间层能力越来越像标准化商品,真正的护城河就不能只是“我有一个更强的模型”。它必须转向更稳定的基础设施、更好的Agent框架、更丰富的工具和企业数据连接,以及ChatGPT、Codex这些直接触达用户的产品。

对于中国模型公司来说,开放权重和低价策略正在改变全球市场,但低价不自动等于商业成功。模型越大,推理成本越高;价格越低,越需要调用规模、云服务收入或企业服务来支撑持续研发。开放可以建立生态,也可以削弱竞争对手的定价权,但最终仍要回答收入从哪里来。

所以,OpenAI这次降价并不意味着前沿模型高价时代结束了。它真正说明的是,“足够强的智能”正在迅速失去稀缺性。开放权重模型、推理效率提升和基础设施竞争,会不断把昨天昂贵的能力推向今天的低价市场;模型公司则会把新的溢价放到更复杂的能力、更快的速度、更高的可靠性和更完整的产品上。

OpenAI把Luna降价80%,Sol却不降价,这两件事并不矛盾。它们展示了AI模型市场可能长期存在的结构:边界以内的能力会越来越便宜,边界之外的前沿智能仍然昂贵。

开放权重模型真正改变的,不是所有模型都会立刻降到同一个价格,而是这条边界向前移动的速度会越来越快。