标签: Kimi

这次真不慌了,Claude随时可以取消订阅

过去一年,Claude大概是AI Coding领域存在感最强的名字之一。

Claude 3.7之后,Claude 4、Claude 4.5再到后续模型,Anthropic几乎一直占据着编程模型第一梯队的位置。Claude Code的出现,又进一步放大了Claude模型在真实软件开发中的优势。从最初在Terminal里写代码,到后来增加Plan、Sub-agent、Skills、Hooks等能力,Claude Code逐渐从一个命令行工具变成完整的Coding Agent。

Codex也是类似的路径。随着GPT模型能力不断提高,OpenAI也开始把重点从“模型会不会写代码”,转向如何让模型独立完成一个完整的软件开发任务。

这两个产品很快成为AI编程领域的标杆,也让很多开发者开始产生一种过去很少有过的依赖。

这种依赖不是因为品牌忠诚,而是生产力。

在Reddit、X、GitHub以及各种开发者社区里,经常可以看到类似讨论:Claude Code很好用,但是账号、地区、额度和订阅政策的不确定性让人担心;Codex能力很强,但同样存在额度和平台依赖的问题。尤其对已经把Coding Agent融入日常开发流程的人来说,一旦习惯让Agent直接阅读整个项目、修改多个文件、运行测试、查找错误再继续修复,很难再退回以前复制代码到聊天窗口里问AI的方式。

所以过去大家担心Claude账号出问题,本质上并不是少了一个聊天机器人,而是暂时找不到同样好用的替代品。

但最近半年,这件事情正在发生变化。

国产模型终于跨过了“能不能用”的门槛

以前讨论国产模型和Claude、GPT的编程能力,最大的问题其实不是Benchmark差了多少分,而是落到真实项目里以后,体验差距往往比Benchmark看起来更大。

简单写一个函数、解释一段代码,大多数模型都可以完成。但进入一个几十万行代码的真实项目,让模型自己搜索文件、理解依赖、连续修改代码、执行命令、处理编译错误,再根据结果反复修正,差距就很容易暴露出来。

这也是为什么很长一段时间里,即使国产模型便宜很多,真正重度使用AI Coding的人还是会优先选择Claude或者GPT。生产力工具最重要的毕竟还是生产力,如果一个任务Claude Code一次能够完成,换一个工具需要人工来回纠正很多次,价格便宜的意义就没有那么大。

现在这种情况开始改变了。

GLM-5.2、Kimi K3陆续发布,Qwen3.8也开始进入市场,DeepSeek V4正式版同样值得期待。和一年以前相比,这一代国产模型已经明显不再停留在“会生成代码”的阶段,而是在长上下文、工具调用、Agentic Coding和长时间任务执行上快速进步。

最重要的变化并不是某个Benchmark超过Claude两分或者落后GPT三分,而是这些模型已经越来越能够真正参与软件开发。

过去国产模型和前沿闭源模型之间,很多时候是“能不能做”的差距。现在越来越变成“谁做得更好”的差距。

这两者其实完全不同。

只要进入“可以完成”的区间,替代关系就会开始发生变化。一个开发任务不一定非要Claude才能完成,可以使用GLM,也可以换Kimi、Qwen或者DeepSeek。模型之间的能力仍然有高低,但已经不像过去那样存在明显断层。

更重要的是,这些模型还在逐渐和具体的编程工具解耦。

一个模型可以接入不同的CLI、IDE和Agent Framework,一个Coding Agent也可以支持多个模型。模型开始越来越像AI Coding系统里的“发动机”,而不是整个产品本身。

一旦发动机可以替换,过去那种“Claude不能用,工作流就断掉”的焦虑自然会下降很多。

Claude Code真正领先的,已经不只是Claude

不过,如果只看到国产模型能力快速提高,就认为Claude Code和Codex很快没有优势了,也并不准确。

目前AI Coding真正明显的差距,已经越来越从Model转移到了Agent。

同样一个Claude或者GPT模型,放在普通聊天窗口里使用,和放进Claude Code、Codex这样的Coding Agent里,最终完成复杂开发任务的能力可以有很大区别。

原因在于,现在真正的AI编程已经不是简单的:

用户提出需求,模型生成代码。

真实的软件开发通常是一个很长的过程。Agent首先要理解项目结构,然后搜索相关代码,找到需要修改的位置,理解调用关系,制定方案,修改多个文件,运行编译或者测试,读取错误信息,再继续定位问题和修改。如果是一个复杂任务,中间还可能使用Git、浏览器、数据库、MCP工具,甚至启动多个Sub-agent分别处理不同工作。

模型当然是整个过程最重要的核心之一,但仅有模型并不能完成这一切。

把模型、工具、上下文和执行环境组织起来的这一层,就是现在越来越重要的Harness。

而让Agent不断执行“观察、思考、行动、获得反馈、继续行动”,直到任务真正完成,则是Loop Engineering。

这也是Claude Code和Codex现在真正领先的地方。

一个优秀的Coding Agent需要解决很多模型之外的问题。例如,一个大型项目不可能把所有代码一次性塞进Context,Agent必须知道什么时候搜索文件,什么时候读取源码,哪些内容值得长期保留,哪些内容应该在Context接近上限时压缩掉。

工具调用也是一样。什么时候应该使用grep,什么时候应该直接打开文件,什么时候运行完整测试,什么时候只运行局部测试,一个命令失败以后应该继续尝试还是改变方案,这些都属于Agent系统本身的能力。

还有一个非常关键的问题,是验证。

真正好用的Coding Agent不能只会写代码,还必须知道自己有没有写对。修改完成以后主动Build、Lint、Test,运行程序查看结果,发现问题以后重新修改,再次验证。这个不断反馈的循环,才让AI从代码生成器变成能够独立完成任务的Agent。

所以在很多开发者的实际评价中,经常会出现一种现象:两个模型在Benchmark上的差距并不大,但放进不同的Coding Agent以后,使用体验却可能差一个档次。

原因就在这里。

大家最终使用的从来不是一个裸模型,而是一整个系统。

国产AI Coding现在最大的短板,已经变成工具

这其实是一个很值得注意的变化。

过去国产AI Coding的问题首先是模型不够强,工具即使做得不错,上限也会受到限制。现在模型这一块正在迅速补齐,剩下更明显的差距开始集中到Harness和Loop Engineering。

目前国内已经出现了不少比较完整的AI编程产品,包括CodeBuddy、Qoder、TRAE,以及GLM、Kimi、Qwen等模型相关的CLI工具。和早期AI编程工具主要围绕代码补全、IDE聊天不同,这些产品现在也明显开始转向Agent。

它们已经可以阅读整个代码库、修改多个文件、调用Terminal、执行命令,并开始加入Plan、Sub-agent、MCP等能力。从产品方向来看,国内厂商和Claude Code、Codex已经没有本质上的路线分歧,大家做的都是同一件事情:让AI从“帮程序员写代码”,变成“直接帮程序员完成开发任务”。

真正的差距更多体现在工程成熟度上。

比如一个Agent执行一个复杂任务两个小时以后,还能不能保持最初的目标;Context越来越长以后,能不能正确保留关键的信息;中间执行失败以后,是不是能够主动换一种思路;面对一个大任务时,能不能合理拆分成多个小任务;多个Sub-agent之间怎么共享信息;代码修改完成以后,是否能够形成稳定的验证闭环。

这些事情单独看起来都不是什么特别惊人的功能,但最终决定Coding Agent是否好用的,恰恰就是这些细节。

Claude Code和Codex的优势,是它们已经通过大量真实用户和真实软件工程任务,把这些细节做成了一套越来越成熟的系统。

国产Coding Agent目前真正要追的,也正是这一层。

Harness的差距,可能比模型更容易追

训练一个前沿模型是极其昂贵而且复杂的事情。

需要大量GPU、数据、算法团队、训练基础设施和强化学习能力,而且竞争对手不会停下来等待。今天刚刚追上Claude,Anthropic下一代模型可能很快又出来了。

Harness不一样。

它当然也需要很强的工程能力,但很多问题已经从“未知问题”变成了“已知问题”。

今天一个先进的Coding Agent大概应该具备什么能力,行业实际上已经越来越清楚。

CLI、Plan模式、Sub-agent、MCP、Skills、Hooks、Sandbox、Git Worktree、Context Compaction、后台任务、自动测试和验证,这些方向已经被Claude Code、Codex以及其他产品不断验证。

后来者不再需要从零回答“AI编程工具应该长什么样”,而是可以直接学习已经被证明有效的设计,再根据自己的模型和用户场景快速迭代。

这和追赶基础模型的难度并不一样。

以前国内Coding Agent还有一个很现实的限制,就是即使Harness设计得不错,底层模型能力不足,整个系统仍然很难达到Claude Code的效果。

现在这个限制正在快速消失。

当GLM、Kimi、Qwen和DeepSeek逐渐进入前沿模型附近以后,Context管理优化一点、工具调用稳定一点、Loop设计成熟一点,都会直接反映到最终的产品体验上。

因此,我个人的判断是,未来半年国产AI Coding最值得关注的,可能并不是又有哪个新模型在Benchmark上超过Claude,而是CodeBuddy、Qoder、TRAE以及各家模型CLI会进化到什么程度。

这里说的“追上”,并不是所有Benchmark全面超过,也不是每一个复杂任务都比Claude Code和Codex更强,而是作为生产力工具,已经能够成为真正平替。

对于用户来说,这才是最重要的标准。

如果Claude Code是100分,国产工具只有50分,那么基本没有替代价值。但如果国产工具已经做到85分或者90分,同时模型选择更多、价格更低、使用限制更少,那么很多用户并不会为了最后那10分一直绑定在同一个平台上。

竞争往往并不需要把第一名彻底打败。

只需要让第一名不再不可替代。

Claude最重要的变化,是从“必须用”变成了“可以选”

这可能才是最近这一轮国产模型进步带来的最大变化。

Claude Code目前仍然是最成熟的Coding Agent之一,Codex同样处在第一梯队。对于重度开发者而言,它们在复杂任务、长时间运行、上下文管理和整体稳定性上的优势仍然存在,这一点没有必要回避。

但和一年前相比,整个市场的状态已经完全不同。

以前是Claude和GPT站在前面,后面隔着很长一段距离才是其他模型。Claude账号、额度或者订阅一旦出现问题,用户很难立刻找到体验相近的替代方案。

现在下面已经有GLM、Kimi、Qwen、DeepSeek,工具层还有CodeBuddy、Qoder、TRAE、OpenCode以及各种CLI和Agent Framework。

模型正在变得可以替换,Coding Agent也正在变得越来越开放。

这意味着用户不需要再把全部生产力绑定在一家公司、一个账号或者一个订阅上。

AI Coding过去两年的主要竞争,大家一直在看模型。Claude和GPT到底谁写代码更好,新模型在SWE-bench又提高了多少,成为每次模型发布时最受关注的话题。

但是当模型能力逐渐接近以后,下一阶段真正决定AI Coding体验的,很可能越来越不是模型本身,而是Harness、Loop Engineering和整个Agent系统。

这场竞争才刚刚开始。

Claude Code和Codex目前领先,但国内的模型和编程工具已经进入同一条赛道,而且追赶速度明显加快。未来半年到底能不能追上,这是一个判断,现在当然还不能当作事实。

但至少有一件事情已经和以前不同了。

现在即使Claude调整订阅、限制额度,甚至账号真的出现问题,也不再意味着AI Coding工作流就没有了替代方案。

Claude好用,当然可以继续订。

哪天不好用了,或者有更合适的选择,也可以取消。

这次确实不用那么慌了。

Kimi卖爆之后,我发现AI可能不是一门互联网生意

Kimi K3发布之后,市场反响非常热烈,发布仅几天,Kimi就宣布暂时暂停新用户订阅,原因是过去48小时的需求已经逼近现有算力容量的极限,为了保证现有付费用户的使用体验,只能暂时停止接受新的订阅,同时加快增加算力,后续再分批开放。Kimi还准备将会员拆分为普通的Kimi Membership和面向编程场景的Kimi Code Membership,以便更精确地分配算力。一个互联网产品发布后,因为用户太少而失败很常见,但因为用户太多,甚至连愿意付费的用户都暂时不接了,这种情况就比较少见了。

前段时间GLM-5.2上线后也出现过类似的情况,Coding Plan一度很难订阅,随着算力增加才逐步放开,目前智谱已经围绕GLM-5.2提供Lite、Pro、Max等不同等级的Coding Plan,并通过5小时和周度使用额度来控制资源消耗。虽然Kimi和GLM遇到的具体问题不完全相同,但放在一起看,至少说明一个现实:中国大模型的能力正在快速提升,用户需求也随之增长,但高质量算力供给并没有办法以同样的速度增长。

不过,我觉得这件事真正值得讨论的,并不只是中国缺不缺算力,而是AI的商业模式可能和我们过去熟悉的互联网有很大的不同。我们习惯把OpenAI、Anthropic、Kimi、智谱看成互联网公司,把ChatGPT、Claude、Kimi看成新一代互联网产品,但如果从成本结构和规模经济来看,AI可能并不是一门典型的互联网生意。

一、互联网最重要的商业优势,是规模效应

我在之前写中国互联网二手车行业时,曾经专门讨论过规模经济的问题。一个行业是否具有好的规模效应,很大程度上取决于成本结构,如果固定成本占比高、变动成本占比低,随着产量不断增加,固定成本被越来越多的产品和用户分摊,单位成本就会不断下降,这也是互联网公司非常重要的商业优势。

开发一套软件需要投入大量研发成本,但软件一旦开发完成,再增加一个用户的成本非常低。微软开发Windows需要大量程序员,但不会因为多卖出一份Windows,就再重新开发一次;腾讯开发一款游戏之后,一百万用户下载和一千万用户下载,研发成本基本不会发生变化;淘宝增加一个消费者,也不需要为这个消费者单独建设一个商场。当然互联网业务同样需要服务器、网络、电力、客服和运营成本,规模扩大后这些成本也会增加,但和传统行业相比,其新增一个用户的边际成本非常低,很多数字产品甚至接近于零。

互联网平台还有另外一个非常重要的特点,就是网络效应。淘宝的买家越多,就越能吸引商家,商家越多,商品越丰富,又会吸引更多买家;微信的用户越多,每一个用户加入这个网络后获得的价值也越大。因此,互联网公司做大规模不仅能够降低单位成本,还可能增加单位用户创造的价值,也就是边际成本下降的同时,边际收益反而增加,这也是互联网行业经常出现赢家通吃的根本原因。

所以过去二十多年互联网创业有一个非常重要的逻辑,就是先做规模。早期可以免费,甚至通过补贴获取用户,只要能够快速建立用户规模和网络效应,后面总有机会找到商业模式。从Google、Facebook,到国内的腾讯、阿里、美团、滴滴,基本都遵循过类似的发展路径,用户增长在大部分情况下都是一件好事,因为新增用户带来的收益,最终会大于新增用户产生的成本。

但到了AI时代,这个逻辑开始发生变化。

二、AI的成本,会随着用户使用量持续增加

传统互联网产品提供的,大部分是已经存在的信息或者已经开发完成的功能。打开一个网页,是把已经存在的内容传输给用户;观看一部电影,是把已经制作完成的视频播放给用户;使用一个SaaS软件,大部分操作也是执行已经写好的程序逻辑。但大模型不一样,你问ChatGPT一个问题,它需要重新进行一次推理;让Claude写一段程序,需要重新计算;让Kimi阅读几十份资料并生成一份报告,同样需要消耗新的计算资源。

也就是说,AI每提供一次服务,都需要重新“生产”一次结果。用户数量增加一倍,在使用方式基本不变的情况下,需要完成的推理任务也会大幅增加;一个用户原来每天问10个问题,现在每天问100个问题,即使用户数量完全没有增长,平台消耗的算力同样会显著增加。从成本结构来看,这更像传统行业里的变动成本,而不是互联网最典型的近乎零边际成本。

当然,AI的成本并不是简单的严格线性增长,随着Batch、KV Cache、量化、MoE、投机解码等技术不断成熟,加上芯片性能提升、模型架构优化和大规模集群利用率提高,单位Token的推理成本会持续下降,同样的模型能力,几年后的成本很可能只有今天的一小部分。但这并没有改变AI的一个基本特征:每多生成一批Token,就仍然需要消耗新的计算资源。互联网可以把同一份软件和内容近乎零成本地复制给更多人,而AI每一次输出,本质上都是一次新的计算。

如果把大模型看成一家“智能工厂”,GPU、HBM、服务器、数据中心和电力就是生产资料,Token是中间产品,最后生产出来的是用户需要的文字、代码、图片、视频以及各种任务结果。从这个角度来看,AI虽然以软件和互联网产品的形态提供服务,但它背后的成本结构反而有点像制造业,用户使用得越多,就需要生产更多“智能”,也就意味着需要更多的生产资料。

这个差异对商业模式的影响非常大。互联网公司通常希望用户尽可能多地使用自己的产品,因为一个用户每天打开微信10次还是100次,对腾讯产生的新增成本差别并不会特别大,但一个用户每天调用AI 10次和100次,对AI公司的成本影响就非常直接。如果用户支付的是固定订阅费,那么还会出现一个比较麻烦的问题:用户创造的收入是固定的,但用户消耗的计算资源却没有上限。

三、Agent会把这个问题进一步放大

过去的大模型主要还是Chatbot模式,一问一答,一次推理可能几秒或者几十秒结束,所以单个用户产生的计算量相对有限。但现在AI正在快速从Chatbot向Agent发展,特别是AI Coding,已经从过去的代码补全、问答,发展到让Codex、Claude Code、Kimi Code这样的Agent自主阅读代码库、修改文件、运行命令、执行测试、发现错误后继续修改,一个复杂任务可能连续运行几十分钟甚至几个小时。

这意味着,未来衡量AI产品规模,仅仅看MAU、DAU可能已经没有太大意义。同样是一个月活用户,一个人每天只问几个简单的问题,另外一个人每天让Coding Agent工作五六个小时,两个人给平台带来的收入可能都是同样的订阅费,但产生的计算成本完全不同。这也是为什么现在几乎所有AI Coding产品都会设置5小时额度、周额度、速率限制或者不同等级的订阅套餐,本质上都是在解决同一个问题:固定的订阅收入,如何覆盖高度不固定的计算成本。

传统互联网和SaaS通常喜欢重度用户,因为用户使用越频繁,说明产品粘性越高,续费概率越大,而新增的服务成本并不会同步增加。但AI可能出现一个很有意思的现象,就是用户过于重度反而未必是一件好事。如果一个用户每个月支付20美元,却长期消耗50美元甚至100美元的推理成本,那么用户增长越快、使用越活跃,公司亏损反而可能越大,这种情况在传统互联网产品中比较少见。

所以AI公司面临的问题,不只是如何获得更多用户,而是如何控制每个用户使用智能的成本,这也是为什么OpenAI、Anthropic、Kimi、智谱都在不断调整额度、会员等级和模型使用策略。模型越强,用户越喜欢使用;Agent能力越强,用户让它工作的时间越长,而使用时间越长,背后的算力消耗也越高,这其实形成了一个和互联网规模效应完全不同的商业逻辑。

四、Kimi暂停订阅,也说明中国AI开始遇到算力瓶颈

再回到Kimi K3暂停订阅这件事情,最直接的问题当然还是算力。模型发布之后,用户和使用量可以在几天内增长几倍甚至几十倍,但GPU不可能在几天之内同步增加,购买芯片、建设数据中心、部署服务器、配置高速网络和电力都需要时间。特别是对于中国AI企业来说,高性能GPU的供应仍然受到限制,虽然美国已经开始允许部分H200向中国企业出货,但截至7月中旬实际出货数量仍然很少,路透社也将目前中国科技企业面临的状况直接描述为算力容量紧张。

国产算力这几年发展很快,华为昇腾、寒武纪、摩尔线程等都在加速进入大模型训练和推理市场,国产模型也越来越重视对国产芯片的适配,但模型能够运行在国产芯片上,和能够以足够低的成本、足够大的规模稳定服务几千万用户,还是两个不同的问题。以前我们讨论中国AI,更多关注的是能不能训练出和GPT、Claude竞争的模型,现在随着DeepSeek、Qwen、Kimi、GLM等模型不断进步,新的瓶颈正在从“能不能做出好模型”,转向“做出来以后能不能让足够多的人用”。

训练一个模型虽然需要巨大的计算资源,但训练毕竟是阶段性的,模型训练完成之后,这部分投入就结束了;推理却是持续发生的,只要用户在使用,就一直需要算力。特别是在Agent时代,一个Agent可能持续工作几个小时,未来如果每个人都有几个甚至几十个Agent同时工作,算力需求会比现在的Chatbot时代高得多。因此,从长期来看,训练决定一个模型能不能出现,而推理成本可能决定这个模型能不能真正成为一门大规模的生意。

五、开源可能也是一种分散算力成本的方式

这也让我重新思考开放权重模型的价值。上一篇文章里,我更多从生态的角度讨论Kimi K3开源,开放权重可以让开发者、云厂商、企业和创业公司基于模型继续开发,带动芯片、推理框架、Agent平台以及各种应用的发展。但如果从算力成本来看,开放模型还有另外一个价值,就是把原本集中在模型公司身上的推理压力分散到整个生态中。

如果一个模型只能通过官方产品和API使用,那么模型越成功,所有用户就越集中到官方服务器,用户增长的同时,模型公司必须不断购买GPU和建设数据中心,成功本身会带来巨大的资本开支。但开放权重之后,云厂商可以部署,企业可以私有化,第三方API平台可以提供服务,随着模型压缩和终端芯片的发展,未来还可能有越来越多的推理直接运行在个人电脑和手机上。

Linux今天运行在全世界无数服务器上,但这些服务器显然不需要由Linux的开发者购买。从这个角度看,开放模型未来可能也是类似的模式,模型公司负责训练和持续迭代一个足够好的基础模型,整个生态共同承担部署、推理和算力成本。因此,开放权重不仅可以促进创新和生态繁荣,也可能是一种更加适合AI成本结构的分发方式。

六、AI最终比拼的,可能是谁能更便宜地生产智能

过去几年,大家判断一家AI公司最重要的标准一直是模型能力,Benchmark是多少、Coding能力怎么样、Context有多长、推理能力强不强,但随着模型之间的能力差距不断缩小,我觉得未来还会出现一个越来越重要的指标,就是完成同样一件事情到底需要消耗多少计算资源,也就是生产一单位智能需要多少钱。

假设两个模型都能完成同样的软件开发任务,一个需要运行一个小时,另外一个只需要20分钟;一个必须运行在最昂贵的GPU上,另外一个可以运行在成本更低的芯片上;一个完成任务需要消耗1亿Token,另外一个通过更好的模型架构、Context管理和工具调用只需要3000万Token,那么即使两个模型最终完成任务的质量差不多,后者也显然具有更大的商业价值。因此未来AI公司的竞争,不会只是模型与模型之间的竞争,而会是模型、芯片、基础设施、推理效率和资本能力的综合竞争。

互联网时代,规模越大通常意味着单位成本越低、网络效应越强,所以“先做大再赚钱”成为互联网创业非常经典的发展逻辑。但AI可能没有这么简单,用户增长会带来收入,同时也会持续带来计算成本,如果收入增长赶不上算力消耗增长,规模越大未必越赚钱。因此,一家AI公司最终能不能建立真正可持续的商业模式,不仅取决于模型够不够强,还取决于单位智能的生产成本能不能持续下降,以及用户创造的价值能不能高于他消耗的算力成本。

当然,未来AI的单位计算成本一定还会继续快速下降,芯片会越来越快,模型会越来越小、越来越高效,但与此同时,人类对智能的需求也会不断增长。以前我们只是让AI回答几个问题,现在已经开始让AI连续几个小时写代码、做研究、操作电脑,未来可能是几十亿个Agent每天24小时不停工作,所以即使单位智能的成本下降了,人类对智能的总需求也可能增长得更快。

Kimi K3发布后因为需求过大而暂停新订阅,表面上看只是一次“卖爆”之后的甜蜜烦恼,但背后反映的可能是AI行业一个非常重要的商业问题。过去互联网通过数字化,把信息和软件的复制成本降到了接近于零,从而创造了巨大的规模经济;AI则是在把智能变成一种可以规模化生产的商品,但每生产一份智能,目前仍然需要消耗真实的芯片、电力和计算资源。

所以,我越来越觉得,AI看起来像互联网,但可能并不是一门传统的互联网生意。未来真正决定AI公司胜负的,也不只是能不能做出最聪明的模型,而是谁能够以最低的成本,把足够好的智能提供给最多的人。当模型能力逐渐不再稀缺之后,廉价、稳定、规模化的智能供给能力,可能才是AI时代真正的护城河。

当中国开始开源最强模型,OpenAI和Anthropic的护城河还剩什么?

7月17日,月之暗面发布了最新的Kimi K3模型,这个模型很快在国内外AI圈引起了很大关注。Kimi K3总参数达到2.8万亿,在Coding、Agent、长上下文等方面的表现已经进入目前全球最强模型的第一梯队,Artificial Analysis给出的 Intelligence Index 得分为57分,而且在一些编程相关的公开评测中表现非常突出。更值得关注的是,月之暗面宣布将在7月27日前发布Kimi K3的完整模型权重。

前几天我写了一篇《最强的模型,不一定能赢:AI Coding开始拼“好用”了》,主要讨论的是,当GPT、Claude、Gemini这些模型的能力逐渐接近以后,单纯比较哪个模型跑分更高已经没有那么大的意义,真正决定用户选择的,会逐渐变成产品体验、价格、额度、工具生态等因素。

Kimi K3的发布,让我觉得还可以再往后思考一步。

如果有一天,全球最强的AI模型不再只掌握在OpenAI、Anthropic、Google这样的少数几家公司手里,而是有大量能力相近的开放权重模型可以自由部署、修改和使用,那么AI行业会发生什么?

这可能比Kimi K3在某个排行榜上超过Claude或者GPT更加值得关注。

因为一个模型从90分提高到95分,只是技术能力的提升;但一个90分的模型从封闭变成开放,影响的可能是整个产业的创新方式、商业模式和利益分配。

需要说明的是,严格意义上来说,开放权重并不完全等于开源。开源通常还包括训练代码、训练数据、训练方法等更多内容,而Kimi K3目前宣布的是开放完整模型权重,所以本文所说的“开源”,更多是指现在AI行业里经常讨论的开放权重模型。Kimi官方目前也明确表示,完整权重将在7月27日前发布。

开放最大的价值,不是免费,而是让更多人参与创新

很多人说到开源模型,首先想到的就是便宜,可以自己部署,不需要再向OpenAI或者Anthropic支付昂贵的API费用。但我觉得,开放最大的价值并不是免费,而是让更多的人拥有参与创新的机会。

使用一个闭源模型,本质上是在别人制定的规则下开发产品。模型提供什么能力、API怎么收费、上下文有多长、哪些功能可以使用、模型什么时候升级或者下线,最终的决定权都掌握在模型厂商手里。开发者当然可以基于GPT或者Claude做很多创新,但这个创新始终是在OpenAI和Anthropic划定的边界里进行的。

开放权重之后,情况就不一样了。

开发者可以对模型进行量化,可以针对某个行业进行微调,可以改变推理方式,可以针对不同的芯片做优化,可以把模型部署到企业自己的服务器里,也可以基于这个模型继续训练新的模型。医疗公司可以训练医疗模型,金融公司可以针对自己的业务进行微调,汽车厂商可以把模型放进汽车,机器人公司可以把模型和机器人结合起来,芯片公司也可以针对模型设计更加高效的推理方案。

这些事情不需要原来的模型公司一件一件去做。

这也是我认为开放最有价值的地方。

一家公司无论多么强大,它拥有的人才、资金和资源终究是有限的,它不可能理解所有行业,也不可能把所有应用场景都做一遍。但是把一个足够强的基础模型开放出来以后,全世界的开发者、企业和科研机构都会基于它进行创新,其中一定会出现很多连原来模型开发者自己都没有想到过的应用。

互联网之所以能够发展到今天,很重要的原因就是开放。HTTP、HTML、Linux以及大量开源软件,让任何一个开发者都可以在已有技术的基础上继续创新,而不需要重新发明一遍轮子。

所以我一直认为,真正能够推动技术快速发展的,一定是开放。

封闭可以让一家公司获得更大的短期商业利益,但是开放能够让更多人参与进来,从而放大整个产业的创新速度。

Linux可能是一个很好的参考

AI开放模型的发展,让我想到Linux。

Linux本身并不是一个特别成功的传统商业软件,如果按照卖软件许可证的标准来看,它甚至没有微软Windows那么好的商业模式。但是今天全球绝大多数互联网服务器、云计算平台、超级计算机,以及Android等大量系统,底层都与Linux生态密不可分。

Linux真正成功的地方,不是Linux公司赚了多少钱,而是它成为了整个产业的基础设施。

因为Linux开放,所以Intel、AMD、IBM、NVIDIA这些公司都可以针对它做优化;服务器厂商可以使用它,云计算公司可以使用它,软件公司也可以基于它开发各种产品。最后形成的商业价值,远远超过了Linux操作系统本身。

AI未来很可能也会出现类似的情况。

现在大家还在讨论GPT-5.6比Claude强多少,Kimi K3又在哪个排行榜超过了谁,但如果几年之后,模型能力普遍达到了一个足够高的水平,企业可能不会再像今天这样特别关心底层到底是哪一个模型。

就像今天我们开发一个互联网系统,很少有人会把“Linux到底比另一个操作系统强多少”作为最核心的问题。大家真正关心的是这个系统是否稳定、成本是多少、生态是否成熟、有没有足够多的软件和服务支持。

AI模型最终也可能逐渐变成这样的基础设施。

企业会在基础模型之上选择推理平台、Agent框架、数据库、云计算、芯片、安全系统以及各种行业应用,真正巨大的商业价值会慢慢向整个产业链扩散。

所以开源模型对于AI行业最大的意义,并不是又多了一个免费的ChatGPT,而是可能逐渐改变AI产业的价值分配。

模型本身的价值可能下降,但围绕模型形成的整个生态价值会变得更大。

开放模型会带动一整条新的产业链

从这个角度看Kimi K3,我觉得真正值得观察的并不是月之暗面以后通过K3能赚多少钱,而是Kimi K3开放以后,围绕它会出现多少新的东西。

Kimi K3有2.8万亿参数,这么大的模型并不是普通公司买几块显卡就可以轻松部署,所以权重开放并不等于使用成本为零。恰恰因为模型很大,如何量化、如何降低显存占用、如何提高推理速度、如何降低运行成本,本身就会形成大量技术需求。

然后是芯片。

NVIDIA可以针对它做优化,AMD可以做,国内的AI芯片企业同样可以做。不同的硬件厂商会想办法让这些模型在自己的芯片上跑得更快、更便宜,这会推动整个AI算力产业的发展。

云计算公司也会提供各种托管方案,推理平台会做更好的部署工具,软件公司会开发微调、量化、模型管理、安全审计等各种产品,再往上就是大量行业应用。

医疗、金融、法律、制造、科研、教育,每一个行业都可能在基础模型上形成自己的模型和Agent。

对于创业公司来说,这个变化同样非常重要。

以前做一个AI产品,最简单的方法就是调用OpenAI或者Anthropic的API。刚开始用户不多的时候,成本可能不是问题,但是当用户规模越来越大,模型API就会成为非常重要的一项成本,而且整个产品事实上也被绑定在了模型供应商身上。

开放模型提供了更多选择。

企业可以使用Kimi,也可以使用Qwen、DeepSeek,甚至同时使用多个模型,根据不同任务自动选择最合适的模型。模型从一个不可替代的核心供应商,逐渐变成可以替换的基础设施。

只要这种趋势形成,围绕模型的投资和创业机会一定会越来越多。

这和Linux的发展其实非常像。Linux自己没有拿走整个产业最大的利润,但它创造了一个极其庞大的生态,IBM、Red Hat、AWS、Google、NVIDIA以及无数软件公司,都从这个生态里获得了巨大的商业机会。

所以开放真正放大的,不是一个模型公司的价值,而是整个产业的价值。

对很多企业来说,真正重要的是控制权

开放模型还有一个非常重要的市场,就是对数据比较敏感的企业。

普通消费者其实不太关心一个模型到底是开源还是闭源,我自己平时使用ChatGPT、Claude、Gemini,也不会因为某个模型开源就一定使用它,最终还是哪个产品好用就用哪个。

但企业完全不同。

特别是医疗、金融、政府、制造业、科研机构,以及拥有大量核心知识产权的大型企业,它们拥有的很多数据根本不适合发送给外部模型。

比如患者病历、银行交易数据、企业源代码、研发资料、客户数据和商业机密,这些数据对于企业来说可能比模型本身更加重要。

使用OpenAI或者Anthropic的云端API,本质上还是要让数据离开企业自己的环境,虽然这些公司会提供各种安全、隐私和企业级的数据保护措施,但对于一些高度敏感的业务来说,企业仍然会希望把数据完全控制在自己手里。

开放权重模型提供了一种完全不同的方式:不是把数据送到模型那里,而是把模型放到数据那里。

模型可以部署在企业自己的数据中心,甚至运行在完全隔离的内部网络里,数据是否保存、日志保留多久、模型什么时候升级、哪些人可以访问,都由企业自己决定。

当然,我并不认为自己部署就一定比OpenAI更加安全。很多企业自己的IT安全能力可能还不如这些大型AI公司,自己部署之后也会出现运维、安全漏洞、权限管理等一系列问题。

但两者最大的区别是控制权。

对于很多大型企业和数据敏感行业来说,控制权本身就是价值。

当开放模型能力只有闭源模型60%、70%的时候,企业可能还会为了模型效果选择闭源模型;但如果开放模型已经能够达到90%、95%,很多企业的选择就可能发生变化。

因为对于实际业务来说,很多时候并不需要世界上最强的模型,只需要一个“足够好”的模型。

OpenAI和Anthropic真正受到冲击的是定价权

过去几年,OpenAI和Anthropic能够建立非常高的商业价值,一个非常重要的原因就是最先进的AI能力是一种稀缺资源。

世界上只有少数几家公司能够训练出最好的模型,所以这些公司拥有很强的定价权。

更强的模型价格更高,更长的上下文价格更高,更强的推理能力也可以卖得更贵。

这个商业模式能够成立,最重要的前提就是其他人做不出来。

如果OpenAI的模型是100分,而市场上其他模型只有60分,那么为了这40分的巨大能力差距,客户当然愿意支付很高的费用。

但如果开放模型已经做到90分甚至95分,问题就完全不同了。

企业会开始计算,为了最后5分或者10分的能力提升,是否值得长期支付更高的API费用,是否值得把自己的业务和数据绑定在一家模型厂商身上。

对于一些非常复杂的任务,答案可能仍然是值得,最强模型依然有非常大的价值。

但是对于大量普通业务,90分可能已经完全够用了。

技术发展经常会出现这样的阶段。

早期大家追求的是“最好”,因为产品之间的能力差距非常大;但是当整个行业发展到一定程度以后,市场就会逐渐进入“足够好”的阶段。

智能手机是这样,电脑是这样,服务器也是这样。

当一个普通人买一台电脑的时候,他其实已经不太关心CPU性能到底提高了10%还是15%,因为对于大多数工作来说,性能早就够用了。

AI模型未来也一定会遇到这个问题。

当模型普遍已经足够聪明以后,用户选择产品的标准就会从“谁最聪明”,转向价格、速度、稳定性、产品体验、数据安全以及生态。

这也是开放模型对OpenAI和Anthropic商业模式最大的冲击。

不是明天大家都不用GPT和Claude了,而是模型本身越来越难长期保持今天这样的高溢价。

OpenAI真正要担心的,也不是ChatGPT少了几个用户

很多人看到Kimi K3这样的模型发布,首先想到的是,它会不会抢走ChatGPT或者Claude的用户。

我觉得短期内不会有太大的影响。

ChatGPT已经形成了非常强的品牌和用户习惯,普通用户不会因为看到某个Benchmark排名变化,就马上换掉自己每天使用的产品。更何况像Kimi K3这么大的模型,即使权重开放,也不代表普通用户可以很方便地在自己的电脑上运行。

OpenAI真正需要担心的,是开发者和企业会不会逐渐减少对OpenAI的依赖。

过去几年,很多AI创业公司开发产品时,最自然的选择就是OpenAI API,因为它的模型最好,生态最成熟,开发也最方便。

但是现在情况已经发生变化。

Claude、Gemini、Kimi、Qwen、DeepSeek以及越来越多模型都可以作为选择,很多新的AI应用在架构设计时,已经不会把自己完全绑定在某一个模型上,而是从一开始就考虑模型路由和模型替换。

哪个模型效果好就用哪个,哪个便宜就用哪个,有些任务使用闭源模型,有些任务使用开放模型。

这才是对OpenAI更加长期的影响。

因为一个消费者不用ChatGPT,OpenAI失去的是一个订阅用户;但如果未来大量开发者在构建产品的时候,不再默认选择OpenAI,那么OpenAI失去的是整个应用生态。

当年的微软为什么如此重视Windows开发者?

因为只要所有软件都首先为Windows开发,用户自然就会继续使用Windows。

AI也是一样。

谁拥有开发者,谁就更容易成为下一代技术平台。

所以开放模型真正争夺的,并不只是模型市场,而是开发者。

Anthropic受到的压力可能更直接

相比OpenAI,我觉得Anthropic受到开放模型的压力可能更加直接。

OpenAI至少已经拥有ChatGPT这个全球最大的AI产品之一,有非常强的消费者入口、品牌和用户习惯,同时还在发展Codex、Agent以及企业服务。

Anthropic目前最强的优势主要集中在模型能力、Coding和企业开发者市场,尤其Claude Code这两年的发展非常快,已经成为AI Coding领域最重要的产品之一。

但恰恰是Coding,可能也是开放模型最容易快速追赶的领域。

因为代码和普通内容不同。

一篇文章写得好不好,很难有完全客观的标准,但一段代码能不能运行、Bug有没有修复、测试能不能通过,是可以自动验证的。

这使得Coding模型更加容易通过大量自动化方式进行训练、强化学习和评测。

Kimi K3发布后之所以引起这么大的关注,一个重要原因也是它在Coding、Agent等方向已经表现出了很强的竞争力。Kimi官方也把Agentic Coding作为K3的核心方向之一,而第三方评测已经将它放在当前高性能模型行列。

另外,代码本身又是企业最敏感的数据之一。

很多公司愿意让AI帮助程序员写代码,但是并不一定愿意把整个核心代码库长期交给第三方模型公司。

当开放模型能力不够的时候,大家只能接受这种取舍。

但如果开放模型的Coding能力已经足够好,企业就会很自然地考虑私有化部署。

所以从这个角度来看,开放模型对Anthropic的冲击,可能比对OpenAI更加直接。

当然,开源也并不意味着一定会赢

写到这里,很容易得出一个结论,未来开源模型一定会打败闭源模型。

我觉得没有这么简单。

首先,开放权重不等于免费。

Kimi K3有2.8万亿参数,即使采用MoE等架构,要真正部署这样规模的模型,仍然需要非常昂贵的算力和复杂的工程能力。模型权重可以免费下载,但电费、GPU、数据中心和工程师都不是免费的。

很多中小企业最后算下来,直接购买OpenAI或者Anthropic的API,可能反而更加便宜和方便。

其次,模型本身只是AI产品的一部分。

ChatGPT真正强大的地方已经不仅仅是GPT模型,而是产品、用户、数据、工具、Agent以及整个生态。

Claude也是一样。

Claude Code之所以受到程序员欢迎,并不是因为大家每天拿Claude去跑Benchmark,而是因为整个Coding体验确实好用。

这也是我上一篇文章里想表达的观点:最强的模型,不一定能赢。

未来OpenAI和Anthropic真正的护城河,可能越来越不是“我的模型比你高几分”,而是产品、入口、生态、企业服务以及持续创新的能力。

比如ChatGPT已经拥有庞大的用户群和品牌认知,这种分发能力非常难复制;Anthropic在Coding领域形成的开发者口碑和Claude Code产品体验,也不是简单开放一个模型权重就能够替代的。

大型企业购买AI服务,也不只是购买模型能力,还需要SLA、安全合规、稳定运行、技术支持以及明确的责任主体。

这些都是闭源商业公司非常重要的优势。

所以开放模型并不会直接填平OpenAI和Anthropic的所有护城河。

但它会迫使这些公司重新挖护城河。

过去的护城河是模型。

未来的护城河可能必须变成产品和生态。

中国AI选择开放,可能是一条非常聪明的路

最后再回到Kimi K3。

这几年中国AI模型有一个很明显的特点,就是越来越重视开放。

从DeepSeek到Qwen,再到Kimi,中国最有竞争力的一批模型都在积极建设开放模型生态,而美国目前最顶级的GPT和Claude仍然是闭源模式。Reuters在K3发布后的报道中,也把这次发布放在中国开放模型快速逼近美国领先闭源模型的大背景下讨论。

这背后未必是谁更加理想主义,而是不同企业在不同市场位置上的选择。

如果你已经拥有全球最多的用户、最强的品牌和最大的开发者入口,当然希望把最核心的技术留在自己手里,然后通过API和订阅获得最大的商业利润。

但是如果暂时还没有这样的市场优势,开放可能反而是最快建立生态的方法。

Google当年开放Android,很重要的原因就是需要快速对抗已经占据智能手机先发优势的苹果iOS。Android本身免费,却迅速吸引了三星、小米、OPPO、vivo以及全球大量手机厂商,最终形成了世界上最大的移动操作系统生态之一。

AI模型可能也会出现类似的竞争。

中国模型真正需要争夺的,不一定是每一次Benchmark都超过GPT。

今天第一,过几个月可能又变成第二,这种排名其实没有那么重要。

真正重要的是,未来全球有多少开发者会使用中国模型,有多少AI创业公司建立在这些模型之上,有多少企业会私有化部署这些模型,有多少芯片、云计算、Agent框架和行业应用会围绕这些模型进行优化。

如果有一天,大量全球AI应用的底层都是Qwen、DeepSeek或者Kimi,那么即使OpenAI仍然拥有世界上最强的单一模型,整个AI产业的格局也已经发生了变化。

这才是开放真正的力量。

AI发展的第一阶段,大家竞争的是谁能做出最强的模型;现在已经开始进入第二个阶段,大家开始竞争谁能做出最好用的产品;再往后,很可能还会进入第三个阶段——谁能建立最大的生态。

这三件事情其实完全不同。

OpenAI可能拥有最强的模型,Anthropic可能拥有最好用的Coding产品,而开放模型可能拥有最多的开发者、最多的衍生模型、最多的硬件适配,以及最多由全世界开发者共同创造出来的应用。

Linux没有在个人电脑市场上打败Windows,但它最终成为了互联网和云计算时代最重要的基础设施之一。

AI会不会重演类似的故事,现在还无法确定。

但当Kimi、DeepSeek、Qwen这些中国模型越来越接近全球最先进的模型,同时又选择把权重开放给整个市场时,OpenAI和Anthropic需要考虑的问题,可能已经不只是下一代模型还能领先多少了。

而是当最先进的智能逐渐不再稀缺,当越来越多“足够好”的模型可以被任何企业拥有、部署和修改之后,原来建立在模型能力之上的高价格、高利润和封闭生态,还能够维持多久?

只有开放,才能让更多人参与创新,而当足够多的人开始在同一套开放技术上创新的时候,最终形成的力量,往往会远远超过技术本身。