日期: 2026年7月21日

Kimi K3之后,我第一次觉得美国有点输不起了

Kimi K3 发布之后,我原本以为接下来大家讨论的重点,应该还是模型本身,比如它到底有多强,Benchmark 是否可信,中国开放模型和 OpenAI、Anthropic 之间的差距到底缩小到了什么程度。但没想到,几天之后另一个话题先热了起来。Axios 报道称,特朗普政府内部正在重新讨论如何限制美国企业使用中国先进 AI 模型,包括通过实体清单、政府采购、安全警告和合规要求等方式,提高美国企业使用中国开放模型的门槛。实际上,这些讨论并不是 Kimi K3 出现之后才有,只是 Kimi K3 的发布,让原本已经存在的争论重新热了起来。截至目前,这仍然只是政策讨论,并没有形成正式禁令,但看到这条新闻的时候,我还是有一种挺奇怪的感觉:美国在 AI 这件事情上,好像开始有点输不起了。

当然,这并不是说美国已经输掉了 AI 竞争。今天的 OpenAI、Anthropic、Google 依然站在大模型能力的最前沿,NVIDIA 仍然掌握着最重要的算力基础设施,美国也依然拥有最成熟的资本市场、最强的人才吸引力和完整的 AI 产业链。Kimi K3 很强,DeepSeek、Qwen 这些中国开放模型进步也很快,但现在就说中国 AI 已经全面超过美国,显然还太早。真正让我觉得有些变化的,并不是技术排名本身,而是美国开始如何面对来自中国开放模型的竞争。过去我们对美国科技行业最深的印象之一,就是它的自信,你做出了一个更好的产品,那我就做一个更好的。Google 打败 Yahoo,Chrome 挑战 IE,iPhone 重构手机,Tesla 重新定义电动车,后来 OpenAI 又用 ChatGPT 改变了整个 AI 行业。硅谷最有魅力的地方,从来不只是技术强,而是那种相信创新和竞争最终会决定输赢的气质。

现在支持限制中国开放模型的人,最常提到的理由当然还是安全,比如网络攻击、生物风险、诈骗、模型滥用等等。这些风险确实存在,而且开放权重模型和闭源模型相比,也确实存在一个明显区别:模型一旦被下载到本地,原来的开发者就很难再像 API 那样监控调用、封禁账号或者增加安全限制。所以我并不认为所有模型都应该毫无条件开放,尤其当模型能力越来越强之后,如何控制高风险能力的扩散,本来就是一个值得认真讨论的问题。但另一方面,网络攻击、生物风险和模型滥用也并不是因为“开源”才出现的,Claude、GPT 这样的闭源模型同样可能被尝试用于寻找漏洞、生成恶意代码或者学习危险知识,闭源模型公司可以增加安全护栏,可以监控和封禁用户,但这些措施更多是在增加控制,而不是让风险本身消失。

也正因为这样,当“AI 安全”最后推导出的政策结果变成“限制中国开放模型”的时候,我觉得还是应该再多问一句,这里面到底有多少是在解决风险,又有多少是在保护现有商业利益。过去几年,大模型行业形成了一套非常清楚的商业模式:OpenAI、Anthropic 花巨额成本训练模型,然后通过订阅和 API 按 Token 收费,用户越依赖最强模型,公司收入越高,再投入更多资金训练下一代模型。这套逻辑成立的一个重要前提,是最好的模型是一种稀缺资源,你想使用最强的能力,就必须向拥有模型的人持续付费。但开放权重改变了这个前提,当 DeepSeek、Qwen、Kimi 这样的模型越来越接近 frontier 水平之后,企业会开始面对一个非常现实的问题,如果一个开放模型已经足够完成我的任务,我为什么一定要把数据交给 OpenAI 或 Anthropic,再按 Token 持续付费?我完全可以私有部署、微调、量化,也可以根据自己的业务选择不同模型,模型本身开始从一种稀缺商品,慢慢变成一种可以替换的基础能力。

这其实才是开放模型真正可能带来的冲击。Linux 当年并不是第一天就全面超过商业 Unix,MySQL、PostgreSQL 也不是一开始就在所有场景里都比商业数据库更强,但当这些开放产品达到“足够好”的程度之后,开放带来的低成本、可修改和生态效应,会逐渐改变整个市场结构。AI 很可能也会走类似的路径。如果中国开放模型一直只是便宜,但性能明显不如美国模型,其实根本不需要限制,因为企业自己就不会选择它们;真正让人开始紧张的,是这些模型既便宜、开放,又开始变得足够好了。一旦这个临界点出现,受到威胁的就不只是某一个模型,而是闭源模型长期依靠能力稀缺性建立起来的高毛利商业模式。

所以,如果美国未来真的通过实体清单、政府采购或者合规要求,让企业不敢使用中国开放模型,那么无论政策制定者主观上是不是为了保护 OpenAI 和 Anthropic,客观结果都会非常清楚:美国闭源模型公司少了一批最有威胁的竞争者。这也是为什么我觉得,这件事情不能简单只用“国家安全”来解释。安全当然重要,但当安全、产业利益和国家竞争恰好都指向同一个政策结果时,反而更应该警惕,因为这很容易让原本应该由市场决定的竞争,被政策提前决定。

美国过去几十年一直是全球化和自由市场最大的受益者之一,Apple、Microsoft、Google、Amazon、Netflix,包括今天的 OpenAI,都是从美国公司变成全球公司的。美国过去也经常批评其他国家市场不够开放,批评政府保护本土企业,批评行政力量干预正常竞争,这些批评很多时候确实有道理。但自由市场有一个很有意思的地方,当你一直赢的时候,相信自由竞争其实并不难,真正难的是,当别人开始有机会赢的时候,你还愿不愿意继续相信市场。如果美国模型在能力上遥遥领先,中国模型性能差、成本高、没有企业愿意用,那么根本不需要任何限制;只有当这些模型真的开始有竞争力,限制才会变得“有意义”。

也正因为如此,Kimi K3 之后出现的这些讨论,让我觉得有一种很微妙的角色错位。过去中国经常被认为更倾向于保护自己的市场,而美国代表开放和自由竞争,但至少在大模型这件事情上,中国公司正在把越来越强的模型权重直接开放出来,让全球开发者下载、部署和修改,而美国却开始讨论,美国企业是不是应该少用甚至不能使用这些模型。当然,这里面有复杂的国家安全问题,不能因此简单得出“中国更开放、美国更封闭”的结论,但这种反差依然值得思考。真正的问题并不是美国有没有权利保护自己的国家安全,美国当然有,而是当“国家安全”的边界不断扩大,最后开始覆盖越来越多具有竞争力的技术和产品时,自由市场到底还剩下多少空间。

我去过美国2次,感觉美国过去真正有吸引力的地方,不只是有钱和科技先进,而是有一种很特别的气质,自信、幽默,甚至有一点不在乎。别人做出了更好的东西,第一反应通常不是怎么禁止它,而是怎么做一个更好的。硅谷过去最经典的故事,本质上也都是后来者推翻原来的强者,如果 IBM、Microsoft、Yahoo、Nokia 当年都能够轻易通过规则把挑战者挡在门外,也不会有后来那么多伟大的公司。一个真正强大的创新体系,最重要的不是永远领先,而是即使有一天别人追上来了,仍然相信自己可以通过下一次创新重新领先。

我依然不认为美国已经输掉了 AI 竞争,恰恰因为美国现在依然拥有 OpenAI、Anthropic、Google、NVIDIA,依然拥有最强的人才、资本和产业基础,我才更加觉得奇怪:一个还在领先的人,为什么已经开始表现得像一个害怕输的人?Kimi K3 未必代表中国 AI 已经超过美国,半年以后也许又会有一个更强的模型出现,今天所有的 Benchmark 排名都会重新改写。但如果一个来自中国的开放模型,仅仅因为开始变得足够好,就已经让全球最强大的科技国家认真讨论是不是应该限制自己的企业使用它,那么至少说明了一件事情,真正的竞争已经来了。

而对于一个长期领先的人来说,真正值得证明的,从来不是有没有能力把对手挡在门外,而是在门一直开着的时候,自己还能不能继续赢。

这次真不慌了,Claude随时可以取消订阅

过去一年,Claude大概是AI Coding领域存在感最强的名字之一。

Claude 3.7之后,Claude 4、Claude 4.5再到后续模型,Anthropic几乎一直占据着编程模型第一梯队的位置。Claude Code的出现,又进一步放大了Claude模型在真实软件开发中的优势。从最初在Terminal里写代码,到后来增加Plan、Sub-agent、Skills、Hooks等能力,Claude Code逐渐从一个命令行工具变成完整的Coding Agent。

Codex也是类似的路径。随着GPT模型能力不断提高,OpenAI也开始把重点从“模型会不会写代码”,转向如何让模型独立完成一个完整的软件开发任务。

这两个产品很快成为AI编程领域的标杆,也让很多开发者开始产生一种过去很少有过的依赖。

这种依赖不是因为品牌忠诚,而是生产力。

在Reddit、X、GitHub以及各种开发者社区里,经常可以看到类似讨论:Claude Code很好用,但是账号、地区、额度和订阅政策的不确定性让人担心;Codex能力很强,但同样存在额度和平台依赖的问题。尤其对已经把Coding Agent融入日常开发流程的人来说,一旦习惯让Agent直接阅读整个项目、修改多个文件、运行测试、查找错误再继续修复,很难再退回以前复制代码到聊天窗口里问AI的方式。

所以过去大家担心Claude账号出问题,本质上并不是少了一个聊天机器人,而是暂时找不到同样好用的替代品。

但最近半年,这件事情正在发生变化。

国产模型终于跨过了“能不能用”的门槛

以前讨论国产模型和Claude、GPT的编程能力,最大的问题其实不是Benchmark差了多少分,而是落到真实项目里以后,体验差距往往比Benchmark看起来更大。

简单写一个函数、解释一段代码,大多数模型都可以完成。但进入一个几十万行代码的真实项目,让模型自己搜索文件、理解依赖、连续修改代码、执行命令、处理编译错误,再根据结果反复修正,差距就很容易暴露出来。

这也是为什么很长一段时间里,即使国产模型便宜很多,真正重度使用AI Coding的人还是会优先选择Claude或者GPT。生产力工具最重要的毕竟还是生产力,如果一个任务Claude Code一次能够完成,换一个工具需要人工来回纠正很多次,价格便宜的意义就没有那么大。

现在这种情况开始改变了。

GLM-5.2、Kimi K3陆续发布,Qwen3.8也开始进入市场,DeepSeek V4正式版同样值得期待。和一年以前相比,这一代国产模型已经明显不再停留在“会生成代码”的阶段,而是在长上下文、工具调用、Agentic Coding和长时间任务执行上快速进步。

最重要的变化并不是某个Benchmark超过Claude两分或者落后GPT三分,而是这些模型已经越来越能够真正参与软件开发。

过去国产模型和前沿闭源模型之间,很多时候是“能不能做”的差距。现在越来越变成“谁做得更好”的差距。

这两者其实完全不同。

只要进入“可以完成”的区间,替代关系就会开始发生变化。一个开发任务不一定非要Claude才能完成,可以使用GLM,也可以换Kimi、Qwen或者DeepSeek。模型之间的能力仍然有高低,但已经不像过去那样存在明显断层。

更重要的是,这些模型还在逐渐和具体的编程工具解耦。

一个模型可以接入不同的CLI、IDE和Agent Framework,一个Coding Agent也可以支持多个模型。模型开始越来越像AI Coding系统里的“发动机”,而不是整个产品本身。

一旦发动机可以替换,过去那种“Claude不能用,工作流就断掉”的焦虑自然会下降很多。

Claude Code真正领先的,已经不只是Claude

不过,如果只看到国产模型能力快速提高,就认为Claude Code和Codex很快没有优势了,也并不准确。

目前AI Coding真正明显的差距,已经越来越从Model转移到了Agent。

同样一个Claude或者GPT模型,放在普通聊天窗口里使用,和放进Claude Code、Codex这样的Coding Agent里,最终完成复杂开发任务的能力可以有很大区别。

原因在于,现在真正的AI编程已经不是简单的:

用户提出需求,模型生成代码。

真实的软件开发通常是一个很长的过程。Agent首先要理解项目结构,然后搜索相关代码,找到需要修改的位置,理解调用关系,制定方案,修改多个文件,运行编译或者测试,读取错误信息,再继续定位问题和修改。如果是一个复杂任务,中间还可能使用Git、浏览器、数据库、MCP工具,甚至启动多个Sub-agent分别处理不同工作。

模型当然是整个过程最重要的核心之一,但仅有模型并不能完成这一切。

把模型、工具、上下文和执行环境组织起来的这一层,就是现在越来越重要的Harness。

而让Agent不断执行“观察、思考、行动、获得反馈、继续行动”,直到任务真正完成,则是Loop Engineering。

这也是Claude Code和Codex现在真正领先的地方。

一个优秀的Coding Agent需要解决很多模型之外的问题。例如,一个大型项目不可能把所有代码一次性塞进Context,Agent必须知道什么时候搜索文件,什么时候读取源码,哪些内容值得长期保留,哪些内容应该在Context接近上限时压缩掉。

工具调用也是一样。什么时候应该使用grep,什么时候应该直接打开文件,什么时候运行完整测试,什么时候只运行局部测试,一个命令失败以后应该继续尝试还是改变方案,这些都属于Agent系统本身的能力。

还有一个非常关键的问题,是验证。

真正好用的Coding Agent不能只会写代码,还必须知道自己有没有写对。修改完成以后主动Build、Lint、Test,运行程序查看结果,发现问题以后重新修改,再次验证。这个不断反馈的循环,才让AI从代码生成器变成能够独立完成任务的Agent。

所以在很多开发者的实际评价中,经常会出现一种现象:两个模型在Benchmark上的差距并不大,但放进不同的Coding Agent以后,使用体验却可能差一个档次。

原因就在这里。

大家最终使用的从来不是一个裸模型,而是一整个系统。

国产AI Coding现在最大的短板,已经变成工具

这其实是一个很值得注意的变化。

过去国产AI Coding的问题首先是模型不够强,工具即使做得不错,上限也会受到限制。现在模型这一块正在迅速补齐,剩下更明显的差距开始集中到Harness和Loop Engineering。

目前国内已经出现了不少比较完整的AI编程产品,包括CodeBuddy、Qoder、TRAE,以及GLM、Kimi、Qwen等模型相关的CLI工具。和早期AI编程工具主要围绕代码补全、IDE聊天不同,这些产品现在也明显开始转向Agent。

它们已经可以阅读整个代码库、修改多个文件、调用Terminal、执行命令,并开始加入Plan、Sub-agent、MCP等能力。从产品方向来看,国内厂商和Claude Code、Codex已经没有本质上的路线分歧,大家做的都是同一件事情:让AI从“帮程序员写代码”,变成“直接帮程序员完成开发任务”。

真正的差距更多体现在工程成熟度上。

比如一个Agent执行一个复杂任务两个小时以后,还能不能保持最初的目标;Context越来越长以后,能不能正确保留关键的信息;中间执行失败以后,是不是能够主动换一种思路;面对一个大任务时,能不能合理拆分成多个小任务;多个Sub-agent之间怎么共享信息;代码修改完成以后,是否能够形成稳定的验证闭环。

这些事情单独看起来都不是什么特别惊人的功能,但最终决定Coding Agent是否好用的,恰恰就是这些细节。

Claude Code和Codex的优势,是它们已经通过大量真实用户和真实软件工程任务,把这些细节做成了一套越来越成熟的系统。

国产Coding Agent目前真正要追的,也正是这一层。

Harness的差距,可能比模型更容易追

训练一个前沿模型是极其昂贵而且复杂的事情。

需要大量GPU、数据、算法团队、训练基础设施和强化学习能力,而且竞争对手不会停下来等待。今天刚刚追上Claude,Anthropic下一代模型可能很快又出来了。

Harness不一样。

它当然也需要很强的工程能力,但很多问题已经从“未知问题”变成了“已知问题”。

今天一个先进的Coding Agent大概应该具备什么能力,行业实际上已经越来越清楚。

CLI、Plan模式、Sub-agent、MCP、Skills、Hooks、Sandbox、Git Worktree、Context Compaction、后台任务、自动测试和验证,这些方向已经被Claude Code、Codex以及其他产品不断验证。

后来者不再需要从零回答“AI编程工具应该长什么样”,而是可以直接学习已经被证明有效的设计,再根据自己的模型和用户场景快速迭代。

这和追赶基础模型的难度并不一样。

以前国内Coding Agent还有一个很现实的限制,就是即使Harness设计得不错,底层模型能力不足,整个系统仍然很难达到Claude Code的效果。

现在这个限制正在快速消失。

当GLM、Kimi、Qwen和DeepSeek逐渐进入前沿模型附近以后,Context管理优化一点、工具调用稳定一点、Loop设计成熟一点,都会直接反映到最终的产品体验上。

因此,我个人的判断是,未来半年国产AI Coding最值得关注的,可能并不是又有哪个新模型在Benchmark上超过Claude,而是CodeBuddy、Qoder、TRAE以及各家模型CLI会进化到什么程度。

这里说的“追上”,并不是所有Benchmark全面超过,也不是每一个复杂任务都比Claude Code和Codex更强,而是作为生产力工具,已经能够成为真正平替。

对于用户来说,这才是最重要的标准。

如果Claude Code是100分,国产工具只有50分,那么基本没有替代价值。但如果国产工具已经做到85分或者90分,同时模型选择更多、价格更低、使用限制更少,那么很多用户并不会为了最后那10分一直绑定在同一个平台上。

竞争往往并不需要把第一名彻底打败。

只需要让第一名不再不可替代。

Claude最重要的变化,是从“必须用”变成了“可以选”

这可能才是最近这一轮国产模型进步带来的最大变化。

Claude Code目前仍然是最成熟的Coding Agent之一,Codex同样处在第一梯队。对于重度开发者而言,它们在复杂任务、长时间运行、上下文管理和整体稳定性上的优势仍然存在,这一点没有必要回避。

但和一年前相比,整个市场的状态已经完全不同。

以前是Claude和GPT站在前面,后面隔着很长一段距离才是其他模型。Claude账号、额度或者订阅一旦出现问题,用户很难立刻找到体验相近的替代方案。

现在下面已经有GLM、Kimi、Qwen、DeepSeek,工具层还有CodeBuddy、Qoder、TRAE、OpenCode以及各种CLI和Agent Framework。

模型正在变得可以替换,Coding Agent也正在变得越来越开放。

这意味着用户不需要再把全部生产力绑定在一家公司、一个账号或者一个订阅上。

AI Coding过去两年的主要竞争,大家一直在看模型。Claude和GPT到底谁写代码更好,新模型在SWE-bench又提高了多少,成为每次模型发布时最受关注的话题。

但是当模型能力逐渐接近以后,下一阶段真正决定AI Coding体验的,很可能越来越不是模型本身,而是Harness、Loop Engineering和整个Agent系统。

这场竞争才刚刚开始。

Claude Code和Codex目前领先,但国内的模型和编程工具已经进入同一条赛道,而且追赶速度明显加快。未来半年到底能不能追上,这是一个判断,现在当然还不能当作事实。

但至少有一件事情已经和以前不同了。

现在即使Claude调整订阅、限制额度,甚至账号真的出现问题,也不再意味着AI Coding工作流就没有了替代方案。

Claude好用,当然可以继续订。

哪天不好用了,或者有更合适的选择,也可以取消。

这次确实不用那么慌了。