一个199块的模型,把自己给挤爆了

一个199块的模型,把自己给挤爆了

月之暗面 Kimi K3 上线48小时就因算力挤兑暂停新订阅。一个开放权重、便宜到人人都想用的模型,反而被自己的成功噎住。这背后是杰文斯悖论,是模型可以开源、算力永远不能开源的残酷真相。

发布于 2026/07/20
更新于 2026/07/20
11 分钟阅读
2 次阅读

这几天我看到一件特别有趣的事。一个产品,火到不敢卖了。

月之暗面的 Kimi K3 上线才 48 小时,官方就发了个公告,说算力紧缺,即日起暂停 C 端新用户订阅,把所有算力全部投进去,只保障已经付过钱的老用户。你没看错,不是卖不动降价促销,是卖太好,好到只能挂上「今日售罄」的牌子,把想掏钱的新人挡在门外。

我第一反应是,这年头还有这种烦恼。多少 AI 产品愁的是没人用,烧了几个亿做增长,拉来的用户第二天就流失。Kimi 这边倒好,反过来了,用户来得太猛,猛到系统扛不住,只能主动踩刹车。

但你要是把这件事只当成一条「国产模型真争气」的喜讯来读,那就把它看小了。我越琢磨越觉得,这背后藏着一个反直觉的循环,而且这个循环不是 Kimi 一家的偶发事故,它是接下来整个 AI 行业都要反复上演的剧本。今天我想把这条线掰开跟你聊聊。

先说说 K3 到底什么来头,值不值得这么疯抢。

这是一个 2.8 万亿参数的 MoE 架构模型,带 100 万 token 的上下文窗口。光看数字你可能没概念,我给你一个更直观的坐标。在 Frontend Code Arena 这个前端编码榜上,K3 拿了 1679 分登顶,力压 Claude Fable 5 和 GPT-5.6 Sol,七个前端细分赛道拿下六个第一[Kimi K3 登顶前端编码榜]。连彭博社都出来说话了,说这个模型挑战了「中国 AI 落后美国」的固有认知,有专家判断中美顶尖模型的差距,已经从六到九个月,缩短到了两到三个月[月之暗面 Kimi K3 登顶全球榜单]

一个开放权重的模型,在最硬核的编码战场上,把两家闭源巨头按在了地上。 这就是它凭什么让人半夜蹲点抢订阅的原因。

我认识几个天天用 AI 写代码的朋友,前几天他们的群里就炸了。有人说 K3 的前端能力已经好到「打到头」了,一些用来测模型的题库,撑了两个月就被它刷穿,只能作废重出[Kimi-K3 编程实测]。这种体感的进步,是跑分数字给不了你的。当一个每天靠它吃饭的人,愿意为它半夜蹲点、愿意为它掏钱包月,那才是最硬的口碑。K3 火起来不是营销吹出来的,是实打实用出来的。

好,现在你理解了它有多强,我们来看挤兑现场有多壮观。

K3 上线两天,就冲上了 OpenRouter 的第十大模型,一天要处理大约 1400 亿个 token。但代价是,它的吞吐量从每秒 30 个 token 一路掉到 13 个,端到端延迟飙到了 72 秒[Kimi K3上线2天成OpenRouter第10大模型]。你能想象吗,你问它一个问题,得等一分多钟才开始出字。这不是模型笨,是排队的人实在太多,算力这条管子已经被彻底堵死了。

于是就有了那个「售罄」的公告。官方说得很坦诚,GPU 算力逼近上限,现有订阅用户不受影响,新订阅先停一停,团队正在加速扩容,以后会分批重新开放[Kimi K3 需求超预期,月之暗面暂停新订阅申请]。有意思的是,评论区一片「赢麻了」的声音,前几天花 199 开通订阅的人,现在感觉自己像是抢到了末班车的幸运儿。一个订阅服务能让用户产生「幸好我下手早」的稀缺焦虑,这种事我上一次见到,还是抢演唱会门票。

聊到这里,如果只是感慨一句「太火爆了」,那我们跟朋友圈的转发也没区别。

我们普通人的直觉是这样的,开源+便宜=人人都能用。K3 是开放权重的,它的 API 定价里,输入每百万 token 缓存命中只要 2 块钱[月之暗面 Kimi 暂停 C 端新用户订阅]。这么便宜,这么开放,按理说应该是雨露均沾,大家都能轻松用上才对。

可现实恰恰相反。便宜的只是你调用它的那个价格,贵的是它背后那堆滚烫的铁。有人算过一笔账,要服务一套量化版的 K3,最少得配 8 块 B300 芯片,差不多 50 万美元;要是想用推荐的 GB300 NVL72 机架,得砸大约 400 万美元[Kimi K3上线2天成OpenRouter第10大模型]。模型权重你可以免费下载,但让这个权重真正跑起来、还能同时服务几百万人的那套硬件,一分钱都不会少。

于是一个诡异的循环就出现了。模型越便宜越好用,想用的人就越多;想用的人越多,算力就越紧张;算力越紧张,就越买不到。便宜,亲手制造了稀缺。 你以为降价是为了让更多人进来,结果是把门给挤爆了。

便宜制造稀缺的循环

这个循环,经济学里有个特别古老的名字,叫杰文斯悖论。一百多年前,人们以为蒸汽机效率提高、烧煤更省了,煤的消耗就会下降。结果完全反了,因为煤变得更划算,用煤的场景反而爆炸式增长,总消耗不降反升。今天的 token 就是那时候的煤。有个投资人说得很直白,token 成本下降根本不会减少总支出,反而因为你会写更多代码、审查更多安全、处理更大的数据集,把推理需求越推越高,GPU 集群持续满载,形成「成本越低、需求越大」的循环[AI成本下降反推推理需求与GPU需求增长]

我特别喜欢这个煤的比喻,因为它一下子把 AI 从一个虚头巴脑的科技话题,拉回到了最朴素的物理世界。你用得越爽、越顺手、越离不开,你在背后消耗的电和算力就越多,不是少。 过去我们总觉得技术进步会让资源越用越省,可 AI 这东西偏偏是个无底洞,它的效率每提升一分,人类给它派的活就多十分。你以为省下来的算力可以歇一歇,结果它立刻被更多的新需求填满,一秒都不带停的。

想通了这一层,你再回头看 Kimi 的暂停订阅,它就不是一次运营事故了,它是这个循环第一次以肉眼可见的方式,砸在了一家公司脸上。

那么问题来了,在这个循环里,谁是真正闷声发财的人?

答案是,攥着算力的那些人。

前沿模型的价格,三年只降了 4 到 5 倍,可市场对它的需求,涨了超过三个数量级,也就是一千倍以上[Kimi K3上线2天成OpenRouter第10大模型]。供给端和需求端之间,裂开了一道巨大的鸿沟。谁能填上这道鸿沟,谁就能收取过路费。而能填上它的,不是更聪明的模型,是更多的卡。

更扎心的是一个对比。Stability AI 的联合创始人 Emad Mostaque 指出,美国公司比如 Modal、Fireworks、Baseten,能以中国竞争对手十分之一的成本去部署同一个 Kimi K3,因为它们能拿到最先进的英伟达和 AMD 芯片[美国公司可用Kimi K3,成本仅为中国对手十分之一]。同样一个开源模型,权重是全世界共享的,可跑起来的成本能差十倍。差在哪?差在你手里那张卡是什么型号,差在你能不能拿到最好的硬件。

模型可以开源,算力永远不能开源。 这句话我觉得是理解这轮 AI 竞赛最关键的一把钥匙。

模型可以开源,算力永远不能开源

杨植麟自己也说,Kimi K2 的训练总成本只花了 460 万美元,通过极致优化、线性注意力和子代理这些架构创新,小团队也能抹平和大厂的资源差距[Kimi K2训练仅花460万美元]。训练端,聪明可以省钱。可到了推理端,到了要同时伺候几百万张嘴的时候,聪明救不了你,只有卡能救你。

所以你看,这场竞赛表面上比的是谁的模型更聪明,榜单谁登顶,参数谁更大。但水面之下,真正决定生死的,是谁烧得起,谁扩得动。Kimi 这次的暂停订阅,就是这条水下暗线第一次浮出水面。它绝对不会是最后一个。接下来你会看到越来越多这样的场景,一个模型技术上遥遥领先,商业上却被自己的成功噎住,因为它跑得太快,快到算力这双鞋跟不上脚。

其实这样的苗头早就有了。今年上半年 GLM 火的时候,就出现过类似的抢购和限量,当时不少人还以为是饥饿营销。现在 Kimi 又来一遍,你就知道这不是谁家的套路,而是行业的常态。有意思的是,连智谱 GLM 那边的人都跑出来给 Kimi 打 call[GLM 大佬为 Kimi 打 Call],这种同行之间的惺惺相惜,恰恰说明大家心里都清楚,面对同一堵算力的墙,谁也没比谁轻松多少。这是所有人共同的天花板。

我甚至觉得,以后判断一家 AI 公司行不行,不能只看它发布会上的跑分了,得看它敢不敢敞开了卖。敢敞开卖的,说明它背后的算力储备是真的足;不敢的,说明再漂亮的模型,也架不住真实世界的洪水。

写到这我又想起开头那件有趣的事。一个产品好到不敢卖,这在任何一个正常的商业世界里都是荒诞的。可在今天的 AI 世界里,它却是最真实的注脚。它告诉你,我们真的造出了一个足够聪明、足够便宜的东西,聪明和便宜到所有人都想要。但我们同时发现,想让这个东西真正为所有人服务,需要的电和铁,远远不够。

那颗能思考的沙子,已经不稀缺了。你花 199 块钱,就能用上全球顶尖的智能。真正稀缺的,是喂饱它的那些东西,是电,是水,是一排排在机房里日夜嘶吼的显卡。这一轮我们抢的从来不是智能本身,是让智能持续运转下去的燃料。

稀缺的是燃料不是智能

Kimi 挂出的那块「暂停订阅」的牌子,像一个来自未来的提醒。它提醒我们,当智能本身变得越来越像空气一样廉价的时候,决定谁能呼吸、谁只能干看着的,是那个我们平时根本注意不到的、沉默的物理世界。

谢谢你看我的文章,我们,下次再见。

/ 作者:青玉白露

延伸阅读

  • 我们给AI出的考试,可能全错了:两份不相干的报告指向同一件事,AI学会了应付考试,而不是真的具备能力。当分数越来越高、可信度越来越低,验证的价值正在超过信任。
  • AI公司正在失去定义自己边界的能力:OpenAI主动送5%股权,Anthropic被五角大楼逼拆护栏。看似截然不同的选择,底层逻辑一样:AI公司的独立性窗口正在关闭。互联网公司走了二十年的路,AI只用了四年。
  • 诺兰说AI是一匹玻璃木马:诺兰说AI是一匹透明的特洛伊木马,所有人都知道里面藏着什么,但门还是开了。真正推着我们开城门的不是木马多诱人,是怕被别人落下的恐慌。
  • 用了AI之后,我们变得更自信地犯错:一项研究发现,人用了AI建议后准确率从27%暴跌到9%,自信心却从30%飙到76%。AI最先夺走的不是答对的能力,是承认不知道的勇气。

评论区

欢迎留下你的看法,支持匿名评论。

你的评论会公开展示,建议填写便于交流的昵称,并尽量提供有信息量的反馈。