
马斯克前两天在 X 上说了句话,我盯着看了半天,越想越觉得这可能是今年 AI 圈最值得琢磨的一句。
他说 xAI 下一次训练 Grok,要把 SpaceX 的海量世界级工程数据喂进去,猎鹰火箭、龙飞船、星舰、星链的设计文件、测试数据、仿真数据,全都拿来训练,说要大幅提升 Grok 的工程能力,只有受美国 ITAR 出口管制的那部分除外[Musk: SpaceX Engineering Data Will Train Grok's Next 2T Run]。这里得说一句,这些细节目前主要是科技媒体转述他的推文,还没有一手权威源完全核实,你就当据报道来听。
第一眼看,这不就是又一条大厂喂数据练模型的常规新闻嘛。
但我脑子里立刻冒出一个问题,全世界有几家公司,手里攥着真实的火箭发射和回收数据。
答案是,就他一家。
这才是我觉得这条新闻真正的分量所在。它不是又一次算力竞赛的续集,它悄悄掀开了 AI 竞争下一阶段的底牌。
要讲清楚这个转变,得先回到一个几乎所有人都知道、但很少有人往深里想的事实。现在这些顶尖大模型,GPT、Claude、Gemini、Grok、Llama,它们其实是喝着同一口井里的水长大的。
这口井,就是公开的互联网。
甲骨文的创始人拉里·埃里森,去年底在财报电话会上把这层窗户纸捅破了,而且说得特别不留情面。他说这些 AI 模型,全都是用互联网上公开的数据训练的,ChatGPT、Anthropic、Grok、Llama,它们训练的是同一批数据,所以它们基本上都是一样的,这就是为什么它们这么快就商品化了[Oracle cofounder Larry Ellison on the biggest problem all AI models have]。
商品化这个词,用得又准又狠。
说到这个,可能有懂行的朋友要反驳了,模型明明各有各的强项,怎么就一样了。这话没错,短期看确实有差异。但埃里森指的是一个更长期的趋势,当所有人的原料都来自同一口井,你熬出来的汤再怎么调味,底味也会越来越接近。你追我赶几个月,大家又拉平了。这种趋同,是数据源单一的必然结果。
那问题来了,这口公共的井,还够喝多久。
这才是最扎心的地方。它快见底了。
一个叫 Epoch AI 的研究机构做过测算,人类生成的高质量公开文本,总量大约 300 万亿 token,如果照现在的消耗速度,大概会在 2026 到 2032 年之间被用光,而在追求最优训练效率的情况下,临界点可能就在 2028 年前后[Will we run out of data?]。马斯克自己早在去年初也说过类似的话,人类知识的累积总和,已经在 AI 训练里被榨干了。
你把这几件事串起来看,一幅新图景就浮出来了。
公共的井正在被抽干,喝同一口井的模型越长越像、越来越不值钱。那接下来拼什么,拼的就是谁在自家后院,还藏着一口别人打不到的私井。
这就是为什么马斯克要把 SpaceX 的火箭数据喂给 Grok。那不是普通的数据,那是全人类独一份、花了几百亿美元和无数次爆炸才换来的真实物理世界数据。你想抄,抄不了,因为你没有火箭。
一旦你从这个角度看世界,会发现这场抢私井的战争,其实早就打响了。
特斯拉手里有什么,它的车队跑出来的真实驾驶数据,到今年 7 月已经累计超过 120 亿英里[Tesla FSD Fleet Hits 12 Billion Mile Milestone]。这是任何一个后来者,砸再多钱都没法在短期内复制的。
彭博社更早就想明白了。它训练了一个 BloombergGPT,500 亿参数,喂的是一个叫 FinPile 的专有金融数据集,3630 亿 token,全是彭博几十年攒下来的档案,包括只有它的终端才有的独家数据[BloombergGPT arXiv]。这口井,别人连桶都伸不进去。
还有更直接的,Reddit 干脆把自己的数据当水卖。2024 年初,它跟谷歌签了个协议,大约每年 6000 万美元,把平台上的内容授权给谷歌训练 AI[Reddit AI content licensing deal with Google]。你看,当公共的水快没了,连一个论坛后院那口井,都突然变得价值连城。
聊到这,你可能觉得这逻辑天衣无缝了,未来就是得数据者得天下。
但我得诚实地泼一盆冷水,因为我自己也没完全想明白。
护城河这个比喻,有个隐藏的陷阱。井是死的,水是流动的。一口静态的私井,真的能一直护着你吗。
有一派观点就很不客气。他们说,Gartner 预测到 2028 年,合成数据会占到 AI 训练数据的六成,而现在微调一个模型的成本已经崩到,一万条样本的微调不到 2000 美元[The Data Advantage Myth]。这说明啥呢,一堆静态的私有数据,可能只能给你带来领先几个月的先发优势,真正的护城河不是你水井里存了多少水,而是你有没有一个能持续往井里注水的活水系统,也就是反馈闭环。
这个反驳我觉得相当有力。做垂直 AI 的人里,甚至有人直接开炮,说数据护城河就是扯淡,更别提医疗、法律那些最值钱的私有数据,很多因为隐私约束,根本不能拿去训练。
所以你看,私井这个事,一半是真金白银的壁垒,一半是可能被合成数据和活水冲垮的幻觉。
那我自己怎么看呢。我一直觉得,真正的护城河,从来不是你囤了多少水,而是你有没有一个别人复制不了的、能源源不断产生新数据的现实世界入口。
马斯克的厉害之处,可能不在于 SpaceX 那些存量数据本身,而在于 SpaceX 每一次发射、每一次回收,都在往那口井里注新水。特斯拉每天几百万辆车在路上跑,也是在注水。这才是最狠的,你有的不是一口井,你有的是一条别人接不进去的活水源头。
死水会枯,活水长流。
我们总以为 AI 的竞争是在比谁的模型更聪明,是在云端那些看不见的参数里。但兜兜转转,决定胜负的东西,可能重新回到了物理世界,回到了谁真的在造火箭、谁真的有车队上路、谁真的握着别人碰不到的现实。
最聪明的大脑,也得靠喝水才能活。而这个世界上最干净、最独一份的那口水,往往不在网上,就在你自己的后院里。
谢谢你看我的文章,我们,下次再见。
/ 作者:青玉白露
延伸阅读
- 五巨头隐藏债务狂飙 8 倍破 1.65 万亿,AI 基建债一半藏在财报外:微软、谷歌、亚马逊、Meta、甲骨文的表外债务两年狂飙 8 倍,逼近 1.65 万亿。AI 基建这座冰山,露出水面的只是一角,真正的窟窿藏在财报看不见的地方。
- 中美 AI 管制第一次双向开火:美国拦模型入境,中国拦模型出海:美国收紧对华 AI 封锁的同时,中国也第一次开始拦模型出海。这不是老剧本的重演,而是两堵墙第一次同时合拢,全球 AI 正在被劈成两个互不相通的世界。
- 机器人第一次拿起了手术刀:一个人形机器人给活猪做了台胆囊切除手术。它笨拙、遥控、达不到无菌标准,但在我看来比过去所有的后空翻加起来都重要。因为它跨过了从表演到干活的坎,而它的成本,只是达芬奇的5%。
- 当Meta开始卖算力,这场淘金热里最赚钱的角色变了:Meta要下场卖算力,股价大涨1270亿美元,CoreWeave、Nebius却暴跌17%。最大客户一夜变对手,卖铲子的逻辑被买铲子的人搅乱了。这到底是AI见顶,还是开始算账?

评论区
欢迎留下你的看法,支持匿名评论。
你的评论会公开展示,建议填写便于交流的昵称,并尽量提供有信息量的反馈。