大模型开始放「预告片」了

大模型开始放「预告片」了

通义千问、智谱、腾讯混元同一周各出奇招,不是卖今天的产品,是抢明天的预期。当MoE架构趋同,叙事权之争才刚刚开始。

发布于 2026/08/28
11 分钟阅读
0 次阅读

昨天晚上刷到一个挺有意思的事。

通义千问发了个模型叫 Qwen3.8-Flash,然后在博客里写了一句,这是 Qwen4 架构的早期预览

同一天,智谱也发了 GLM-5.3-Flash,之前匿名以「Ox Alpha」的身份在 OpenRouter 上跑了整整六天,22万人免费调用,谁都不知道是谁家的。等大家猜了一轮微软、DeepSeek、谷歌、小米之后,智谱才掀开底牌,说这是我的。

一个把下一代架构当预告片放出来,一个用匿名身份搞了一波悬疑营销。

我当时的第一反应是,这俩公司的市场部是不是偷偷约了个饭。

但冷静下来想想,其实吧,加上腾讯混元同一周把翻译模型压到 440MB 塞进了B站直播弹幕,三家几乎同时做了同一件事,都在用自己的方式说同一句话,我的下一代已经在路上了,而且比你以为的更快

这不是巧合。这是一种新的游戏方式。

我管它叫「预告片经济」。

就像漫威每次电影结束后的彩蛋,观众看完黑寡妇就知道下一部是什么,期待感从散场那一刻就开始积累了。大模型现在也学会了这招,不等产品完全成熟就先放出一个能跑的版本,让你知道未来长什么样。

但漫威放彩蛋是因为故事线太长需要提前铺垫。大模型公司这么干,是因为另一个更现实的原因。

开发者的注意力正在变成最稀缺的资源。

你想想看,现在一个想选大模型的开发者面对什么局面。每周都有新模型发布,每个都说自己是最强的那个。如果你只是发一个完成品,说「我很强」,那你的声音会在一周内被下一个新模型淹没。但如果你说「我现在很强,而且你看,我下一代的架构已经能跑了,性能是现在的9倍性价比」,那开发者会怎么想?

他会等。

他会把技术栈的选择权暂时留给你。

这就是预告片经济的核心逻辑,不是卖今天的产品,是抢明天的预期。

顺着上面的再聊聊三家具体做了什么,因为虽然策略方向一致,执行细节里藏着完全不同的思路。

先说通义千问的 Qwen3.8-Flash。这个模型有意思的地方在于它的架构创新。它用了一个叫 GDN + QSA 的混合注意力机制,简单说就是把四层网络里的三层换成了一种叫 Gated DeltaNet 的结构来压缩历史上下文,剩下一层用稀疏注意力来捞全局里真正重要的信息。结果是什么呢,在100万 token 的长上下文里,预填充速度比上一代快了 7.6 倍,解码快了 4.9 倍。

125B 总参数,每个 token 只激活 6B。训练成本是 Qwen3.7-Plus 的九分之一。

坦率的讲,如果只看数字,这就是一个很强的推理模型。但通义千问做了一个决定性的动作,它把这个模型定义为「Qwen4架构的预览」,而不是一个独立产品

那结果会怎样呢?开发者在评估这个模型的时候,脑子里想的不是「Qwen3.8-Flash 够不够我用」,而是「如果 Qwen4 是这个架构的完全体,那会有多猛」。

预告片的价值不在于预告片本身有多好看,在于它让你对正片产生了期待。

再说智谱的 GLM-5.3-Flash。320B 总参数,18B 激活,也是 MoE 架构。但智谱玩了一招更骚的。

他们先把模型匿名丢到 OpenRouter 上,取了个代号叫 Ox Alpha。六天之内 22 万用户调用,社区开始疯狂猜它是谁。有人跑 tokenizer 指纹对比,有人拿视频编码方式交叉验证,一个一个排除微软、DeepSeek、小米、谷歌。最后社区自己得出结论,95 项 tokenizer 测试全匹配,这一定是智谱的。

然后智谱官宣,说对,是我。

你敢信,22万人帮你做了六天压力测试和口碑传播,一分钱营销费没花。

而且你注意一个细节,GLM-5.3-Flash 用了 KDA 线性注意力加 NoPE 稀疏 MLA 的混合架构,注意力计算量比 GLM-5.3 砍了 3 倍,KV缓存缩了 4.4 倍。全部跑在国产芯片上。定价是 Claude Opus 4.8 的四十分之一。

这两个数据放在一起看,智谱在说的不止是「我有个好模型」,它在说的是「我能在国产芯片上跑出和世界顶级模型一个水平的东西,而且便宜40倍」。

这是一个关于自主可控的预告片。

回到腾讯混元这块。坦率的讲,腾讯做的事看起来最不性感,一个 1.8B 的翻译模型,量化到 440MB,塞进手机跑。但我反而觉得这是三家里最有说服力的预告片。

为什么?因为它有一个已经落地的产品场景。

哔哩哔哩直播弹幕实时翻译。一条弹幕从输入到翻译完成,500到800毫秒。不需要联网,不需要云端GPU,在手机本地芯片上就能跑。

如果说通义千问的预告片是关于「下一代架构有多强」,智谱的预告片是关于「性价比能做到多极端」,那腾讯混元的预告片是关于「AI 什么时候真的跑到你口袋里」。

三种预告片,三个不同的赌注,但都在回答同一个问题。

这个问题就是,MoE 架构趋同之后,大家靠什么差异化?

你看,Qwen3.8-Flash 是 512 个专家选 10 个激活,GLM-5.3-Flash 是 288 个专家选 8 个。大家都在用 MoE,都在做稀疏激活,都在堆总参数但压激活参数。从宏观架构上看,这两个模型长得几乎一模一样。

但如果你仔细看细节。

通义千问赌的是「混合注意力」,用 Gated DeltaNet 替代传统 Transformer 的自注意力,说到底是在长上下文效率上下注。它在说,未来的 Agent 场景需要处理百万级 token 的上下文,谁能在这个尺度上又快又便宜谁就赢。

智谱赌的是「IndexPool + 流形约束超连接」,说到底是在 Scaling 效率上下注。它用更少的激活参数和更少的层数达到了更大模型的效果,而且在国产芯片上验证了可行性。它在说,性能天花板不是问题,成本地板才是。

腾讯混元赌的是「极端量化」,1.25-bit 量化把 3.3GB 压到 440MB,翻译质量几乎无损。它在说,最后赢的不是云端的百亿参数大模型,是能真正跑在每一台设备上的小模型。

三条路,三个对未来的判断。

我自己的感受是,这三条路其实不矛盾。

长远来看,AI 会分化成两层。上面一层是百亿参数的大模型,跑在云端,负责复杂推理和创意生成,对应通义千问和智谱在做的事。下面一层是极度压缩的小模型,跑在端侧,负责实时响应和隐私敏感的场景,对应腾讯混元在做的事。

中间那层,那些既不够聪明又跑不了端侧的模型,会慢慢被挤掉。

但这里有一个更深的东西值得聊。

预告片经济之所以出现,其实反映了一个结构性的变化。大模型的竞争正在从「谁先做出来」变成「谁先定义下一代长什么样」。

以前大家比的是基准测试分数,你 MMLU 高一个点我就输了。但现在,当头部模型的能力开始趋同的时候,仅仅发一个新版本已经不够了。你得告诉市场,你看到的未来和别人不一样。

通义千问说未来是混合注意力,智谱说未来是极致性价比,腾讯说未来是端侧。这不是产品发布,这是叙事权之争

谁的叙事被开发者接受了,谁就拿到了生态位。

不知道为什么,这让我想起了早年的 PC 时代。Intel 和 AMD 打得最凶的那几年,两家每年都会提前一两年公布下一代架构的代号和路线图。不是因为提前公布能让产品卖得更好,是因为OEM厂商需要提前做主板设计,需要知道未来两年的方向。谁的路线图被采纳了,谁就锁定了下游的整个生态。

现在的大模型也一样。开发者需要知道,我今天基于你的模型写的代码,明年是不是还能用。你的架构会往哪个方向演进。你的API接口会不会大改。

预告片,说到底是一种对开发者的承诺。

我来告诉你未来长什么样,你放心,跟着我走没问题。

所以你再回头看通义千问那句「Qwen4 架构的早期预览」,这七个字的信息量远不止一个模型发布那么简单。它在说,我的 Qwen4 已经有雏形了,我对方向有信心,而且我愿意提前让你看到。

这是一种技术自信的外化。也是一种对生态伙伴的喊话。

反过来说,如果你是一个大模型公司,到了这个阶段你还只是默默发模型、贴基准测试分数、等用户自己来选,那你可能已经掉队了。

因为这个游戏的规则已经变了。

不是谁的模型最强谁赢,是谁的故事最让人信谁赢。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~
谢谢你看我的文章,我们,下次再见。

评论区

欢迎留下你的看法,支持匿名评论。

你的评论会公开展示,建议填写便于交流的昵称,并尽量提供有信息量的反馈。