昨天晚上我在fal上随手试了一下H3 Max,输入一句话prompt,点了生成,然后去倒水。
水还没倒满,视频已经出来了。
5秒钟的768p视频,生成时间不到3秒。我反应了好一会儿,因为这个体验跟我过去两年用视频生成工具的体验完全不一样。过去你点完生成,最快也要等个一两分钟,慢的话十几分钟,你甚至可以去刷会儿手机再回来看结果。但现在,生成一段视频比你播放这段视频还快。
这不是什么实验室里的demo数字,是真的可以花0.9美元跑通的商业化产品。
我是真的觉得这件事的意义被严重低估了。所以今天想认真聊聊,最近这一周在AI视频生成领域到底发生了什么,以及为什么我认为我们正在目睹一个临界点。
先说H3 Max本身。它是fal基于MiniMax开源的H3模型做的后训练版本。MiniMax在7月底把H3开源了,这个模型本身就很猛,支持2K分辨率、最长15秒、原生立体声音频、T2V和I2V全覆盖。但真正让H3 Max炸场的不是模型能力,而是速度。
fal这家公司很有意思,他们不做基础模型,专门做推理基础设施。你可以把他们理解成AI视频领域的「加速器厂商」,别人造发动机,他们造涡轮增压。他们拿到H3开源权重之后做了大量的后训练优化和推理加速,最终把生成速度压到了一个荒谬的水平,5秒视频不到3秒生成。
然后这个东西直接登顶了Artificial Analysis的视频生成排行榜,Elo评分1201,把之前所有的闭源模型全干下去了。
你想想这个画面。
一个开源模型的后训练版本,在商业化产品形态下,同时在质量和速度两个维度上打败了所有闭源竞品。。。这在半年前是不可想象的事情。半年前的视频生成领域,Sora还是那个不可逾越的质量标杆,大家讨论的核心问题是「闭源模型的画面质感,开源什么时候能追上」。
现在这个问题的答案是,不用追了,已经反超了。
但H3 Max的速度突破不是孤立事件。同一周,SGLang团队发布了一个叫SGLang Diffusion的推理加速方案,专门针对扩散模型做的。他们在MiniMax H3上跑出了非常夸张的数字。
无损加速1.85到1.95倍,注意是无损的,画面质量完全不变。如果你愿意接受一点质量损失,用上Cache-DiT加SubBlock稀疏注意力,8张H200上可以做到6.24倍加速。
我给你翻译一下这个数字的含义。原来用Diffusers跑一个10秒的视频要207秒,SGLang无损加速后变成112秒,开满加速后变成34.8秒。一个10秒的视频,34.8秒就能生成。fal的H3 Max走得更激进,5秒视频不到3秒,这个速度已经突破了一个心理阈值,视频生成从「等结果」变成了「看结果」,从异步工作流变成了近实时交互。
这个变化为什么重要?因为它改变了人和工具之间的关系。
怎么说呢,过去用视频生成工具,你的工作流是这样的,写prompt,点生成,等两分钟,看结果不满意,改prompt,再等两分钟,再看。每一次迭代的成本是分钟级的,你一个下午可能只能跑十几轮。这种节奏下,你会变得非常保守,每次改动都小心翼翼,因为试错的时间成本太高了。
但当生成速度快到秒级的时候,整个创作逻辑变了。你可以像调Photoshop滤镜一样调视频,改一个词看看效果,不行再改,三秒钟一轮。一个下午你能跑几百轮迭代。这种速度会催生出完全不同的创作方式和创作者群体。
坦率的讲,这让我想到了图像生成领域两年前发生的事情。
2024年初Stable Diffusion刚火的时候,出一张图也要十几秒甚至几十秒。后来SDXL Turbo和LCM把速度压到了一两秒,再后来Flux出现了实时预览,你拖动一个参数滑块,画面就跟着变。就是从那个时刻开始,AI图像生成才真正从「技术人的玩具」变成了「所有人的工具」。速度不是量变,是质变的触发器。
现在视频生成正在经历同样的拐点。
再说说这一周另一个让我挺兴奋的事情,Google在I/O开发者大会上发布的Gemini Omni 1.1 Flash。
这个产品的思路跟前面聊的H3 Max完全不一样,但从另一个方向指向了同一个结论。H3 Max解决的是「生成快不快」的问题,Gemini Omni解决的是「生成完了怎么改」的问题。
它有几个功能特别值得聊。第一个是场景扩展,你生成一段10秒的视频,觉得不够长,可以一次一次往后延伸,每次10秒,最长到40秒。你还可以指定首帧和尾帧,让AI自己去填中间的内容。第二个是对话式编辑,你可以用自然语言跟它说「把天空改成黄昏」「让人物走得更慢一点」,它就帮你改。第三个是4K输出,这是目前为数不多的原生支持4K的视频生成工具。
Gemini Omni的野心不是做一个最好的视频生成器,而是做一个视频编辑器。 它在赌一个判断,未来视频创作的核心体验不是「一句话出片」,而是「对话式修片」。你不需要一次写对prompt,你可以先出一个粗版,然后一点一点对话调整,像跟一个助手协作一样。
这个判断对不对,说实话我也不确定,但方向很有意思。因为目前市面上绝大多数视频生成工具都在卷「一次出片」的质量,很少有人认真做「出片之后怎么迭代」这件事。Gemini Omni和Runway Gen-4是少数在这个方向上投入的玩家。
说到竞争格局,其实吧,2026年的AI视频生成市场已经跟一年前完全不一样了。
一年前的格局很简单,Sora是质量天花板,大家都在追。Runway是最早商业化的,有先发优势。Kling在中文市场跑得快。Pika走平民路线。其他选手要么还在实验室里,要么刚出demo。
现在呢?Sora反而成了最尴尬的那一个。
OpenAI在今年上半年的动作挺奇怪的。他们先是在2月份把Sora的免费额度砍了,然后4月份推出了Sora Pro,定价200美元一个月,明确走高端路线。但问题是,当H3 Max用0.9美元就能跑出排行榜第一的质量时,Sora的200美元定价就显得非常微妙了。你不能说Sora的画面不好,它的画面质感确实还是顶尖的,但「顶尖」和「比别人好200倍」是两回事。
质量差距在缩小,但价格差距在拉大。 这对Sora来说是一个结构性的困境。
反观开源阵营,MiniMax开源H3是一个标志性事件。它证明了一件事,视频生成模型的开源,不再是「开源一个能用但比闭源差很多的版本」,而是「开源的基座模型经过第三方加速后,直接在商业化产品形态下登顶排行榜」。这跟LLM领域Llama带起来的那一波开源浪潮非常像,先有一个足够强的开源基座,然后社区和第三方公司基于它做各种优化和定制,最终在特定场景下超过闭源。
fal就是这个生态里的典型玩家。他们不做模型,做推理,做加速,做后训练。他们的商业模式建立在开源模型之上,反正就是开源越强,他们的生意越好。这是一个正循环。
说真的,2026年下半年的AI视频生成,正在从「谁的画面最好看」的军备竞赛,转向「谁的整体体验最顺滑」的体验竞赛。画面质量已经不是瓶颈了,至少对大多数创作场景来说不是。瓶颈变成了速度、可控性、编辑能力、价格,以及最重要的,迭代效率。
Midjourney也在这一周推了V8.2,正式进入图像编辑领域。指令编辑、img2img、inpainting、outpainting,一个做图像生成做了三年的公司终于开始做编辑了。这不是巧合。当生成的质量已经「够用」之后,所有玩家都在往「生成之后的事情」使劲。
回到文章开头的那杯水。
我倒水的时候视频已经生成完了,这个体验之所以值得写一篇文章,不仅是因为快,而是因为它改变了我对这个工具的心理定位。过去我把视频生成工具当成一个「提交任务然后等结果」的异步工具,跟你提交一个渲染任务差不多。但3秒出结果的时候,它变成了一个「实时反馈」的交互工具,跟你在Figma里拖一个元素差不多。
工具的速度决定了人和工具之间的关系模式。 慢的工具是「委托」关系,你把任务交出去,等它做完。快的工具是「协作」关系,你和它一起做,你动一下它动一下。
我一直觉得,技术的每一次质变都不是功能的增加,而是某个参数越过了一个阈值。视频生成正在从委托时代进入协作时代。而这个转变的起点,就是当生成速度快过播放速度的那一刻。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~
谢谢你看我的文章,我们,下次再见。

评论区
欢迎留下你的看法,支持匿名评论。
你的评论会公开展示,建议填写便于交流的昵称,并尽量提供有信息量的反馈。