8 月 29 日,模型推理平台 fal 在 X 上开了一场不间断直播。画面一直没停,每一帧都是视频模型在现场实时生成的。你在聊天框里敲一个 !prompt 再加一句描述,过上几秒,画面就真按你的话改了剧情走向。官方把这项功能叫作 H3 Max Live,打出的标语是视频生成快于实时(fal 发布推文)。
行业里类似的演示每个月都有,大部分看完就忘了。这次的差别藏在一个容易漏掉的数字里:生成一段视频花的时间,头一次压到了这段视频自身的播放时长之下。生成速度一旦越过这条线,再加上观众能现场干预剧情,一类过去跑不通的业务就有了成立的前提。我们往下先对一遍这次演示证明了什么、没证明什么,再来算算这门新业务的账,最后看谁能先做出来、门槛卡在哪里。
先看背后的参与方和模型底座。fal 是一家美国做模型推理的平台,主要业务就是托管各种开源和第三方生成模型,按调用量向开发者收钱。H3 Max 是 fal 拿 MiniMax 开源的 H3 视频模型做后训练调优搞出来的提速版本,专门针对自家的推理栈做了优化。它支持 480p 和 768p 两种分辨率,能生成 5 到 15 秒的单段视频,画面还自带同步音频(模型页)。
速度数据得从两个口径分开看。fal 官方给出的 live endpoint 示例里,生成一段 5 秒的 768p 视频,模型推理花了 2.53 秒(第三方核对)。480p/768p 两档分辨率下的公开实测数据也摆在那里:5 秒的 480p 视频 1 秒内就能跑完,10 秒的片段需要 8 秒,但 15 秒的片段就要花 16 秒了(fal 官方演示视频、独立测评转写)。
问题就出在最后一个数字上:生成 15 秒的片段,你实际上得等上 16 秒。大家说的快于实时,眼下其实只在比较短的片段里勉强说得通,时间裕量基本压平了。直播这门业务特别看重长时间运行下的延迟稳定性,但目前还没有任何一方公开过长程运行的数据。前面提到的 2.53 秒也单指纯后端的推理时间,排队等任务、首帧加载、网络来回传输还有音画对齐全没算在里面,整套端到端延迟究竟怎么分布,目前谁也没有公开口径。
另一个短板在画面连贯性上。每个 5 到 15 秒的片段都是各做各的,线上端点目前还没有跨片段保持人物和场景一致的能力。发布前后,创作者 Lovis Odin 发过一个公开征集帖,展示了自己用 10 秒参考素材在 90 秒视频里保持人物长相的方案,顺便问社区想不想让 fal 官方跟进集成(X 贴文)。这场讨论正好说明了一件事:现网接口现在确实还做不到跨片段的记忆。
要算商业账,得先看成本底牌。768p 的推理单价截至 2026 年 8 月 31 日是每秒 0.04 美元,2026 年 9 月 1 日起已经恢复到每秒 0.08 美元(定价核对)。你可以折算成时间来看:按促销价和现行常规价,让一条 768p 的视频流连续生成一小时,成本大概在 144 到 288 美元之间。后面我们算所有的账,都会拿这个数字区间当基准。
按分钟收钱的视频流之前其实就有。Runway 的 GWM-1 Avatars 定价是每流式分钟 0.20 美元再加每会话 0.02 美元,Tavus 和 D-ID 也在这个赛道跑了多年(同上对比文)。但这两拨人做的是两码事。数字人产品驱动的是一套设定好的人物动作管线,画面有多自由,全看角色预先做了哪些动作,交出来的是会开口说话的虚拟形象。H3 Max Live 后面接的是通用视频生成模型,观众输入一行字,画面就能切换到任意场景。正如行业对比评测下的结论:两种架构虽然都挂着实时这个词,其余部分几乎找不出任何共同点。
fal 这次演示带来的新东西,主要在两个地方。首先是生成速度跨过了播放门槛,通用场景下的视频生成,头一回在短片段里比视频播放还要快。其次是画面的控制权交出来了,以前改画面得开发者去调 API,现在普通观众在聊天框里发句话就能改。两件事加在一起,内容就从提前录好的固定视频切片,变成了一条可以随时互动、现场修改的视频流。
这门新业务最快能落地的场景,就在直播秀场。过去大家看直播打赏,买的都是现成的礼物特效,刷个火箭屏幕上就放一段固定动画。生成式视频流把这种玩法往前推了一步:观众花钱买到的标的从视觉特效变成了导播权限,发出去一句话就能直接决定下一幕的剧情走向。付钱动作和内容操控合到了同一步里,这种结合过去从没出现过。
互动要想成立,生成速度必须跑在播放前面。观众改剧本的节奏,得紧紧跟上视频流播放的步子。要是你发了句话得等上三分钟才渲染出来,那种现场控场的感觉立刻就没了;只有在几秒钟里迅速把新画面切出来,整套互动才转得起来。
传统内容这行,商业账本一直很固定。拍电影、电视剧、做短视频或者流媒体,前期制作都是一次性花出去的固定成本。成片只要做出来了,后面不管放多少遍,多一个人看、多放一次,边际成本都几乎是零。观众规模越大,摊到每个人头上的单次成本就越低。
生成式视频流的账本逻辑正好反了过来。前期确实不用先备好现成片子,但直播只要多播一小时,后台算力就得现场硬算一小时,总成本跟着播放时长一路往上叠加。按照前面算出来的单价,跑一小时 768p 视频流,生成开销在 144 到 288 美元之间。做个对照:数字人视频流一小时成本只要 12 美元左右,做全场景通用视频生成的花费是它的 12 到 24 倍。多花出这份钱,买到的就是在任何场景里自由切换的视觉能力。
账本一变,做商业设计要想的事情跟着全变了。传统内容琢磨的是能不能做出一两部爆款来分摊前期成本,生成式视频流则必须回答每一小时的生成开销到底由谁来掏、怎么摊下去。你可以自己算这道算术题:把单条流的生成成本除以同时在线的观众人数。按秀场行业每人每小时毛利 0.1 美元估算,一条视频流大概需要 1,400 到 2,900 名并发观众,才能打平成本。这个在线人数区间,刚好对应秀场头部频道和大型活动直播的受众规模。相反,要是给每位观众单独生成一条专属流,单人一小时就要背上 144 美元以上的算力开销,纯娱乐场景的商业变现很难吃得消这种成本。
把成本和毛利放在一起对照,能理出三类能跑通的业务形态。第一类是一条流大家看:整条流的生成成本固定在每小时几百美元,进来看的人越多,人均摊下来的成本就越低,秀场和大型互动直播正好能摸到打平线。第二类是多条分支流分群服务:按照剧情选择或者兴趣把观众分成几个组,每组人共享一条独立的视频流,这是做互动短剧很务实的走法。第三类是只在高意向节点触发生成:只在广告转化、电商客服问答或者教学解惑这类高价值节点按需生成,单次生成 15 秒视频的成本约 0.6 到 1.2 美元,客单价高的业务完全接得住。
这三类形态一层层排下来,背后比拼的其实是场景自身的毛利厚度。离实际交易和高价值转化越近的环节,越有底气吃下即时生成的算力开销。
直播秀场最容易先跑出来,它的赚钱逻辑跟生成式视频流最合拍。观众花钱打赏的动作,本身就是改画面的控制指令;一条视频流能同时给全场所有人看,成本直接锁定在每小时 144 到 288 美元,而秀场观众掏钱的冲动,正好就集中在改变主播画面和即时互动上。对平台来说,内容供给直接换了模样:不需要真人时刻守在镜头前、能全天候不间断开播的频道变成了现实。真人主播的情感陪伴,反而会因为机器内容的普及变得更加稀缺,两拨主播在平台里各自占据不同的生态位。
微短剧业务得单独分开看。这个行业里大概 70% 的流水都花在投流买量上,成熟团队的投产比通常就卡在 1.03 到 1.07 之间(证券时报)。买量投放需要确定、能反复播放、方便做对比测试的标准化素材,实时生成的视频流则是播完即弃的消耗品,两套逻辑很难硬套在一起。因此短剧的主线制作依然会走离线生产的路子,继续靠 AI 去压低样片的成本。实时生成带来的新机会在衍生互动上:让观众通过投票或打赏来决定剧情走向的互动番外篇,套用第二类分支流的方案,在现有的分销渠道里就能转起来。
广告和电商营销走的是第三类高意向触发的路子。过去十年广告平台搞的动态创意优化,天花板一直卡在固定模板拼贴文字变量上;生成式视频流把做素材的方式变成了现场动态生成,可以根据用户画像和实时上下文,现场生成一段 15 秒的定制视频。电商带货也是同样的逻辑,消费者随口问起特定身材穿上是什么效果、具体怎么用,系统就按需生成一段解答画面。两边的底线都在成本上:普通走量的大曝光广告消化不掉单次 0.6 到 1.2 美元的生成费,只有到了高转化意向的临门一脚节点,在商业上才算得过来。
游戏场景看着热度很高,但实际能落地的切口其实最窄。生成的视频只是单向渲染出来的画面,画面里的状态变动没办法写回游戏底层的逻辑里,玩家的按键操作也进不去核心玩法体系。在现阶段,它主要还是用来顶替预先渲染好的过场动画,处理一些单向播放的环节。
生成能力带来的深层改变,落在了资产沉淀上。通用画面一旦能随时在现场跑出来,内容资产的分量就会重新洗牌:谁都能随手生成的普通画面和库存素材贬值最快;人物设定、世界观框架、交互规则以及跟观众建立的情感连接,每一条都决定着生成质量的上限,身价反而一路走高。平台也得设计新机制:需要及时把互动里跑出来的高价值片段留存成官方正史设定,否则实时流一播完就烟消云散,既聚不起受众的群体记忆,也留不下能二次分发的数字资产。
直觉上,允许观众在公开直播间随便敲提示词来控场,最大的绊脚石理应是内容安全审核。但只要把具体的工程数据和花费摆在桌面上,你就会发现,这道技术门槛其实比大家预想的要低得多。
先看处理延迟。行业里主流的视频审核方案是抽帧跑图像分类模型,音频单独做语音识别转写,每秒抽一帧是大家通用的配置(审核 API 对比)。在 768p 分辨率下,单帧上传加上模型判定的网络来回耗时在 0.5 到 1.5 秒之间。对比一下生成的节拍:生成一段 5 秒的片段需要 2.53 秒推理时间,每个播放周期留出了大约 2.5 秒的缓冲余量,每段生成完抽帧送审、审过了再放出来的段级门控机制,完全能塞进这个时间窗口里。再看花销:按每秒一帧的标准对一小时视频流持续审核,成本大概在 0.2 到 8 美元之间,约占视频生成成本的 0.1% 到 5.4%(数美直播流审核定价)。延迟和成本其实都算不上卡脖子的瓶颈。
真正需要花心思琢磨的,是碰上违规该怎么处置。放眼整个行业,目前还没有在播出前逐帧硬拦的现成先例。Twitch 的平台透明度报告显示,其实时直播的审核指标是以用户举报后 10 分钟内响应为基准的(DSA 报告)。fal 目前给出的处理办法是把不安全的输出换成全黑画面(模型参数文档),在直播里这么干基本就等于直接断流。更符合直播特性的工程做法,是采用段级门控机制:一旦发现片段违规,立刻调用预先写好的安全指令重跑一段替换画面,让审核跟视频流生成严密咬合在一起。
真正的准入门槛其实挪到了另外两个地方。第一处是法律责任到底算谁的。在主流视频生成平台里,fal 的安全审核配置是最宽松的一家:安全检测器虽然默认开启,但允许调用方自己动手关掉;在输出检测上按文档只查裸露与涉性内容,未见版权内容过滤。对照其他几家来看,Sora 在实测里会主动拦截漫威和宝可梦这类版权角色,Veo 配备了专门的模型记忆检测机制,可灵则把上限卡死在严格的 PG-13 且不提供放宽参数(Sora 实测、Veo 文档、Runway 审核文档)。选这种宽松的配置去做大众直播,运营方就得自己扛下全部的侵权与合规责任。
第二处是不同地区的监管政策与平台规矩。在欧盟,欧盟人工智能法案第 50 条已经自 2026 年 8 月 2 日起具备执法效力,合成视频的模型厂商必须嵌入机器可读的水印,运营方在直播画面里也得全程持续标注,直播流拿不到任何豁免(条款解读)。美国联邦层面目前还没出台统一生效的强制性 AI 标识法规,但通信规范法第 230 条的免责条款只保护第三方用户发的内容,平台自己现场生成的视频流,平台必须作为第一方主体承担法律责任(国会研究处分析)。在国内,生成内容标识办法已经在去年 9 月正式施行,微短剧也推行了分类分层备案并强制全平台贴出备案号;更紧的缰绳还在平台自己的规则上:抖音明确要求虚拟主播必须由真人实时驱动,视频号则把纯 AI 数字人直播直接划进了违规范畴(广电总局、金杜解读)。
综合对比这三个主要市场的监管和平台生态,业务落地的先后顺序大概是美国、欧盟、中国。美国市场的合规约束相对宽松,只要绕开真人肖像侵权和选举政治议题就能跑起来。欧盟的监管边界划得很清晰,技术上补齐数字水印和画面持续标注,也就是几周的工程改造。国内目前还缺少纯 AI 生成式直播的正规分发场景,仍需等主要平台逐步放开相关类目。
再回到开头 fal 的那场直播。生成速度跨过了播放时长的临界线,看这类产品的坐标系其实已经换了。去算一个生成式视频项目,不用只盯着比拼画质或者单次 API 调用的价钱,关键要先算清每一观看小时的账:一条流能吸引多少并发观众、每位观众能贡献多少毛利空间、实时生成到底该放在哪个转化节点去触发。只有把这套成本账算得通的业务,才是这项新技术真正能走通的市场空间。