剑指Sora，120秒超长AI视频模型免费开玩

来源：新智元更新时间2024-04-15 16:49:46 点击数：

近日，Picsart AI Resarch等团队联合发布了StreamingT2V，可以生成长达1200帧、时长为2分钟的视频，一举超越Sora。同时，作为开源世界的强大组件，StreamingT2V可以无缝兼容SVD和animatediff等模型。

120秒超长AI视频模型来了！不但比Sora长，而且免费开源！

近日，Picsart AI Resarch等团队联合发布了StreamingT2V，可以生成长达1200帧、时长为2分钟的视频，同时质量也很不错。

论文地址：https://arxiv.org/pdf/2403.14773.pdf

并且，作者表示，两分钟并不是模型的极限，就像之前Runway的视频可以延长一样，StreamingT2V理论上可以做到无限长。

在Sora之前，Pika、Runway、Stable Video Diffusion（SVD）等视频生成模型，一般只能生成几秒钟的视频，最多延长到十几秒，

Sora一出，60秒的时长直接秒杀一众模型，Runway的CEO Cristóbal Valenzuela当天便发推表示：比赛开始了。

——这不，120秒的超长AI视频说来就来了。

这下虽说不能马上撼动Sora的统治地位，但至少在时长上扳回一城。

更重要的是，StreamingT2V作为开源世界的强大组件，可以兼容SVD和animatediff等项目，更好地促进开源生态的发展：

通过放出的例子来看，目前兼容的效果还稍显抽象，但技术进步只是时间的问题，卷起来才是最重要的~

总有一天我们都能用上「开源的Sora」，——你说是吧？OpenAI。

免费开玩

目前，StreamingT2V已在GitHub开源，同时还在huggingface上提供了免费试玩，等不了了，小编马上开测：

不过貌似服务器负载太高，上面的这个不知道是不是等待时间，反正小编没能成功。

目前试玩的界面可以输入文字和图片两种提示，后者需要在下面的高级选项中开启。

两个生成按钮中，Faster Preview指的是分辨率更低、时长更短的视频。

小编于是转战另一个测试平台（https://replicate.com/camenduru/streaming-t2v），终于获得一次测试机会，以下是文字提示：

A beautiful girl with short hair wearing a school uniform is walking on the spring campus

不过可能由于小编的要求比较复杂，导致生成的效果多少有点惊悚，诸位可以根据自己的经验自行尝试。

以下是huggingface上给出的一些成功案例：

01 StreamingT2V

Sora的横空出世曾带来巨大的轰动，使得前一秒还闪闪发光的Pika、Runway、SVD等模型，直接变成了「前Sora时代」的作品。

不过就如同StreamingT2V的作者所言，pre-Sora days的模型也有自己的独特魅力。

模型架构

StreamingT2V是一种先进的自回归技术，可以创建具有丰富运动动态的长视频，而不会出现任何停滞。

它确保了整个视频的时间一致性，与描述性文本紧密对齐，并保持了高帧级图像质量。

现有的文本到视频扩散模型，主要集中在高质量的短视频生成（通常为16或24帧）上，直接扩展到长视频时，会出现质量下降、表现生硬或者停滞等问题。

而通过引入StreamingT2V，可以将视频扩展到80、240、600、1200帧，甚至更长，并具有平滑过渡，在一致性和运动性方面优于其他模型。

StreamingT2V的关键组件包括：

（i）称为条件注意力模块（CAM）的短期记忆块，它通过注意机制根据从前一个块中提取的特征来调节当前一代，从而实现一致的块过渡；
（ii）称为外观保留模块（APM）的长期记忆块，它从第一个视频块中提取高级场景和对象特征，以防止模型忘记初始场景；
（iii）一种随机混合方法，该方法能够对无限长的视频自动回归应用视频增强器，而不会出现块之间的不一致。