观点

Astra的走红,证明OpenAI放弃Sora是一个英明决策

文 | 互联网怪盗团

今年3月,OpenAI突然宣布放弃Sora,此时距离Sora 2发布仅有短短半年。我们都还记得它发布时的盛况——朋友圈里用它做的各式各样的视频刷屏了好久!在Seedance 2和可灵3发布之前,Sora 2是不折不扣的全球第一视频大模型,在硅谷大厂当中,只有谷歌的Veo可以与其相提并论。然后就没有然后了……

当时的情况十分奇怪:OpenAI全面关闭了一切Sora服务,包括API在内;用户数据将在一段时间后被清空。不久前刚刚与迪士尼签下的10亿美元投资协议当然不会生效。OpenAI等于完全退出了方兴未艾的视频生成模型市场,一点也没有留后手。假设几年之后它打算重返这个市场,恐怕得从头做起,因为Sora的遗产作废了。

对于这个令人费解的现象,当时市场主流的解释是:OpenAI要集中精力提高编程能力,抢占方兴未艾的Agentic Coding & Workflow市场,当时这个市场已经成了Claude的天下。这个解释有一定的道理,但OpenAI为何不保留一小块根据地,例如仍然为特定企业客户提供视频生成服务呢?为何要完全退出呢?虽然视频生成很消耗算力,但OpenAI难道连有限规模的Sora算力都承担不起吗?

还有一种愚不可及的解释,就是“视频生成市场根本不赚钱”,“很快会灭亡”——主要见于精英论坛知乎。自从2022年底ChatGPT横空出世以来,知乎对于AI行业的技术和市场判断几乎全是错误的,是完美的反向指标,对视频生成的判断只是这群无知傲慢的所谓“技术人才”做出的众多愚蠢结论之一,不值一驳。

过去一个星期,随着GPT-6 Astra的爆红,我在与影视行业的朋友交流的过程中,总算领会到了:当初OpenAI毅然放弃Sora,可能是早早领会到了现有的原生视频生成模式无法满足工业级影视作品的需要,至少不能单独满足。今后的、精品化的、能上大银幕的那种视频生成,脱离不了Agentic Coding的模式,而Astra恰恰在这方面取得了新的突破。结果就是,Astra不是一个视频大模型、没有视频生成能力,却正在成为视频生成中不可或缺的重要工具。

原生视频模型,无论是Sora还是Veo,可灵还是Seedance,海螺还是HappyHorse……都无法克服一个致命问题:抽卡本身的不确定性。由于视频生成本身是随机的,没有调度可言,导演永远无法精确地控制一切。如果是一些细节问题(例如一致性),还可以通过反复抽卡解决;但是关键的调度和镜头语言问题,无论抽多少次卡都难以做到。

在短剧乃至一部分互联网原生中剧当中,这不是大问题。红果上每天出现上千部AI短剧(含AI真人剧和漫剧),绝大部分谈不上什么调度,镜头语言比较单一,大家看的就是剧情。不过这个市场也很容易饱和,尤其是竖屏短剧市场,变化空间太小了,我估计现在其实已经接近饱和。接下来的增量恐怕还是得指望横屏和大银幕(包括电视屏幕),那是真正有可能做出差异化的地方,制作单位的预算也明显更大。

Astra的诞生给了视频制作者一个崭新的选择:要不要通过Astra操纵Blender等专业3D建模软件,做一个完整的场景,乃至把主要人物的运动轨迹都做出来,由此实现“调度”?别误会,这样生成的东西,本身还不是工业级的视频,无法直接拿给观众看。但是,上述内容可以输入到Seedance或可灵里面,作为Prompt的一部分,那对输出精度的提高可不是一点半点的!

举个例子:以前你想做一个复杂的动作戏,主人公和反派在西部酒吧场景里拔枪互射,现场十分混乱,很多道具都被破坏,人物运动令人眼花缭乱,最后当然是主人公成功击杀了反派。这种复杂场景是原生视频模型的噩梦!你只能用尽可能详细的文本,加上大量图片(最好有手绘图),去调教模型。至于每个道具(例如桌子、椅子)的具体方位、形状和材质,就更难把控了。附带说一句,大部分视频模型对每个场景能输入的图片Prompt数量有限制,你不可能通过无限制补充图片的方式去完善一切细节。

最好的方法当然是交给视频模型一套3D建模,把这个3D场景本身作为Prompt,复杂的人物和道具关系就一劳永逸地解决了。说起来容易,可是做起来呢?传统3D建模要花多少人力物力?我们用AI做视频就是为了节约成本,如果还要在3D场景构建上花大钱,岂非南辕北辙?而且就算花了钱也不一定完成任务,优秀的3D艺术家和技术人员都很难找,不用我多说。

Astra把这个问题解决了:它能以Coding操纵专业3D软件去构建场景和人物,让人物在场景里“走戏”,从而真正解决AI视频的调度问题。如果你只想要一个示意、效果展示,或者简单的PV,其实Astra + Blender都已经足够了!要做复杂的、比较长的视频,则还需要用到原生视频模型。公允地说,就视频生成本身而言,Seedance仍是目前最好的。

然而,不管接下来视频模型如何发展、谁占据第一,Astra这样具有强大Agent能力的文本模型,已经不声不响地占据了“指挥官”的地位:你想做的东西越复杂、对精确度的要求越高,就越要依靠Astra(或其同类模型),而且它们的Agent能力还会进一步水涨船高,谁知道接下来还能创造什么奇迹!

Seedance也好,可灵也好,Veo也好,在AI视频当中发挥的作用,虽然不可或缺,但不是“最重要”的。就像在球场上,它们最终可能只是“工兵”或“角色球员”,Astra(或其竞品)则是中场组织者。我们都知道,后者的身家和薪酬会远远超过前者,现在已经有这个趋势了。

那么,视频模型的开发者知不知道这一点呢?显然是知道的,我认为Seedance的开发者——字节跳动,早就意识到了,并在考虑对策。Astra发布没多久,就传出了字节跳动要基于Seedance去做“世界模型”的说法。媒体猜测这是要进军游戏乃至元宇宙产业,但我认为字节跳动目的更实际,就是通过世界模型,为视频创作者提供更自由、更精确的调度空间。再过两三年,AI视频创作或许就是让3D建模的角色在世界模型里面“演出”一遍,再把演出视频进行修改润色,最终包装生成为工业级视频。与传统影视行业的制作思路一致!

由此看来,五个多月前OpenAI突然宣布放弃Sora,简直就是一个英明的战略决策。Sam Altman当时就想到这一层了吗?不得而知,反正结果是很好的。这对于整个AI视频赛道也是好事。我始终认为,只有尽可能摆脱抽卡带来的不确定性,AI视频才能进一步打开自己的天空,超越短剧层面,进入更宽广的未来。

我非常期待这个未来!

*如果大家有关于中泰信托吴庆斌、建华建材、深圳优制云工业互联网有限公司郑能欢、镇江市中级人民法院贾黛舒、句容市人民法院赵剑岚、南京市鼓楼人民法院刘桂占的相关新闻线索,欢迎联系我们,我们将联合其他媒体进行全球范围的重点报道。
20亿首轮,字节分拆AI制药拿下巨额融资
« 上一篇 09-17
二代豆包手机,给“微信美团淘宝们”留了30天冷静期
下一篇 » 09-17

相关内容

谷歌给RSI找到了一条捷径:做梦
二代豆包手机,给“微信美团淘宝们”留了30天冷静期
Astra的走红,证明OpenAI放弃Sora是一个英明决策
20亿首轮,字节分拆AI制药拿下巨额融资