Codex当导演反向规划Seedance 2.5:AI视频从终点倒推


# 让AI视频停在最后一秒不崩盘,有人用Codex倒着拍了一部灾难片!

把视频生成的终点当成起点来规划,事情突然就说得通了!


2026年8月,一条20秒的视频在Reddit的ChatGPT板块炸了锅。画面从一个昏暗的室内开始,镜头穿过一扇窗户,掠过燃烧的房屋和消防车,最后稳稳停在那个全世界都认识的小女孩脸上——灾难女孩(Disaster Girl)对着镜头露出标志性的诡笑。这不是实拍,这是AI生成的。更离谱的是,做出这条视频的人说,他用的方法跟所有人都不一样:他不从第一帧开始想,他从最后一帧倒着推。


大家都觉得AI视频最大的问题是时长,其实真正的魔鬼藏在最后一秒

过去三年,几乎所有AI视频模型都在干同一件事:生成漂亮的五秒小片段,然后在你刚觉得“有点意思”的时候戛然而止。整个行业围绕这个五秒约束搭建了一套复杂的生产流程——分镜要按五秒的节奏写,素材要碎片化生成,最后在剪辑软件里拼接,然后祈祷四号镜头里角色的外套颜色和一号镜头对得上。

2026年7月31日,字节跳动正式发布Seedance 2.5,把单次视频生成上限从15秒直接拉到30秒。消息一出,创作者奔走相告。30秒啊!一条标准广告时长的片子,AI一次就能吐出来,不用拼接、不用对齐、不用祈祷颜色一致。

但事情没那么简单。

那位Reddit用户Lonelydude014发现了一个让所有AI视频创作者头疼的问题:大多数图生视频的失败,都发生在最后一秒。画面可以连贯地跑19秒,然后在第20秒的最后一帧,Seedance突然“想起来”自己还有个参考图要匹配——于是人脸变形、透视跳跃、或者一道白光闪过去把过渡遮掉。

这就怪了。一个能生成30秒连贯画面的模型,为什么偏偏在终点线上栽跟头?


传统提示词是“许愿”,反向规划是“画施工图”

大多数人用AI视频模型的流程是这样的:写一段提示词,塞一堆“ cinematic”“dynamic”“smooth”这种形容词,点击生成,然后祈祷。这本质上是在许愿。

Lonelydude014换了个思路。他不再问“这个视频里应该发生什么”,而是问了一个完全不同的问题:“视频结束的时候,什么必须是真的?

他把灾难女孩的最终画面拆解成一组硬约束:女孩的位置、视线方向、表情、前景和背景的层次关系、最终的摄像机高度、精确的观察轴线。这些东西不是“视觉建议”,是“终点状态”——摄像机必须抵达的位置,不是大概其,是精确坐标。

然后他让OpenAI Codex把这个终点状态倒推成一条完整的摄像机运动路线。路线长这样:从低角度室内出发→跟着地面上的红色引导线移动→加速冲向一个过曝的出口→穿过院子→经过消防员、水带和消防车(它们作为前景遮挡物制造视差)→沿着女孩身侧移动→弧线绕到最终的观察轴线上。

注意这里每个元素都有功能。红色引导线确定运动方向,过曝的出口给曝光过渡一个理由,消防车和水带制造平移和视差,最后的弧线把摄像机送上参考图的透视角度。没有一个是“好看但没用”的装饰。


Codex在这儿干的不是写代码的活儿,是当导演

Codex是什么?它是OpenAI面向软件开发场景打造的AI编程Agent。它能进入你授权的项目目录,读取代码、理解项目结构、修改文件,还能执行命令、运行测试。

但在这个案例里,Codex没写一行代码。Lonelydude014用它来做分镜规划。他把终点约束喂给Codex,让它生成一份包含明确摄像机运动、前景事件时序、曝光变化节点和停止行为的拍摄计划。目标不是写一个更长的提示词,是消除歧义

这背后的逻辑值得细想。传统的提示词工程是在跟模型“商量”——你描述一个场景,模型猜你要什么。但猜这件事,天生就带着不确定性。而Lonelydude014的做法是把“猜”变成“算”——终点已知,倒推路径就是一个有唯一解的几何问题。

第一次生成的视频跑偏了。他没让Codex“写个更好的提示词”,他问的是“哪个约束没有被充分指定”。答案很快出来:摄像机在旋转而不是平移,前景物体没有明确的时间节点,最终帧被描述成一张“图片”而不是“摄像机必须到达的一个状态”。


评论区扒出的每一个穿帮,都在证明同一件事

视频发出来之后,评论区炸了。但炸的方向跟你想的可能不太一样。

有人说:穿过窗户之前,室内看起来根本不像是会烧成那样的房子。有人说:这个建筑到底有没有二楼?窗外看是二楼的高度,绕到正面一看房子根本没二楼。有人说:水带从消防栓里直接喷水,根本没人扶着。有人说:消防车长得像拖车和消防车的杂交体。有人说:消防员围了一圈就是站着看。

创作者自己承认:“这些连续性细节我下一版会修”。

但你仔细想想,这些穿帮恰恰说明了同一个问题:AI视频模型在处理空间关系时,缺乏三维世界的因果认知

当前主流像素级、文本驱动的视频生成模型,本质仍是2D扩散模型,没有三维空间认知能力,分不清远近、遮挡、物体真实坐标。一个球可能弹得比掉下来的时候还高——看着挺像那么回事,但物理是错的。镜头一动,场景漂移、物体错位、空间失真、画面穿帮。

这跟Lonelydude014遇到的问题其实是同一个问题的两面。模型能生成漂亮的像素,但不理解这些像素在三维空间里的关系。所以当摄像机需要从一个位置运动到另一个位置时,它只能“猜”中间应该发生什么——而猜,总会出错。


一个值得注意的细节:Seedance 2.5其实支持指定尾帧

搜一下Seedance 2.5的API文档会发现,这个模型其实支持上传“尾帧图片”(last_frame_image)。你可以明确告诉模型:最后给我落到这张图上。

但Lonelydude014没用这个功能。他让Seedance 2.5从第一帧出发,用提示词引导它走到终点。换句话说,他选择了一条更难的路——不告诉模型终点在哪,而是规划一条路径让模型自己走过去。

为什么?

因为“指定尾帧”和“让模型理解为什么要停在那里”是两码事。前者是硬约束,后者是因果链。如果模型不理解为什么摄像机最后要停在这个位置、为什么要在这个角度、为什么要在这个时刻停下来,那就算终点对了,中间的运动也是无意义的漂移。

他把终止设计成了一个运动阶段:快速飞行→受控滑行→小幅位置修正→摄像机与主体同步减速→完全停止。停止不是剪辑点,是这个镜头里的最后一个动作


成本账算下来,比想象中便宜,也比想象中贵

这条20秒视频的成本是这样的:首帧用Seedream 5.0 Pro生成,花0.045美元。20秒的Seedance 2.5生成,通过Atlas Cloud API在OpenMontage里跑,1080p-ESR/60fps,花2.68美元。

对比一下公开报价:Seedance 2.5官方定价含视频输入42元/百万tokens,720P下每秒1.5到2.1元,一条30秒的片子45块起步。第三方平台RunningHub的会员价是480P每秒0.21元、720P每秒0.49元。Atlas Cloud的Seedance 2.5定价大约每秒0.462美元。

2.68美元做一条20秒的片子。放在两年前,这个价格你想都不敢想。放在今天,评论区的人在用4K电视逐帧找穿帮。


一个让所有AI视频创作者睡不着的问题

Lonelydude014在帖子的最后问了一个问题:这种“从终点状态倒推”的方法,能不能用在UI动画、机器人仿真、建筑可视化上?

这个问题有意思。因为如果这个方法真的通用,那它指向的是一个更深层的东西:规划的本质不是预测未来,是定义终点,然后倒推路径。

传统AI生成是“给定起点,预测接下来发生什么”。Lonelydude014的方法是“给定终点,反推怎么走到那里”。前者是天气预报,后者是导航地图。天气预报你可以报错,导航地图错一步你就到不了。

但问题来了:如果模型本身没有三维空间认知能力,倒推出来的路径再精确,它能在执行过程中不偏航吗?评论区那些穿帮——二楼变一楼、水带自己喷水、消防车变拖车——说明模型在执行路径的时候,还是会“发明”一些东西来填补它不理解的空白。

Seedance 2.5能听懂“从A点到B点”的指令,但它真的理解A点和B点在三维空间里的关系吗?

这个问题,那条视频没有回答。评论区吵了九个小时,也没吵出个所以然。