AI 视频片段规划器
把任意一场戏切成符合你模型时长上限的片段
粘贴一场戏、选好你模型的片段时长上限,这个规划器就会把它切成带编号、可直接粘贴的提示词,并且首尾相接成一段连续的序列。为那些模型停在 8 秒或 10 秒、而戏有 45 秒的 AI 电影人而造。
所有文生视频模型都只能一小段一小段地生成:Veo 3 大约到 8 秒,Sora 2 和 Kling 2.x 大约到 10 秒。更长的一场戏,只能以一串共用同一段一致性描述、并在每个切点交接状态的片段形式存在。规划器会估算每个节拍的银幕时长(动作按每秒约 3 个词,对白按每秒约 2.5 个说出口的词再加 20% 余量),然后把连续的节拍打包进不超过你上限的片段里。
全部在你的浏览器里运行。你的场次文本从不离开这里,也没有任何内容被发送到服务器。
模型预设只设定秒数,依据的是各模型在 2026 年年底的上限。
每个片段的秒数会逐字重复在每条片段提示词的最前面。它越具体,你的人物和场景在片段之间就越不会飘。
人物你的片段方案
把你的场次粘到上面,就能看到片段方案。
工作原理
规划器把你的场次切成节拍:每一句动作和每一次对白(一行「名字:」或一句带引号的话)都成为一个节拍。它按阅读节奏惯例估算每个节拍的银幕秒数,动作按每秒约 3 个词,对白按每秒约 2.5 个说出口的词再加 20% 余量用于呼吸和反应。然后它按顺序把连续的节拍打包进不超过你上限的片段里。每条片段提示词都带着同一段一致性表头、一行从上一个片段的 EXIT STATE 继承来的 ENTRY STATE、节拍文本和一个目标时长,这串片段于是能像同一场戏那样剪到一起。
怎么把一场戏切成 AI 视频片段
模型限制时长有两个原因:算力成本随片段长度陡增,而生成越久一致性就越飘(脸会变形、道具会瞬移、光会滑动)。所以没有任何设置能让 Veo 3 超过 8 秒,也没有办法让 Sora 2 在一次生成里更长。可靠地拉长 AI 视频的唯一办法是多片段工作:把戏切成节拍、分别生成每个片段,再剪到一起。
真正有效的串联方法既枯燥又可复制。在你的模型支持图像条件时,把一个片段的最后一帧当成下一个片段的第一帧,并且在每条提示词里重复完整的一致性描述。写「和刚才同一个角色」毫无用处,因为模型对上一次生成没有记忆;重复写「红色雨衣,黑色短发」才管用。正是这种重复保住了片段之间的一致性,而这也正是规划器该替你自动完成的事。
当你在动作上切开时,片段之间的接缝就消失了,这条剪辑惯例和连续性剪辑一样古老。让一个片段停在动作进行到一半(一扇正在推开的门、一个正在转过来的头),再让下一个片段把那个动作做完,观众的眼睛会自己跨过这个切点。每条提示词里的 EXIT STATE 和 ENTRY STATE 就是为了铺好这些交接,也正是它们让 Veo 3、Sora 2 或 Kling 的片段能串成一场连贯流动的戏,而不是一段幻灯片。
方案定下来之后,用我们的 免费 AI 视频提示词生成器 调好每个片段的摄影机和光线语言,让这一串提示词说同一套电影语法。
适合谁
- 做 AI 短片的人 把它当成场次规划器,在烧掉生成额度之前,先把剧本里的每一场戏变成带编号的镜头方案。
- 在 Veo 3 或 Sora 2 上单干的人 别再为了塞进 8 秒而删戏,开始用真的接得上的进出状态来规划片段串联。
- 代理商和社交团队 把一支 30 秒广告作为一串片段来做简报,整个团队都读得懂,一致性在第一次生成之前就已经锁好。
场次拆分成片段:完整指南
它把你粘贴的场次切成节拍,按字数估算每个节拍的银幕秒数,把节拍打包成不超过你设定长度的片段,并为每段写一条可以直接粘贴的提示词,配同一段连贯性抬头。
这类工作的核心问题很清楚:文生视频模型把单次生成卡在 8 到 12 秒,所以完整的一场戏必须当成片段链来规划,而手工做这件事会丢掉连贯性和时长的账。不解决,它就会在后面的环节制造摩擦,让决策变慢。实际要达到的是一份带编号的片段计划,每段一条提示词,进出状态互相衔接,时长估算从不超过模型的上限。
需要记住的限制:按字数推的节奏是估算,不是秒表:表演、运镜速度和模型的理解都会改变真实时长,所以把片段时间当成规划目标,并预留在剪辑里修剪的余地。
进阶用法:进阶用户会给每条片段提示词配上末帧条件:先生成第 1 段,导出它的最后一帧,作为第 2 段的起始图喂进去,同时让写下来的连贯性抬头保持一字不差,这样模型既有视觉锚点也有文字锚点。
一步步怎么做
- 粘贴场次文本,包括对白,选择你的模型预设或自定义最长片段长度。
- 把连贯性区块填满:人物的准确外形、地点、光线和风格,因为它会在每条提示词里重复。
- 过一遍片段卡:核对时长、留意超限提示,把断得别扭的节拍调一调。
- 一段一段复制提示词(或者导出 .txt),按顺序生成,再把结果在动作节拍上剪到一起。
按角色分的使用场景
- AI 短片创作者:在花掉额度之前,把剧本里的一场戏变成逐镜的生成计划。
- Veo 3 上的单人创作者:规划一条 8 秒片段链,衔接点切在动作上,而不是每段都硬重启。
- 社交团队负责人:把一支 30 秒的片子讲成一条读得懂的片段链,连贯性一开始就锁死。
常见的坑
- 写「和之前同一个人物」,而不是把完整描述重复一遍,模型根本记不住。
- 把片段填到刚好卡上限,一点余量都不留,等某次生成偏短时就没东西可剪。
- 在对白句子中间断开,让口型和表演的连贯几乎不可能做到。
行业里的做法
- 把片段规划得比上限短一两秒,每次生成在剪辑里都有余量。
- 让片段在动作进行到一半时结束,下一段从把这个动作做完开始;切在动作上,两次生成之间的接缝就藏住了。
- 每个项目留一份主连贯性区块,拆每一场戏时都原样粘贴。
把这个工具的输出当成决策的辅助,而不是写作本身的替代。一个好剧本被记住,靠的是具体的选择、准确的情绪,以及戏剧动作的清晰。工具的作用是把噪音去掉,让你的精力落到真正要紧的地方:人物、冲突、升级和兑现。每过一轮就回看一次结果,把接受的改动记下来,你的工作方式会一稿比一稿更快、更可预期。这种稳定正是专业合作者看重的东西:意外更少,理由更清楚,剧本朝着有意识的方向长。
延伸问答
AI 视频模型为什么把片段限制在 8 秒或 10 秒?
两个原因:算力成本随时长陡增,而且生成越长,时间上的一致性越会漂移,脸和道具就开始变形。短上限保住了质量,所以更长的场次才要用片段链来搭。
把一整场戏规划成片段,最好的流程是什么?
把场次切成节拍,把节拍打包成不超过模型上限的片段,在每条提示词里重复同一段连贯性区块,把进出状态串起来,然后按顺序生成。这个工具把切分、计时和提示词拼装都自动化了。
末帧接首帧是怎么运作的?
你导出第 N 段的最后一帧,在模型支持的地方把它作为第 N+1 段的起始图喂进去。再配上重复的文字连贯性区块,就能把人物、服装和光线锚在这一刀的两侧。
能用在 Kling 或 Runway 而不是 Veo 上吗?
能。预设只是设定最长秒数(截至 2026 年底,Kling 2.x 和 Runway Gen-4 是 10 秒)。提示词是纯文本,粘进任何模型的输入框都行。
片段时长是怎么从文本估出来的?
动作按每秒约 3 个字的银幕时间估,对白按每秒约 2.5 个说出来的字估,再加两成余量。节拍有 1 秒的下限,片段永远不会超过你设的上限。
如果单个节拍就超过了上限怎么办?
工具会在词的边界处切开,并标出受影响的片段。更好的解法是改写:把那个长节拍拆成两个动作,中间留一个自然的切点,然后重跑一次拆分。
常见问题
单次生成做不到。做法是把戏切成不超过 8 秒的片段、在每条提示词里重复同一段一致性描述块、在支持时把每个片段的最后一帧当作下一个的第一帧喂进去,然后把结果剪到一起。这个规划器替你把那串片段搭好。
大约 24 个词的动作(按每秒约 3 个词),或者大约 16 个词的说出口的对白(按每秒约 2.5 个词再加 20% 余量用于呼吸和反应)。这就是为什么半页的一场戏需要好几个片段。
因为每次生成都从零开始,模型对你上一个片段没有记忆。解法是在每条提示词里逐字重复完整的人物和场景描述,也就是每张片段卡上那段一致性表头在做的事。
它们把片段串起来。每个片段的 EXIT STATE 描述最后一帧,下一个片段的 ENTRY STATE 把它重复一遍,模型于是从上一个片段停住的地方接着开始。如果你的模型接受起始图,就把这套做法和喂入上一个片段的最后一帧结合起来用。
你模型的上限就是天花板:Veo 3 是 8 秒,Sora 2、Kling 2.x 和 Runway Gen-4 在 2026 年底大约是 10 秒。很多电影人会有意规划更短的片段(4 到 6 秒),因为短生成飘得更少,也在剪辑里给出更多切点。
