详情

首页手游攻略 AI短剧视频如何生成?从剧本分镜到成片的完整教程

AI短剧视频如何生成?从剧本分镜到成片的完整教程

佚名 2026-07-20 17:14:04

想把一个点子做成 60 秒竖屏短剧,最容易踩的坑不是“不会用 AI”,而是一次让模型完成整段剧情。人物会变脸,动作会互相打架,台词也很难对上口型。稳妥的做法是把工作拆成一条短链:先定剧情节拍,再做角色参考图,把故事切成 6 到 10 个单动作镜头,逐段生成,最后在剪辑软件里完成对白、字幕和节奏。

下面用“雨夜便利店”悬疑短剧做完整示范。成片目标是 9:16 竖屏、约 60 秒、两名角色、一个便利店场景。视频生成部分用 Runway 当前官方帮助页中的 Gen-4.5 操作作例子;换成其他支持文生视频或图生视频的平台时,剧本、分镜、连续性和剪辑方法仍然适用。

开始前先备齐这些材料

  1. 一台能稳定访问视频生成平台和剪辑软件的电脑。
  2. 视频生成平台账号,以及足够完成多次试生成的额度。
  3. 一款带多轨时间线、字幕和音频调整功能的剪辑软件。
  4. 两张角色参考图和一张场景参考图;没有现成素材时,先生成静态图并确认使用权。
  5. 一副耳机,用来检查对白、环境声和背景音乐是否互相遮挡。

完成标准:导出的视频能在手机上竖屏播放;主要人物在相邻镜头中的脸、发型和服装基本一致;对白听得清;字幕没有越出安全区域;开头 3 秒出现异常信息,结尾留下未解决的问题。

步骤一:先把 60 秒故事压成四个节拍

主要动作:只写“钩子、冲突、反转、悬念”四段,不急着写镜头提示词。示例可以这样定:0 至 5 秒,浑身湿透的女孩冲进便利店,店员说“你不是三天前就失踪了吗”;5 至 25 秒,女孩借手机报警,却在监控回放里看见三天前的自己一直站在店内;25 至 45 秒,店员接到真正女孩的电话,对方只说“别让她回头”;45 至 60 秒,柜台前的女孩慢慢抬眼,说“终于找到你了”。

入口位置:在文档、备忘录或编剧工具中新建一页,先写成四行节拍表。成功标志:删掉任意一段都会影响剧情因果,而且第一段和最后一段都能单独说清“发生了什么”。失败处理:如果四段仍然塞了很多世界观,先删支线角色和解释性对白,只保留一个异常、一次证据和一次反转。

步骤二:把节拍改成可拍的单动作分镜

主要动作:每个镜头只安排一个主要动作。不要写“女孩进门、回头、哭、拿手机、看监控”,应拆成“推门进入”“抬头听见店员说话”“手机屏幕出现监控画面”三个镜头。

镜头时长画面与唯一动作声音
14 秒雨夜便利店外景,门铃亮起雨声、门铃
26 秒女孩推门进入,湿外套滴水急促呼吸
37 秒店员抬眼认出她第一句对白
46 秒手机特写出现监控回放电流底噪
58 秒监控里的女孩停在货架尽头冰柜嗡鸣
67 秒店员接起电话电话里的警告
76 秒玻璃反光中的女孩先转头雨声突然变小
87 秒店员慢慢后退鞋底摩擦地面
99 秒女孩抬眼说出结尾台词台词后切黑

入口位置:在剧本下方建立“镜头号、时长、画面、声音”四列。成功标志:每一行都能用一个动词概括,而且 9 个镜头时长相加约为 60 秒。失败处理:如果某行出现三个以上动作,把它继续拆分;如果总时长超出目标,先删解释性镜头,不要把每段都强行加速。

步骤三:先固定角色和场景,再生成视频

主要动作:为女孩、店员和便利店各准备一张基准图。女孩的描述固定为“黑色齐肩短发、浅灰连帽外套、湿发贴脸”;店员固定为“30 岁左右、深绿色制服、胸前银色工牌”;便利店固定为“白色顶灯、绿色货架标签、右侧落地窗、窗外大雨”。角色图尽量用自然均匀的光线和中性表情,服装要完整可见。

入口位置:在图像生成工具的 References、参考图或角色素材区添加图片,并给角色起固定名称。Runway 官方资料说明,References 可以用一张或多张图片保留角色、物体或场景特征,也可以把满意结果继续保存为新的参考图。成功标志:换一个机位生成测试图后,脸型、发型、服装主色和场景布局仍能辨认。失败处理:如果人物漂移,先换成光线均匀、表情中性的正面参考图;不要同时修改年龄、服装、光线和机位,先锁住一个变量再迭代。

Runway 官方帮助页中的 Reference for image 按钮和参考图复用示例
看画面上方的“Reference for image”:满意的角色或服装结果可以继续作为参考图,下一镜头只改场景和动作。来源:Runway 官方 Gen-4 Image References 帮助页,现场截图。

步骤四:进入视频生成区并选定模型

主要动作:打开视频生成工具,选择同时支持文生视频和图生视频的模型。Runway 当前官方 Gen-4.5 页面给出两个入口:Apps View 搜索 Gen-4.5,或在 Video 模式的模型选择器中切换。

入口位置:Runway 的 Apps View 顶部搜索框,或者 Video 模式底部的模型选择器。成功标志:生成区显示 Gen-4.5,并能看到提示词输入区和 Generate 按钮。失败处理:如果搜索不到模型,先确认当前打开的是 Video 类工具,再检查账号计划、地区可用性和页面是否已刷新;不要在图像生成区反复寻找视频时长设置。

Runway 官方帮助页展示从 Apps View 搜索并进入 Gen-4.5
先看搜索结果里是否出现 Gen-4.5,再进入视频生成区。来源:Runway 官方 Creating with Gen-4.5 帮助页,现场截图。
Runway 视频模式的模型选择器中显示 Gen-4.5 和 Image Text to Video
模型选择器显示“Gen-4.5 · Image/Text to Video”,说明当前入口同时覆盖图生视频和文生视频。来源:Runway 官方 Creating with Gen-4.5 帮助页,现场截图。

步骤五:给每个镜头写一条低歧义提示词

主要动作:按“机位 + 主体 + 单一动作 + 环境 + 补充视觉信息”写一条镜头提示词。文生视频要同时描述画面里有什么、如何运动;图生视频已经有首帧,重点描述动作、镜头运动和环境变化。

中近景,深绿色制服的便利店店员抬起眼睛看向门口,身体保持不动。白色顶灯轻微闪烁,右侧落地窗上雨水持续向下流。镜头缓慢向前推进,压抑的悬疑片质感。

入口位置:视频生成页的提示词输入框;使用图生视频时,先把对应角色或场景首帧拖入输入区。成功标志:提示词里只有一个主动作,主体、环境和镜头运动没有互相矛盾。失败处理:如果人物动作过多或画面乱跳,先删掉情绪形容词和连续事件,只保留一个可见动作;如果镜头理解错误,改用“固定机位”“缓慢推进”“无镜头旋转”等明确限制。

Runway 官方文生视频提示词结构:机位、主体、动作、环境和补充描述
新手先照着“机位、主体、动作、环境、补充描述”排信息,重点是减少歧义,不是堆关键词。来源:Runway 官方 Text to Video Prompting Guide,现场截图。

步骤六:设置竖屏比例、时长和帧率

主要动作:按镜头表设置本段参数。Runway 当前官方 Gen-4.5 资料列出的单段时长为 2 至 10 秒,输出为 720p,可选 24 或 25fps;图生视频支持 9:16。短剧镜头先统一 9:16 和同一帧率,时长按分镜逐段选择。

入口位置:Generate 按钮附近的 Aspect Ratio、Duration 和 Advanced settings。成功标志:比例显示 9:16,时长与镜头表一致,所有镜头使用同一帧率。失败处理:如果 9:16 不可选,检查是否已上传适配的竖屏首帧或是否处在支持该比例的图生视频模式;如果动作没做完,先把镜头拆小,再考虑延长到 10 秒。

Runway Gen-4.5 生成设置中的画面比例、时长和高级设置入口
生成前只核对三个位置:画面比例、单镜头时长和高级设置里的帧率。来源:Runway 官方 Creating with Gen-4.5 帮助页,现场截图。

步骤七:逐镜头生成并做连续性检查

主要动作:一次只生成镜头表中的一个镜头,下载前检查人物、服装、光线、视线方向和动作起止。镜头 2 里女孩从画面左侧进门,镜头 3 就不要无理由让她出现在右侧;镜头 6 接电话时,店员拿手机的手也要保持一致。

入口位置:点击 Generate 后,在结果区播放单段视频;满意时使用结果下方的下载、放大或继续处理控件。成功标志:从首帧、动作中段和尾帧各暂停一次,人物没有突然换脸,衣服主色没变,镜头末尾能接上下一个镜头。失败处理:如果只有局部不对,保留参考图和场景描述,只改一条动作或机位;如果尾帧无法衔接,把满意结果继续作为下一段输入,避免从零重做人物。

Runway 生成结果下方的 Use 菜单,包含继续编辑、角色使用和口型等操作
结果能用时再打开“Use”继续处理;人物不稳时,优先沿用同一结果或参考图,不要每个镜头从空白开始。来源:Runway 官方 Creating with Gen-4.5 帮助页,现场截图。

步骤八:分别制作对白、口型和环境声

主要动作:先按角色分别录制或生成干净对白,再决定是否做口型驱动。两人对话不要把整段混在一个文件里:女孩一条音轨,店员一条音轨,每句前后留一点空白。Runway 官方的多角色对白流程也采用“分别获得角色表演,再在剪辑软件里合成”的思路;其 Act-Two 单次输入面向一个角色,多角色场景需要分开处理。

入口位置:配音工具的角色音色区、口型工具的角色输入区,以及剪辑软件的音频轨道。成功标志:关闭背景音乐后,每句对白都能听清;口型镜头只驱动正在说话的人,另一个角色没有异常嘴部动作。失败处理:如果口型抖动,缩短单句、换正脸或轻侧脸镜头,并减少遮挡;如果两个人同时被驱动,把画面裁到单个角色分别生成,再回到剪辑软件合成。

步骤九:在时间线里完成节奏、字幕和导出

主要动作:把 9 个视频按镜头号放进主视频轨,再放对白、环境声、音乐和字幕。悬疑短剧不需要每个剪切点都加转场;门铃、电话接通、雨声骤停这类声音能自然连接镜头。开头 3 秒保留异常信息,结尾台词说完后留半秒切黑。

入口位置:剪辑软件的新建竖屏项目和多轨时间线。成功标志:时间线总长接近 60 秒,字幕与对白同步,手机全屏预览时字幕不贴边,人物对话音量稳定,音乐不会盖住关键句。失败处理:如果节奏拖沓,先删动作前后的空等时间;如果跳切明显,用环境声连续、反应镜头或手机特写遮住断点,不要用花哨转场掩盖人物位置错误。

四个高频问题怎么修

人物每个镜头都变:固定同一张角色参考图、同一套服装文字和同一光线方向;每次只改动作或机位。动作像快放:一个镜头只留一个动作,删掉“随后、接着、同时”等连续指令。对白和画面不贴:先定对白长度,再生成相近时长的表演镜头;长句拆短,口型镜头尽量正脸。镜头接不上:让前一镜头尾帧成为后一镜头起点,或插入手机、门铃、雨水、监控画面等不依赖人物位置的特写。

发布前完成检查清单

  1. 剧情在 3 秒内出现异常、冲突或明确问题。
  2. 四个节拍齐全,结尾留下悬念或新的问题。
  3. 每个分镜只有一个主要动作,时长总和接近目标成片长度。
  4. 角色参考图、服装描述、场景光线和左右位置保持一致。
  5. 所有镜头统一为 9:16 和同一帧率,尾帧能接下一镜头。
  6. 对白分角色保存,字幕与声音同步,音乐没有遮住台词。
  7. 手机全屏预览时,字幕、人物脸部和关键道具都没有被裁掉。
  8. 使用的角色形象、声音、音乐、字体和素材具备可发布权限;涉及真实人物时已取得必要授权。
  9. 6 张教程截图均能打开,来源、替代文字和使用位置记录完整。

这套方法的关键不是押中一次“完美生成”,而是让每个镜头都能单独检查、单独返工。先把 60 秒故事切成小块,AI 负责生成可控的画面,你负责把因果、连续性、对白和节奏重新接起来,短剧才会像一条完整的故事,而不是几段漂亮但互不相干的片段。

点击查看更多
推荐专题
热门阅读