AI短剧视频提示词怎么写?小白怎么把一个分镜变成能执行的提示词
- 2026-10-06 09:09:54
上一篇讲“AI漫剧分镜怎么拆”的时候,我拿了一小段剧情做例子,把一句话拆成了6个镜头,最后也实际生成了一段10秒视频放在文章里。
但那篇重点讲的是:为什么这里要切镜、这一镜到底要拍什么。
至于这些分镜真正拿去生成视频时,提示词到底应该怎么写,我没有展开。
所以这一篇就继续往下拆。
比如上一篇有这样一个镜头:
女主近景。她看到信里的关键信息后,神情发生变化。
作为分镜,这句话已经够用了。
但真正到了即梦里,如果只写:
女主看完信以后非常震惊,镜头缓慢推进,电影感,氛围紧张。
其实还是太空了,AI也理解不了。


先别急着写“电影感”
以前写提示词,我也很容易先往里面塞:
电影感。
高级光影。
情绪张力。
细腻表演。
氛围感。
这些词不是完全没用。
但如果这一镜最基础的动作都没有说清楚,前面这些词再多,也救不了。
比如:
女主看信后非常震惊,电影感,镜头推进。
这里最核心的问题不是“不够高级”。
而是:AI根本不知道这10秒具体怎么演。
所以我现在写AI短剧视频提示词,会先按一个比较简单的顺序来:
素材职责 → 初始状态 → 主要事件 → 时间轴动作 → 摄影机 → 不变量
这6个东西,我觉得已经能解决小白大部分基础镜头的问题。


先告诉AI,这一镜里的素材
如果已经提前准备了人物、场景、道具资产,我觉得第一件事就是:别让AI猜参考图分别是干什么的。
比如这一镜需要:
女主。
书房。
一封信。
那就先把职责说清楚。
例如:
使用女主人物参考作为本镜头唯一女性角色。
使用古代书房作为本镜头固定场景。
使用书信作为女主手中的剧情道具。
为什么我要先写这一层?
因为做AI短剧以后,经常不是只给一张图。
可能同时给:
人物参考。
场景参考。
道具参考。
甚至还有上一镜的画面。
素材越多,越应该告诉模型:谁负责什么。
而不是把一堆图片扔进去,让它自己理解。
我现在会把这个叫:素材职责绑定。


把“第0秒已经是什么状态”写出来
这个我觉得特别重要。
很多提示词只写:
女主看到信以后震惊。
但问题是:
视频开始的第0秒,女主到底是什么状态?
如果这个没说清楚,AI就可能自己帮你设计开场。
比如:
她刚从桌子旁走过来。
她正在展开信。
她一开始就已经很震惊。
甚至信根本没在手里。
所以我现在会先锁一个初始状态。
比如这一镜:
女主站在书房木桌旁,胸部以上近景,右手和左手共同拿着已经展开的书信,视线落在信纸上。她一开始神情平静、专注,还没有发现异常。
这里其实只解决了一件事:
视频开始的时候,画面已经是什么样。
注意不是:
“女主走到桌旁拿起信。”
因为那是动作。
如果我们这一镜本来就是要拍她看到内容后的反应,那就不要再浪费时间让她走过去、拿信、展开。
第0秒直接让她:已经在看。
这样10秒的时间才能真正留给这一镜的核心内容。


一个镜头先只确定一个主要事件
这一镜到底要讲什么?
不是:
看信。
转头。
藏信。
走路。
男主进门。
这些全塞进去。
这一镜的任务其实只有一个:
女主看到关键内容以后,情绪发生变化。
这就是这一镜的“主要事件”。
我觉得这一点和上一篇拆分镜其实是连着的。
上一篇我们说:
每一镜要有明确任务。
到了写提示词的时候也是一样。
这一镜只要把这个任务完成。
如果人物震惊以后还要藏信,那是下一镜。
如果男主还要进门,那也是下一镜。
这样AI更容易执行。


不要只写“震惊”,要拆成能看见的变化
这个是我现在觉得特别重要的一点。
比如写:
女主非常震惊。
这对人来说有意义。
但“震惊”到底长什么样?
AI只能自己发挥。
有可能:
瞪大眼睛。
张大嘴巴。
猛然后退。
突然抬头。
甚至直接做成很夸张的短剧表演。
所以比起写“震惊”,我现在更愿意把它拆成:观众真正能看见的东西。
比如:
目光突然停住。
眼睛没有立刻抬起。
呼吸短暂停顿。
手指慢慢收紧信纸。
嘴唇轻微绷紧。
过了一拍后,才缓慢抬眼。
整体情绪是克制的震惊和难以置信,不大喊、不夸张后退。
这时候“震惊”就不再只是一个形容词。
而是变成了几个具体的表演动作。
我现在会提醒自己:
少写抽象情绪,多写能被镜头拍到的反应。


把动作放进时间轴
如果只是一个特别简单的动作,其实不一定每条提示词都要拆得特别细。
但只要一镜里面有两个以上连续变化,我觉得时间轴会非常有用。
比如这条10秒镜头,可以这样安排:
0—2秒
女主保持低头看信。
神情还是正常的。
先让观众看清楚她正在阅读。
2—5秒
视线读到最后一行后突然停住。
眼神不再移动。
呼吸轻微一滞。
握着信纸的手指逐渐收紧。
5—8秒
她仍然没有立刻做大动作。
眉头轻微收紧。
嘴唇绷住。
脸上的平静慢慢消失。
8—10秒
她缓慢抬起视线。
神情已经变成克制的震惊和警觉。
到这里结束。
你会发现:
我们其实没有让她做很多动作。
但这10秒里面是有变化的。
正常阅读
→ 发现异常
→ 情绪压住
→ 抬眼
这就是视频。
而不是:
“一个女人很震惊。”


最后再告诉摄影机怎么拍
人物怎么演清楚以后,才轮到摄影机。
这一镜的任务是看人物反应。
所以我不会设计特别复杂的运镜。
最简单可以是:
胸部以上近景,摄影机位于人物正前方略偏侧,开始保持稳定;从人物发现异常后开始非常缓慢地轻微推进,最终停留在人物面部近景。
为什么要推进?
因为这一镜的重点从:“人在看信” 逐渐变成:“看她的反应”。
镜头靠近一点,是服务于剧情重点。
而不是为了:“看起来有电影感,所以一定要动。”
如果这一镜本来就已经是很紧的近景,甚至完全可以固定机位。
所以我现在理解的运镜也是:
先看镜头任务,再决定摄影机要不要动。


最后还要写:什么东西不能变
这一步以前我经常忽略。
我们告诉AI“要做什么”,但没有告诉它:哪些东西最好别自己加。
比如这一镜,我会加:
人物全程保持站在原位,不走动,不转身。
书信始终拿在手中,不掉落,不消失。
不增加其他人物。
不改变服装和发型。
不突然切换场景。
不出现夸张大叫、后退、捂嘴等额外表演。
摄影机不环绕人物,不突然快速推拉。
这些东西我会把它理解成:不变量 / 禁止项。
不是写得越多越好。
而是把模型最容易“自己加戏”的地方限制一下。


把分镜翻译成提示词
原来的分镜只有一句:
女主近景。看到信中内容后,神情骤变。
如果直接写成:
女主看信以后非常震惊,镜头推进,电影感。
信息其实很少。
但按前面的6层拆完以后,就会变成下面这样。
最终10秒视频提示词示例
使用女主人物参考作为本镜头唯一女性角色;使用古代书房作为固定场景;使用书信作为女主手中的剧情道具。
初始状态:女主站在书房木桌旁,胸部以上近景,双手拿着已经展开的书信,低头阅读。她一开始神情平静、专注,还没有发现异常。
本镜头唯一主要事件:女主看到信中关键内容后,从平静逐渐转为克制的震惊与警觉。
0—2秒:女主保持低头阅读,视线缓慢扫过信纸,神情自然平静。
2—5秒:她读到最后一行后,视线突然停住,眼睛不再移动,呼吸轻微一滞,握住信纸的手指逐渐收紧。
5—8秒:她没有大幅动作,眉头轻微收紧,嘴唇绷住,脸上的平静逐渐消失,表现难以置信但努力压住情绪。
8—10秒:她缓慢抬起视线,眼神已经变得警觉,保持克制的震惊状态。
摄影机使用胸部以上近景,开始保持稳定,从人物发现异常后非常缓慢地轻微推进,最终停留在人物面部近景。
全程保持人物站位、服装、发型、书房场景和手中书信一致。人物不走动、不转身,不增加其他人物,不掉落书信,不突然切换场景,不出现夸张张嘴、后退、捂嘴等额外表演,不使用快速推拉或环绕运镜。


给小白一个最简单的提示词顺序
如果以后拿到一个已经拆好的分镜,不知道从哪里开始写,可以先按这6步:
1. 素材职责
这一镜用了哪些人物、场景、道具。
2. 初始状态
第0秒的时候,人已经在哪里、什么姿势、手里有什么。
3. 主要事件
这一镜真正只发生哪一件重要的事。
4. 时间轴动作
这件事从开始到结束,按什么顺序发生。
5. 摄影机
拍多近、从哪里拍、要不要动。
6. 不变量
哪些人物、场景、动作和状态不能乱变。
最后可以记成:
素材 → 初始状态 → 事件 → 时间轴 → 摄影机 → 不变量
我觉得对刚开始做AI短剧的小白来说,先把这一套写顺,就已经比到处抄“万能提示词”更有用了。
因为以后工具会变,模型也会变。
但你始终需要解决同一个问题:
我脑子里的这一镜,怎么清楚地告诉AI。
而这件事,才是视频提示词真正要解决的问题。
如果这篇文章对你有帮助,欢迎点个关注。后续我会持续更新AI漫剧的实操拆解,包括提示词模板、分镜案例、短片教学、不同平台的横向对比等。有什么想了解的具体问题,也可以在评论区留言,我尽量回复。