AI短剧制作常用名词,一篇讲明白:从剧本到成片,新手到底要懂什么?
- 2026-10-04 20:16:09
你是否也遇到过这样的情况:
明明有了故事,打开分镜表却看不懂 EWS、CU、POV;做出了漂亮的首帧,人物一动,衣服、发型、道具又变了;每段视频单独看都不错,剪在一起却像八个不同的故事。
问题不一定是工具没用对,而是制作流程中每个词负责的事情还没有分清。
这篇不教你操作某一款软件。我们沿着一条短剧从剧本到成片的路线,把常见名词放回它该出现的位置。
剧本 → 分镜 → 资产 → 首帧 → 视频 → 声音 → 剪辑 → 成片

01|剧本阶段:先决定“发生什么”
梗概,是用一两段话讲清故事主线。比如《灭门之夜,只有我一个人活了下来》:沈家遭灭门,沈清璃逃出生天,在追杀中寻找真相。
集(EP),是观众一次看到的故事单元;场(Scene),通常指同一时间、同一地点连续发生的一段戏。“雨夜,沈家镖局门前”是一场;人物进入府内厅堂,通常就进入另一场。
剧情任务,是这段内容必须让观众知道或感受到什么。第一段不必交代幕后黑手,但至少要让观众看见沈清璃、感到危险逼近,并看见她拔剑迎敌。
写剧本时,除了问“发生了什么”,还要问:这一段让观众的认知或情绪发生了什么变化?
02|分镜阶段:把剧情拆成可制作的画面
镜头(Shot),是成片中一段连续的画面。“雨夜拔剑”可以拆成:远处的镖局、逼近的黑影、握住剑柄的手、长剑出鞘、双方对峙。
分镜安排每个镜头拍什么、按什么顺序出现。故事板用草图或图片预览画面;镜头生产表进一步记录编号、景别、动作、提示词、声音和剪辑点。
分镜表里常见的景别缩写有:
EWS,大远景:交代宏观环境,例如暴雨中的长安城。 WS,远景:看清人物与环境的关系,例如沈清璃站在镖局门前。 MS,中景:看清人物动作,例如她举剑面对杀手。 CU,特写:强调面部、手或物件,例如握剑的手。 ECU,大特写:突出极小的细节,例如剑尖滑落的雨滴。
POV是人物主观视角,观众仿佛透过她的眼睛看;OTS是越肩镜头,从一人的肩后看另一人。
记住:景别回答“看多近”,视角回答“从谁的位置看”。

03|资产阶段:让同一个世界始终是同一个世界
AI短剧往往需要分次生成角色、场景和镜头,所以要建立可复用的资产。
人物定妆图确定角色的标准外观;场景资产确定镖局门前的建筑、灯光和雨夜氛围;道具资产确定长剑、剑鞘、玉佩等物件的样子。
以沈清璃为例:22岁、黑色半束长发与白玉簪、月白窄腰长裙、腰左旧白玉佩、腰右黑色长剑鞘。下一镜不能无缘无故换衣服、换发型。
我们在生产表中用人物锁、场景锁、道具锁记录必须继承的设定。这是项目管理用语,不代表每款生成软件都有同名按钮。
所谓一致性,也不只是“长得像”。人物位置、场景、道具所在的手,以及动作前后关系,都要接得上。
04|首帧阶段:决定这一镜从哪里开始
首帧是视频开始时的画面。在图生视频流程中,输入图片通常先确定人物是谁、站在哪里、穿什么、镜头拍多近。
尾帧是希望视频结束时到达的画面;关键帧用于约束某个时间点的状态。具体支持哪种输入,要以所用工具的功能为准。
参考图提供人物、场景或风格依据,但不一定是最终视频的第一帧。沈清璃的棚拍定妆图可以是人物参考图;她在镖局门前持剑的画面,才是雨夜对峙镜头的首帧。
一句话区分:参考图解决“保持什么样”,首帧解决“从什么画面开始”。

05|视频阶段:让画面按剧情动起来
文生视频由文字描述生成动态画面;图生视频以图片为视觉起点,再用文字指导动作和镜头运动。这段文字指令,就是 Prompt(提示词)。
视频 Prompt 不要只写“电影感,打斗激烈”。至少说清楚:
谁在动 → 怎么动 → 镜头怎么动 → 环境怎么变化 → 最终停在什么状态。
例如:
沈清璃右手持已出鞘长剑,后撤半步,以剑身挡住从画面右侧劈来的兵器;镜头从中景缓慢推近,暴雨持续,剑刃相撞后停在双方僵持的近景。
推镜头是镜头向主体靠近;跟拍是镜头跟随主体移动;摇镜头是机位基本不动、镜头向左或向右转。运镜不是装饰,它要帮助观众看清动作。
06|连续性:上一镜的结果,就是下一镜的起点
连续镜头最容易出现的错误,不是画面不漂亮,而是状态突然重置。
如果第07镜已经拔剑,第08镜就必须保留“右手握已出鞘长剑、腰右剑鞘为空”的状态。剑鞘不能突然缩短,也不能凭空又装着一把剑。
我们用 **Shot State(镜头状态)**记录人物位置、左右手、道具、衣物和动作的起止状态。它是这套生产表采用的管理字段。
上一镜结束状态=下一镜开始状态。
人物可以从门前进入院内,但手中的剑、衣服上的雨水和身体动作,不能无缘无故消失。

07|声音与剪辑:把素材接成故事
台词是角色在戏里说的话;旁白/VO是在画面之外讲述的声音。SFX是拔剑、脚步、兵器撞击等音效;环境声持续交代空间,例如暴雨与远雷;BGM是背景音乐。
剪辑点决定当前镜头在哪里结束、下一镜从哪里进入。“兵器相撞瞬间切近景”,就比“适时切换”更能执行。
如果先听到下一镜的脚步声,再切过去看见杀手,这是 J-cut;如果画面已经切到院内,上一镜的喊声还在继续,这是 L-cut。声音能帮助分段生成的视频接得更自然。
用一镜,把所有名词串起来
回到《灭门之夜》的雨夜对峙,生产表中的一行可以这样写:
第09镜|场:沈家镖局门前|景别:MS中景|人物:沈清璃|Shot State:右手持已出鞘长剑,腰右黑色长剑鞘为空|首帧:杀手从画面右侧逼近|视频:沈清璃后撤半步,横剑格挡|SFX:兵器相撞、暴雨|剪辑点:碰撞瞬间切下一镜。
每个名词都在回答一个具体问题:拍哪里、拍多近、谁出现、从什么状态开始、发生什么、听到什么、在哪里结束。
术语的作用不是让创作显得专业,而是让下一步能够照着做,让下一镜能够接得上。
下一篇,我们从最基础的一组区别开始:场、镜头、分镜、故事板、生产表究竟是什么?如何把一段剧情拆成5—8个可生成镜头?