像导演一样写提示词,一个镜头一个镜头地拍你的 MV
AI 音乐视频的上限,就是它背后那条提示词的上限。这是一份把一首歌「拍」出来的实战指南——镜头公式、运镜语言、如何让剪辑卡在节拍上,以及如何让你的歌手从第一帧到最后一帧都是同一个人。
别再写「配文」,开始写「分镜表」
让 AI 音乐视频脱胎换骨的,往往不是更强的模型,而是更好的提示词。
大多数人描述一首歌,写法像在配图说明:「一个女孩在雨里很伤感,电影感」。于是模型只能去猜所有真正重要的东西——她是谁、在做什么、镜头摆在哪、光怎么打、剪辑落在哪里。音乐视频提示词的写法恰好相反:你递给 AI 一张分镜表——明确的主体、精准的动作、框好的运镜、定好的画风,再加一两条约束。你不再「碰运气」,而是开始「当导演」。
一个女孩在雨里很伤感,电影感,唯美,4k
中景,一位身穿湿透灰色风衣的年轻女子站在路灯下,缓缓低下头,雨水顺着脸颊流下。镜头轻柔推近至特写。冷蓝色夜光,湿沥青上柔和的反光,电影质感。画面无文字。
同一个想法。一个把结果交给运气,另一个拿到你脑海里的那个镜头。
一条镜头提示词的解剖
八个构件,大致按这个顺序排。不必每次都写满八个——但你锁定得越多,AI 自由发挥的余地就越小。
主体 + 动作 + 场景 + 光影色调 + 运镜 + 风格 + 画质 + 约束1 · 主体
画面里是谁、是什么。用两三个稳定的视觉特征把它钉死——服饰、发型、年龄、类别——好让 AI 认得出、并在镜头之间保持一致。
一位身穿红色丝绸连衣裙、戴草帽的年轻女子
2 · 动作
主体在做什么,用「身体部位 + 程度」来写。「抬起手」胜过「动一下」。优先缓慢、连贯、有承接的动作,远比剧烈动作渲染得干净。
缓缓抬起下巴,把头转向窗户
3 · 场景
发生在哪、主体周围有什么——地点、时间,以及构成这个世界的前景与背景元素。
夜晚霓虹闪烁的天台廊道,身后全息广告明灭
4 · 光影色调
情绪就住在这里。点明光的方向、冷暖和色调——同一个场景,靠这一句就能读成浪漫,也能读成不安。
暖调黄金时刻逆光,柔和阴影,琥珀与青绿配色
5 · 运镜
怎么拍:景别 + 一个运镜。这是「一段平淡的片子」和「一个被导演过的画面」之间的差别。一个镜头只给一种运镜。
从全景缓慢推近到特写
6 · 风格
整体美术方向——真人实拍、2D 动漫、3D 动画、水墨、黏土定格、像素风。一定要写明,否则一张写实参考图会悄悄把一切拽向真人实拍。
2D 动漫风格,手绘,赛璐璐上色
7 · 画质
成片质感:清晰度、纹理,以及你想烘进去的电影感。一句简短的标准描述就够。
高清,细节丰富,胶片质感,色彩自然
8 · 约束
你不想要的东西。最有用的负向约束,是把多余文字、水印和 Logo 挡在画外,并阻止画风跑偏。
无字幕,无水印,无 Logo
说镜头听得懂的话
AI 视频模型对标准影视术语响应得很精准。学会这套词汇,你几个字就能框出任何一个镜头。黄金法则:一个镜头只用一种运镜——把推、摇、变焦堆进一句话,画面就会发飘。
运镜方式
推镜
镜头朝主体靠近——营造亲密或紧张。副歌特写的主力运镜。
拉镜
镜头后退、交代环境——适合「揭示」,或在一句歌词结尾让画面喘口气。
摇镜
镜头在固定点上左右转——扫过舞台、人群或天际线。
俯仰摇
镜头上下转——从脚摇到脸,或从天空落到街道。
跟镜 / 移镜
镜头与主体并行移动——边走边唱的能量,让走动中的歌手始终在画面里。
环绕
镜头绕主体转——180° 或 360° 弧线,把人秀出来。副歌钩子的绝配。
升降镜
镜头在空间里上升或下降——升到全景显气势,或下沉切入动作。
变焦
焦段变化来放大或压缩空间——快变焦给节拍点睛,慢变焦添不安。
景别
大远景
主体在广阔世界里很小——交代地点与规模,一首歌的定场镜头。
全景
全身入画——拍编舞和全身动作的最佳景别。
中景
腰部以上——对话感的默认景别,肢体语言和表情一起读到。
特写
脸占满画面——情绪、对口型,副歌的招牌镜头。
细节 / 微距
单个细节——眼睛、拨弦的手、滑落的泪——用来做节奏和质感的剪辑点。
机位 & 视角
平视
中性、踏实——观众与主体平起平坐。
低机位仰拍
镜头往上看——让主体显得强大、英雄、高大。
高机位俯拍
镜头往下看——让主体显得渺小、脆弱或迷失。
过肩镜头
越过一个人拍向另一个人——连接、对话、两人之间的张力。
主观 / 第一人称
主体自己的视角——把观众拉进当下这一刻。
航拍 / 无人机
高空俯瞰——辽阔的景、密集的人群,史诗般的尾声。
进阶提示:一个镜头一种运镜。想要又推又环绕?那就拆成两个镜头、在中间剪一刀——剪辑本身就是音乐的一部分。
让它动起来——也让它有情绪
你怎么描述动作,决定了一个镜头是「活的」还是「一张抖动的照片」。四个习惯,把干净的动态和一团融化的乱码区分开。
精确到身体部位
点明部位和程度:「缓缓抬起右手」「头微微侧几度」「用力蹬地」。「动一下」「跳个舞」这种模糊动词只会招来混乱。
优先缓慢连续的动作
轻柔、连贯的细微动作渲染得很漂亮;爆发式狂奔、大跳、剧烈旋转往往会扭曲变形。把高能量留给剪辑,别塞进单个镜头。
把过渡写出来
把前一个动作接到下一个,让动态有惯性:「借着转身的惯性顺势抬臂」,而不是两个互不相干的姿势。
把情绪外化
别写「她很伤心」。写出表现伤心的身体。模型渲染不了一个形容词——但它能渲染一个颤抖的肩膀。
把一首歌变成一张分镜表
音乐视频不是一条提示词,而是一个序列。把歌拆成段落,每段给一个镜头。用时间轴思维:谁、在哪、做什么、镜头怎么动,按发生的先后顺序排。
给一整支视频写提示词,最稳的方式是给镜头编号——镜头1、镜头2、镜头3——按顺序逐个描述。再把它们对到歌曲的结构上,让画面在音乐转折处一起转。
前奏
建立世界。一个定场全景或一个缓慢的细节——让观众在人声进来之前先「到场」。
主歌
讲故事。中景、边走边唱的跟镜,主体在场景里穿行。
推进 / 预副歌
抬升张力。推近、收紧构图,随着能量聚拢加快剪辑。
副歌 / 高潮
兑现承诺。特写、环绕、最大胆的光和最大的运镜——这是大家会记住的那个镜头。
桥段 / 尾声
释放或收束。拉回全景,让光淡下去,给最后一个画面留点呼吸。
每个镜头,四个层次
运镜
运镜或切镜方式——「从全景缓慢推近」「固定机位」「切到特写」。
主体与表情
这一拍的关键动作和表情变化。
空间
主体在哪、周围的场景如何变化。
声音与节拍
什么落在这个镜头上——重拍、Drop、一句歌词的击中。
让剪辑卡节拍,而不是卡秒表。按顺序描述发生了什么,让剪辑点落在节奏上——硬钉精确秒数(「0–3 秒」)反而容易把模型搞糊涂、把成片搞坏。
让你的歌手始终是同一个人
没有什么比「每个镜头换一张脸」更能毁掉一支 MV。参考图加上有纪律的提示词,能让你的角色从头一帧锁到最后一帧。
用 2–3 个特征锁定身份
用几个稳定、辨识度高的特征描述主体——衣着、发型、一件标志性配饰。每次提到他/她,都复用一模一样的描述。
一张特写 + 一张全身
一张干净的头肩特写钉住脸;一张全身图钉住衣着和身材比例。两张一起,比单张更能稳住身份。
把重要的参考放最前
参考出现得越早,权重越大。把这个镜头里最关键的那张放在最前面。
别堆太多参考
图不是越多越好。太多互相打架的参考会模糊掉 AI 对「什么重要」的判断——两三张强而清晰的,胜过一堆弱的。
在 SunoMV 里,把你的角色和场景存成「场景参考」,再让每个镜头的提示词指向它们——这样同一个歌手就能贯穿整首歌的每一句,不必每次重新描述。
毁掉 AI 音乐视频的那些坑
几乎每一个让人失望的结果,都能追溯到下面某一条。早点认出它们,命中率会飞快上升。
角色漂移
脸在镜头之间变了。用一张干净的特写参考、一套一致的 2–3 特征描述、并把关键参考放最前来解决。
画面冒出文字
随机字幕或乱码冒出来。加上「无字幕、无文字」,并优先用横屏——竖屏更容易长出杂乱文字。
画风漂移
一个动漫的想法渲染成了真人。明确写出风格;想要强烈画风,就从一张已经是该风格的参考图开始。
意外双胞胎
同一个人在画面里出现了两次。把每个主体绑到各自的参考,并加一条「禁止出现外形一致的重复人物」约束。
动作过猛
又快又猛的动作会让脸和四肢扭曲。把大动作拆到多个镜头里,让每个单镜保持平稳连贯。
参考过载
五张互相打架的图把结果搅浑。用两三张强参考,剩下的交给提示词。
硬钉精确秒数
硬时间码(「第 2 秒切」)会让生成失稳。改成描述顺序,让剪辑点跟着节拍走。
一句话里混语言
在一句台词里切换语言会搞乱发音。每句只用一种语言;常用字渲染得最干净。
三条提示词,从头到尾
套用这个骨架,把你的歌填进去。每个示例都是一条可以今天就粘贴的多镜头提示词——用上面的构件拼出来。
忧郁独立民谣
私密、被雨打湿、单角色、缓慢而动情。风格:电影感真人实拍,冷调胶片质感。主体:一位身穿湿透灰色风衣的年轻女子,深色头发贴在脸上。镜头1——定场全景,夜晚空荡的街道,琥珀色路灯下细雨落下,她小小地立在画面中;缓慢推近。镜头2——中景,她缓缓低头,雨水顺脸颊流下,呼出的气可见。镜头3——特写,一滴泪在眼眶里打转却没落下,她的目光抬向灯光。冷蓝色调,湿沥青上柔和反光,高清,胶片质感。无字幕,无水印。
为什么有效:一个锁定的角色,三个逐级递进的景别,一个镜头一种运镜,靠身体外化情绪,再配一条干净的约束。
明快合成器流行
明亮、动感、色彩跳脱,围着副歌 Drop 来搭。风格:鲜艳的 3D 动画,光泽感、色彩浓郁。主体:一位身穿霓虹运动套装、白色球鞋的舞者。镜头1(主歌)——中景跟镜,跟着她穿过一条阳光下色块拼接的走廊。镜头2(推进)——低机位仰拍,在她下蹲时推近,光逐渐变亮。镜头3(副歌 Drop)——360° 环绕,她猛地双臂上举,彩纸迸发,饱和的粉与青光。利落、有劲、高清。画面无文字,无 Logo。
为什么有效:镜头对到了歌曲段落,最大的运镜和最亮的光留给了 Drop,能量活在剪辑里,而不是塞进一个手忙脚乱的镜头。
电影感赛博朋克 / 嘻哈
风格化、霓虹、阴郁、超越现实。风格:3D 赛博朋克科幻动画,冷调蓝紫配色。主体:一位身穿带发光镶边黑色连帽夹克的艺人。镜头1——航拍无人机俯冲,向夜晚被雨打湿的霓虹都市下降。镜头2——低机位中景,他穿过全息广告走向镜头,抬头迎向镜头;缓慢跟镜。镜头3——特写,霓虹的反光从他脸上滑过,他对着镜头念出钩子;固定机位。阴郁的体积光,深邃阴影,胶片颗粒。无字幕,无水印,无 Logo。
为什么有效:一个明确写出的强风格统住整段序列,低机位营造气场,每个镜头都恰好只用一种运镜——俯冲、跟、定。
一屏看完的总结
把上面所有内容浓缩到这里。截个图,放在你的提示框旁边。
主体 + 动作 + 场景 + 光影色调 + 运镜 + 风格 + 画质 + 约束要这么做
- 写分镜表,别写配文。
- 用 2–3 个稳定特征锁定主体,并反复复用。
- 一个镜头一种运镜——其余的靠剪辑。
- 用身体外化情绪,别用形容词。
- 把镜头对到歌曲段落;让剪辑卡节拍。
- 结尾加约束:无文字、无水印、无 Logo。
别这么做
- 别把推 + 摇 + 变焦堆进一个镜头。
- 别硬钉精确时间码。
- 别在单个镜头里要求剧烈爆发的动作。
- 别用一堆互相打架的参考图压垮提示词。
- 别在写实参考旁边不写风格。
- 别在一句台词里切换语言。
音乐视频提示词常见问题
什么是音乐视频提示词工程?
它是把一首歌描述给 AI 视频模型、让它还原出你脑海里那些镜头的手艺——为歌曲的每个部分挑好主体、动作、运镜、光影和风格,而不是打一段含糊的描述然后碰运气。做得好,这就是「一段普通片子」和「一支被导演过的 MV」之间的差别。
写好提示词需要懂影视术语吗?
懂会很有帮助,而且很快就能学会——推镜、摇镜、特写、低机位。这一页的词汇基本覆盖你这辈子会用到的。AI 模型对这些标准术语响应得很精准,几个字就能框出一整个镜头。
怎么让同一个角色贯穿整支视频?
用参考图——最好是一张干净的特写加一张全身——并且每次都用同样的 2–3 个特征描述角色。在 SunoMV 里你可以把角色存成「场景参考」,让每个镜头都指向它,于是他/她从第一句到最后一句都保持一致。
为什么我的 AI 音乐视频里有随机文字或字幕?
模型有时会自己造出画面文字。在提示词里加一条「无字幕、无文字」,并优先用横屏——竖屏更容易长出杂乱文字。你也可以事后再裁成竖屏。
我该写一条长提示词,还是分成几个镜头?
分成几个镜头。给它们编号镜头1、镜头2、镜头3,按顺序描述,并对到歌曲段落。一串清晰的镜头,远比一段想一口气搞定所有事的长文可靠。
为什么动作看起来像融化或扭曲了?
通常是单个镜头里动作太多。优先缓慢、连续、精确到身体部位的动作,把大动作拆到多个镜头里。平稳的镜头剪在一起就显得很有能量;一个手忙脚乱的镜头只会扭曲。
这些技巧能用在任何 AI 视频模型上吗?
能。这套公式——主体、动作、场景、光影、运镜、风格、约束——是通用的手艺。SunoMV 让你从多个先进视频模型里挑选、自由切换,但你写提示词的方式在所有模型上都通用。
我具体在 SunoMV 哪里做这件事?
粘贴一首歌或新建一首,然后打开歌曲页:每一句歌词都成为一个你可以单独写提示词的镜头,配上场景参考来保持角色和场景一致。标题、封面、作者在「编辑信息」(铅笔图标)里改。下面就能免费开始,导演你的第一支视频。