提示詞工程指南

像導演一樣寫提示詞,一個鏡頭一個鏡頭地拍你的 MV

AI 音樂影片的上限,就是它背後那條提示詞的上限。這是一份把一首歌「拍」出來的實戰指南——鏡頭公式、運鏡語言、如何讓剪輯卡在節拍上,以及如何讓你的歌手從第一格到最後一格都是同一個人。

8
提示詞構件
20+
鏡頭 & 景別術語
3
完整實戰範例
心法

別再寫「配文」,開始寫「分鏡表」

讓 AI 音樂影片脫胎換骨的,往往不是更強的模型,而是更好的提示詞。

大多數人描述一首歌,寫法像在配圖說明:「一個女孩在雨裡很傷感,電影感」。於是模型只能去猜所有真正重要的東西——她是誰、在做什麼、鏡頭擺在哪、光怎麼打、剪輯落在哪裡。音樂影片提示詞的寫法恰好相反:你遞給 AI 一張分鏡表——明確的主體、精準的動作、框好的運鏡、定好的畫風,再加一兩條約束。你不再「碰運氣」,而是開始「當導演」。

配文式 — 全靠模型猜

一個女孩在雨裡很傷感,電影感,唯美,4k

分鏡式 — 你來導演

中景,一位身穿濕透灰色風衣的年輕女子站在路燈下,緩緩低下頭,雨水順著臉頰流下。鏡頭輕柔推近至特寫。冷藍色夜光,濕瀝青上柔和的反光,電影質感。畫面無文字。

同一個想法。一個把結果交給運氣,另一個拿到你腦海裡的那個鏡頭。

公式

一條鏡頭提示詞的解剖

八個構件,大致按這個順序排。不必每次都寫滿八個——但你鎖定得越多,AI 自由發揮的餘地就越小。

主體 + 動作 + 場景 + 光影色調 + 運鏡 + 風格 + 畫質 + 約束

1 · 主體

畫面裡是誰、是什麼。用兩三個穩定的視覺特徵把它釘死——服飾、髮型、年齡、類別——好讓 AI 認得出、並在鏡頭之間保持一致。

一位身穿紅色絲綢連身裙、戴草帽的年輕女子

2 · 動作

主體在做什麼,用「身體部位 + 程度」來寫。「抬起手」勝過「動一下」。優先緩慢、連貫、有承接的動作,遠比劇烈動作渲染得乾淨。

緩緩抬起下巴,把頭轉向窗戶

3 · 場景

發生在哪、主體周圍有什麼——地點、時間,以及構成這個世界的前景與背景元素。

夜晚霓虹閃爍的天台廊道,身後全像廣告明滅

4 · 光影色調

情緒就住在這裡。點明光的方向、冷暖和色調——同一個場景,靠這一句就能讀成浪漫,也能讀成不安。

暖調黃金時刻逆光,柔和陰影,琥珀與青綠配色

5 · 運鏡

怎麼拍:景別 + 一個運鏡。這是「一段平淡的片子」和「一個被導演過的畫面」之間的差別。一個鏡頭只給一種運鏡。

從全景緩慢推近到特寫

6 · 風格

整體美術方向——真人實拍、2D 動漫、3D 動畫、水墨、黏土定格、像素風。一定要寫明,否則一張寫實參考圖會悄悄把一切拽向真人實拍。

2D 動漫風格,手繪,賽璐璐上色

7 · 畫質

成片質感:清晰度、紋理,以及你想烘進去的電影感。一句簡短的標準描述就夠。

高畫質,細節豐富,膠片質感,色彩自然

8 · 約束

你不想要的東西。最有用的負向約束,是把多餘文字、浮水印和 Logo 擋在畫外,並阻止畫風跑偏。

無字幕,無浮水印,無 Logo

運鏡語言

說鏡頭聽得懂的話

AI 影片模型對標準影視術語回應得很精準。學會這套詞彙,你幾個字就能框出任何一個鏡頭。黃金法則:一個鏡頭只用一種運鏡——把推、搖、變焦堆進一句話,畫面就會發飄。

運鏡方式

推鏡

鏡頭朝主體靠近——營造親密或緊張。副歌特寫的主力運鏡。

拉鏡

鏡頭後退、交代環境——適合「揭示」,或在一句歌詞結尾讓畫面喘口氣。

搖鏡

鏡頭在固定點上左右轉——掃過舞台、人群或天際線。

俯仰搖

鏡頭上下轉——從腳搖到臉,或從天空落到街道。

跟鏡 / 移鏡

鏡頭與主體並行移動——邊走邊唱的能量,讓走動中的歌手始終在畫面裡。

環繞

鏡頭繞主體轉——180° 或 360° 弧線,把人秀出來。副歌鉤子的絕配。

升降鏡

鏡頭在空間裡上升或下降——升到全景顯氣勢,或下沉切入動作。

變焦

焦段變化來放大或壓縮空間——快變焦給節拍點睛,慢變焦添不安。

景別

大遠景

主體在廣闊世界裡很小——交代地點與規模,一首歌的定場鏡頭。

全景

全身入鏡——拍編舞和全身動作的最佳景別。

中景

腰部以上——對話感的預設景別,肢體語言和表情一起讀到。

特寫

臉占滿畫面——情緒、對嘴,副歌的招牌鏡頭。

細節 / 微距

單個細節——眼睛、撥弦的手、滑落的淚——用來做節奏和質感的剪輯點。

機位 & 視角

平視

中性、踏實——觀眾與主體平起平坐。

低機位仰拍

鏡頭往上看——讓主體顯得強大、英雄、高大。

高機位俯拍

鏡頭往下看——讓主體顯得渺小、脆弱或迷失。

過肩鏡頭

越過一個人拍向另一個人——連接、對話、兩人之間的張力。

主觀 / 第一人稱

主體自己的視角——把觀眾拉進當下這一刻。

空拍 / 無人機

高空俯瞰——遼闊的景、密集的人群,史詩般的尾聲。

進階提示:一個鏡頭一種運鏡。想要又推又環繞?那就拆成兩個鏡頭、在中間剪一刀——剪輯本身就是音樂的一部分。

動作與情緒

讓它動起來——也讓它有情緒

你怎麼描述動作,決定了一個鏡頭是「活的」還是「一張抖動的照片」。四個習慣,把乾淨的動態和一團融化的亂碼區分開。

精確到身體部位

點明部位和程度:「緩緩抬起右手」「頭微微側幾度」「用力蹬地」。「動一下」「跳個舞」這種模糊動詞只會招來混亂。

優先緩慢連續的動作

輕柔、連貫的細微動作渲染得很漂亮;爆發式狂奔、大跳、劇烈旋轉往往會扭曲變形。把高能量留給剪輯,別塞進單個鏡頭。

把過渡寫出來

把前一個動作接到下一個,讓動態有慣性:「藉著轉身的慣性順勢抬臂」,而不是兩個互不相干的姿勢。

把情緒外化

別寫「她很傷心」。寫出表現傷心的身體。模型渲染不了一個形容詞——但它能渲染一個顫抖的肩膀。

把情緒變成畫面
悲傷
低著頭,肩膀微微顫抖,眼眶泛紅,手指攥緊衣袖,淚水在眼裡打轉卻沒落下
喜悅
嘴角抑制不住地上揚,眉眼舒展,腳步變輕快,忍不住原地轉一圈
緊張
頻頻看向門口,手指不停敲擊,呼吸變淺,眼神閃躲游移
憤怒
雙拳緊握,下顎緊繃,胸口劇烈起伏,目光銳利如刀
釋然
長長舒一口氣,緊繃的肩膀鬆垮下來,淺淺一笑,抬眼望向遠方
分鏡與卡點

把一首歌變成一張分鏡表

音樂影片不是一條提示詞,而是一個序列。把歌拆成段落,每段給一個鏡頭。用時間軸思維:誰、在哪、做什麼、鏡頭怎麼動,按發生的先後順序排。

給一整支影片寫提示詞,最穩的方式是給鏡頭編號——鏡頭1、鏡頭2、鏡頭3——按順序逐個描述。再把它們對到歌曲的結構上,讓畫面在音樂轉折處一起轉。

01

前奏

建立世界。一個定場全景或一個緩慢的細節——讓觀眾在人聲進來之前先「到場」。

02

主歌

講故事。中景、邊走邊唱的跟鏡,主體在場景裡穿行。

03

推進 / 預副歌

抬升張力。推近、收緊構圖,隨著能量聚攏加快剪輯。

04

副歌 / 高潮

兌現承諾。特寫、環繞、最大膽的光和最大的運鏡——這是大家會記住的那個鏡頭。

05

橋段 / 尾聲

釋放或收束。拉回全景,讓光淡下去,給最後一個畫面留點呼吸。

每個鏡頭,四個層次

運鏡

運鏡或切鏡方式——「從全景緩慢推近」「固定機位」「切到特寫」。

主體與表情

這一拍的關鍵動作和表情變化。

空間

主體在哪、周圍的場景如何變化。

聲音與節拍

什麼落在這個鏡頭上——重拍、Drop、一句歌詞的擊中。

讓剪輯卡節拍,而不是卡碼錶。按順序描述發生了什麼,讓剪輯點落在節奏上——硬釘精確秒數(「0–3 秒」)反而容易把模型搞糊塗、把成片搞壞。

角色一致性

讓你的歌手始終是同一個人

沒有什麼比「每個鏡頭換一張臉」更能毀掉一支 MV。參考圖加上有紀律的提示詞,能讓你的角色從頭一格鎖到最後一格。

用 2–3 個特徵鎖定身份

用幾個穩定、辨識度高的特徵描述主體——衣著、髮型、一件標誌性配飾。每次提到他/她,都複用一模一樣的描述。

一張特寫 + 一張全身

一張乾淨的頭肩特寫釘住臉;一張全身圖釘住衣著和身材比例。兩張一起,比單張更能穩住身份。

把重要的參考放最前

參考出現得越早,權重越大。把這個鏡頭裡最關鍵的那張放在最前面。

別堆太多參考

圖不是越多越好。太多互相打架的參考會模糊掉 AI 對「什麼重要」的判斷——兩三張強而清晰的,勝過一堆弱的。

在 SunoMV 裡,把你的角色和場景存成「場景參考」,再讓每個鏡頭的提示詞指向它們——這樣同一個歌手就能貫穿整首歌的每一句,不必每次重新描述。

請避開

毀掉 AI 音樂影片的那些坑

幾乎每一個讓人失望的結果,都能追溯到下面某一條。早點認出它們,命中率會飛快上升。

角色漂移

臉在鏡頭之間變了。用一張乾淨的特寫參考、一套一致的 2–3 特徵描述、並把關鍵參考放最前來解決。

畫面冒出文字

隨機字幕或亂碼冒出來。加上「無字幕、無文字」,並優先用橫式——直式更容易長出雜亂文字。

畫風漂移

一個動漫的想法渲染成了真人。明確寫出風格;想要強烈畫風,就從一張已經是該風格的參考圖開始。

意外雙胞胎

同一個人在畫面裡出現了兩次。把每個主體綁到各自的參考,並加一條「禁止出現外形一致的重複人物」約束。

動作過猛

又快又猛的動作會讓臉和四肢扭曲。把大動作拆到多個鏡頭裡,讓每個單鏡保持平穩連貫。

參考過載

五張互相打架的圖把結果攪渾。用兩三張強參考,剩下的交給提示詞。

硬釘精確秒數

硬時間碼(「第 2 秒切」)會讓生成失穩。改成描述順序,讓剪輯點跟著節拍走。

一句話裡混語言

在一句台詞裡切換語言會搞亂發音。每句只用一種語言;常用字渲染得最乾淨。

實戰範例

三條提示詞,從頭到尾

套用這個骨架,把你的歌填進去。每個範例都是一條可以今天就貼上的多鏡頭提示詞——用上面的構件拼出來。

憂鬱獨立民謠

私密、被雨打濕、單角色、緩慢而動情。
風格:電影感真人實拍,冷調膠片質感。主體:一位身穿濕透灰色風衣的年輕女子,深色頭髮貼在臉上。鏡頭1——定場全景,夜晚空蕩的街道,琥珀色路燈下細雨落下,她小小地立在畫面中;緩慢推近。鏡頭2——中景,她緩緩低頭,雨水順臉頰流下,呼出的氣可見。鏡頭3——特寫,一滴淚在眼眶裡打轉卻沒落下,她的目光抬向燈光。冷藍色調,濕瀝青上柔和反光,高畫質,膠片質感。無字幕,無浮水印。

為什麼有效:一個鎖定的角色,三個逐級遞進的景別,一個鏡頭一種運鏡,靠身體外化情緒,再配一條乾淨的約束。

明快合成器流行

明亮、動感、色彩跳脫,圍著副歌 Drop 來搭。
風格:鮮豔的 3D 動畫,光澤感、色彩濃郁。主體:一位身穿霓虹運動套裝、白色球鞋的舞者。鏡頭1(主歌)——中景跟鏡,跟著她穿過一條陽光下色塊拼接的走廊。鏡頭2(推進)——低機位仰拍,在她下蹲時推近,光逐漸變亮。鏡頭3(副歌 Drop)——360° 環繞,她猛地雙臂上舉,彩紙迸發,飽和的粉與青光。俐落、有勁、高畫質。畫面無文字,無 Logo。

為什麼有效:鏡頭對到了歌曲段落,最大的運鏡和最亮的光留給了 Drop,能量活在剪輯裡,而不是塞進一個手忙腳亂的鏡頭。

電影感賽博龐克 / 嘻哈

風格化、霓虹、陰鬱、超越現實。
風格:3D 賽博龐克科幻動畫,冷調藍紫配色。主體:一位身穿帶發光鑲邊黑色連帽外套的藝人。鏡頭1——空拍無人機俯衝,向夜晚被雨打濕的霓虹都市下降。鏡頭2——低機位中景,他穿過全像廣告走向鏡頭,抬頭迎向鏡頭;緩慢跟鏡。鏡頭3——特寫,霓虹的反光從他臉上滑過,他對著鏡頭念出鉤子;固定機位。陰鬱的體積光,深邃陰影,膠片顆粒。無字幕,無浮水印,無 Logo。

為什麼有效:一個明確寫出的強風格統住整段序列,低機位營造氣場,每個鏡頭都恰好只用一種運鏡——俯衝、跟、定。

速查表

一屏看完的總結

把上面所有內容濃縮到這裡。截個圖,放在你的提示框旁邊。

主體 + 動作 + 場景 + 光影色調 + 運鏡 + 風格 + 畫質 + 約束

要這麼做

  • 寫分鏡表,別寫配文。
  • 用 2–3 個穩定特徵鎖定主體,並反覆複用。
  • 一個鏡頭一種運鏡——其餘的靠剪輯。
  • 用身體外化情緒,別用形容詞。
  • 把鏡頭對到歌曲段落;讓剪輯卡節拍。
  • 結尾加約束:無文字、無浮水印、無 Logo。

別這麼做

  • 別把推 + 搖 + 變焦堆進一個鏡頭。
  • 別硬釘精確時間碼。
  • 別在單個鏡頭裡要求劇烈爆發的動作。
  • 別用一堆互相打架的參考圖壓垮提示詞。
  • 別在寫實參考旁邊不寫風格。
  • 別在一句台詞裡切換語言。

音樂影片提示詞常見問題

什麼是音樂影片提示詞工程?

它是把一首歌描述給 AI 影片模型、讓它還原出你腦海裡那些鏡頭的手藝——為歌曲的每個部分挑好主體、動作、運鏡、光影和風格,而不是打一段含糊的描述然後碰運氣。做得好,這就是「一段普通片子」和「一支被導演過的 MV」之間的差別。

寫好提示詞需要懂影視術語嗎?

懂會很有幫助,而且很快就能學會——推鏡、搖鏡、特寫、低機位。這一頁的詞彙基本涵蓋你這輩子會用到的。AI 模型對這些標準術語回應得很精準,幾個字就能框出一整個鏡頭。

怎麼讓同一個角色貫穿整支影片?

用參考圖——最好是一張乾淨的特寫加一張全身——並且每次都用同樣的 2–3 個特徵描述角色。在 SunoMV 裡你可以把角色存成「場景參考」,讓每個鏡頭都指向它,於是他/她從第一句到最後一句都保持一致。

為什麼我的 AI 音樂影片裡有隨機文字或字幕?

模型有時會自己造出畫面文字。在提示詞裡加一條「無字幕、無文字」,並優先用橫式——直式更容易長出雜亂文字。你也可以事後再裁成直式。

我該寫一條長提示詞,還是分成幾個鏡頭?

分成幾個鏡頭。給它們編號鏡頭1、鏡頭2、鏡頭3,按順序描述,並對到歌曲段落。一串清晰的鏡頭,遠比一段想一口氣搞定所有事的長文可靠。

為什麼動作看起來像融化或扭曲了?

通常是單個鏡頭裡動作太多。優先緩慢、連續、精確到身體部位的動作,把大動作拆到多個鏡頭裡。平穩的鏡頭剪在一起就顯得很有能量;一個手忙腳亂的鏡頭只會扭曲。

這些技巧能用在任何 AI 影片模型上嗎?

能。這套公式——主體、動作、場景、光影、運鏡、風格、約束——是通用的手藝。SunoMV 讓你從多個先進影片模型裡挑選、自由切換,但你寫提示詞的方式在所有模型上都通用。

我具體在 SunoMV 哪裡做這件事?

貼上一首歌或新建一首,然後打開編輯器:每一句歌詞都成為一個你可以單獨寫提示詞的鏡頭,配上場景參考來保持角色和場景一致。下面就能免費開始,導演你的第一支影片。

現在,去導演你的歌

公式、運鏡語言和範例你都有了。貼上一首曲子,寫下你的第一張分鏡表,看 AI 把它拍出來。