감독처럼 프롬프트를 써서, 한 컷씩 뮤직비디오를 찍자
AI 뮤직비디오의 한계는 곧 그 뒤에 있는 프롬프트의 한계입니다. 이 가이드는 한 곡을 '영상으로' 찍어내는 실전 안내서입니다. 샷 공식, 카메라 언어, 컷을 비트에 맞추는 법, 그리고 첫 프레임부터 마지막까지 보컬을 같은 사람으로 유지하는 법까지 담았습니다.
'캡션' 쓰기를 멈추고, '샷 리스트'를 쓰자
AI 뮤직비디오를 확 바꾸는 건 대개 더 좋은 모델이 아니라 더 좋은 프롬프트입니다.
대부분은 곡을 캡션 쓰듯 묘사합니다. "비 속의 슬픈 소녀, 시네마틱." 그러면 모델은 정작 중요한 모든 것을 추측해야 합니다. 그녀가 누구인지, 무엇을 하는지, 카메라는 어디에 놓이는지, 빛은 어떻게 떨어지는지, 컷은 어디서 떨어지는지. 뮤직비디오 프롬프트는 정반대로 작동합니다. 당신은 AI에게 샷 리스트를 건넵니다. 명확한 피사체, 정확한 동작, 프레이밍한 카메라 무빙, 정해진 화풍, 그리고 한두 개의 제약. 운에 맡기기를 멈추고 연출을 시작하는 겁니다.
비 속의 슬픈 소녀, 시네마틱, 감성적, 아름다움, 4k
미디엄 샷, 흠뻑 젖은 회색 코트를 입은 젊은 여성이 가로등 아래 서서 천천히 고개를 숙이고, 빗물이 뺨을 타고 흐른다. 카메라가 부드럽게 클로즈업으로 밀고 들어간다. 차가운 푸른 밤빛, 젖은 아스팔트 위의 은은한 반사, 시네마틱한 필름 질감. 화면에 텍스트 없음.
같은 아이디어지만, 하나는 결과를 운에 맡기고, 다른 하나는 머릿속에 그린 그 샷을 얻습니다.
샷 프롬프트의 해부도
여덟 가지 구성 요소를 대략 이 순서로. 매번 여덟 개를 다 쓸 필요는 없습니다. 다만 고정하는 요소가 많을수록 AI가 멋대로 변주할 여지는 줄어듭니다.
피사체 + 동작 + 장면 + 빛과 색 + 카메라 + 스타일 + 화질 + 제약1 · 피사체
화면에 누가, 무엇이 있는가. 의상, 머리, 나이, 종류 같은 안정적인 시각 특징 두세 개로 못 박아, AI가 알아보고 컷 사이에서 흔들리지 않게 합니다.
빨간 실크 드레스에 밀짚모자를 쓴 젊은 여성
2 · 동작
피사체가 무엇을 하는지, 신체 부위와 정도로 씁니다. "움직인다"보다 "손을 든다"가 낫습니다. 격한 동작보다 느리고 연속적이며 이어지는 움직임을 우선하면 훨씬 깔끔하게 렌더링됩니다.
천천히 턱을 들어 창문 쪽으로 고개를 돌린다
3 · 장면
어디서 일어나며 피사체 주변에 무엇이 있는가. 장소, 시간대, 그리고 세계를 이루는 전경과 배경 요소.
밤, 네온 불빛이 비치는 옥상 복도, 뒤로 깜빡이는 홀로그램 광고
4 · 빛과 색
정서는 여기에 깃듭니다. 빛의 방향, 온도, 색조를 콕 집으세요. 같은 장면도 이 한 줄에 따라 로맨스로도, 불안으로도 읽힙니다.
따뜻한 골든아워 역광, 부드러운 그림자, 앰버와 틸 색조
5 · 카메라
어떻게 찍는가. 샷 사이즈와 하나의 카메라 무빙. 이것이 밋밋한 클립과 연출된 프레임의 차이입니다. 한 샷에는 무빙 하나만.
와이드 샷에서 클로즈업으로 천천히 밀어 들어가기
6 · 스타일
전체 미술 방향. 실사, 2D 애니메이션, 3D 애니메이션, 수묵화, 클레이 애니메이션, 픽셀 아트. 반드시 명시하세요. 그러지 않으면 사실적인 참고 사진이 조용히 모든 걸 실사 쪽으로 끌고 갑니다.
2D 애니메이션 스타일, 손그림, 셀 셰이딩
7 · 화질
완성 질감. 선명도, 텍스처, 그리고 담아내고 싶은 시네마틱한 느낌. 짧고 표준적인 문구면 충분합니다.
고해상도, 풍부한 디테일, 필름 질감, 자연스러운 색
8 · 제약
원하지 않는 것. 가장 유용한 부정 지정은 군더더기 텍스트, 워터마크, Logo를 화면 밖으로 밀어내고, 화풍이 어긋나지 않게 막는 것입니다.
자막 없음, 워터마크 없음, Logo 없음
카메라가 알아듣는 말로 하자
AI 영상 모델은 표준 영화 용어에 정확하게 반응합니다. 이 어휘를 익히면 어떤 샷이든 몇 마디로 프레이밍할 수 있습니다. 황금률은 한 샷에 카메라 무빙 하나. 밀기, 패닝, 줌을 한 줄에 욱여넣으면 화면이 흔들립니다.
카메라 무빙
밀기(푸시 인)
카메라가 피사체로 다가간다 — 친밀함이나 긴장을 쌓는다. 후렴 클로즈업의 주력 무빙.
당기기(풀 백)
카메라가 물러나 상황을 보여준다 — 반전에 좋고, 한 소절 끝에서 장면에 숨을 틔워준다.
패닝
고정된 지점에서 카메라가 좌우로 돈다 — 무대, 군중, 스카이라인을 훑는다.
틸트
카메라가 위아래로 돈다 — 발에서 얼굴로 올라가거나, 하늘에서 거리로 내려간다.
트래킹 / 달리
카메라가 피사체와 나란히 이동한다 — 걸으며 노래하는 에너지를 만들어, 움직이는 보컬을 항상 프레임에 담는다.
오비트(선회)
카메라가 피사체 둘레를 돈다 — 180° 또는 360° 호로 피사체를 뽐낸다. 훅에 딱 맞는다.
크레인 / 붐
카메라가 공간을 따라 오르내린다 — 와이드로 올려 규모를 내거나, 액션 속으로 내려간다.
줌
초점 거리를 바꿔 확대하거나 압축한다 — 빠른 줌은 비트를 강조하고, 느린 줌은 불안을 더한다.
샷 사이즈
익스트림 와이드
광활한 세계 속의 작은 피사체 — 장소와 규모를 세우는, 한 곡의 설정 샷.
와이드 / 풀 샷
전신이 프레임에 들어간다 — 안무와 전신 동작에 가장 좋은 사이즈.
미디엄
허리 위 — 대화적인 기본값. 몸짓과 표정을 함께 읽는다.
클로즈업
얼굴이 프레임을 채운다 — 감정, 립싱크, 후렴의 결정적 샷.
디테일 / 매크로
단 하나의 디테일 — 눈, 줄을 짚는 손, 떨어지는 눈물 — 리듬과 질감의 컷에.
앵글 & 시점
아이 레벨
중립적이고 안정적 — 관객이 피사체를 대등하게 마주한다.
로우 앵글(올려찍기)
카메라가 올려다본다 — 피사체를 강하고, 영웅적이며, 실제보다 크게 보이게 한다.
하이 앵글(내려찍기)
카메라가 내려다본다 — 피사체를 작고, 취약하며, 길 잃은 듯 보이게 한다.
오버 더 숄더
한 인물의 어깨 너머로 다른 인물을 잡는다 — 연결, 대화, 둘 사이의 긴장.
POV / 1인칭
피사체 자신의 시야 — 관객을 그 순간 안으로 끌어들인다.
항공 / 드론
높은 곳에서 내려다본다 — 광활한 풍경, 군중, 웅장한 아웃트로.
프로 팁: 한 샷에 무빙 하나. 밀기와 선회를 둘 다 원한다면? 두 샷으로 나누고 그 사이를 컷하세요 — 컷 자체가 음악의 일부입니다.
움직이게 하라 — 그리고 느끼게 하라
동작을 어떻게 묘사하느냐가 한 샷을 '살아 있는' 것으로 만들지, '깜빡이는 사진'으로 만들지를 결정합니다. 깔끔한 움직임과 녹아내린 엉망을 가르는 건 네 가지 습관입니다.
신체 부위로 구체적으로
부위와 정도를 콕 집으세요. "천천히 오른손을 든다", "고개를 몇 도 기울인다", "발을 세게 디딘다." "움직인다", "춤춘다" 같은 막연한 동사는 혼란만 부릅니다.
느리고 연속적인 움직임을 우선
부드럽게 이어지는 미세한 움직임은 아름답게 렌더링됩니다. 폭발적인 질주, 큰 점프, 격렬한 회전은 일그러지기 쉽습니다. 높은 에너지는 컷에 남기고, 한 샷에 욱여넣지 마세요.
전환을 써넣어라
앞 동작을 다음으로 이어 움직임에 관성을 주세요. 무관한 두 포즈를 늘어놓는 대신 "돌아서는 기세를 살려 팔을 든다"처럼.
감정을 밖으로 드러내라
"그녀는 슬프다"라고 쓰지 마세요. 슬픔을 보여주는 몸을 쓰세요. 모델은 형용사를 렌더링하지 못하지만, 떨리는 어깨는 렌더링할 수 있습니다.
한 곡을 샷 리스트로 바꾸기
뮤직비디오는 프롬프트 하나가 아니라 시퀀스입니다. 곡을 섹션으로 나누고 각 섹션에 고유한 샷을 주세요. 타임라인으로 생각하세요. 누가, 어디서, 무엇을 하고, 카메라가 어떻게 움직이는지를 벌어지는 순서대로 늘어놓으세요.
한 편의 영상 전체에 프롬프트를 쓰는 가장 확실한 방법은 샷에 번호를 매기는 것입니다. 샷 1, 샷 2, 샷 3. 순서대로 하나씩 묘사하고 곡 구조에 대응시켜, 음악이 전환될 때 화면도 함께 전환되게 하세요.
인트로
세계를 세운다. 설정용 와이드나 느린 디테일로 — 보컬이 들어오기 전에 관객이 먼저 '도착'하게 한다.
벌스
이야기를 들려준다. 미디엄 샷, 걸으며 노래하는 트래킹, 장면을 가로지르는 피사체.
고조 / 프리코러스
긴장을 끌어올린다. 밀고 들어가 구도를 조이고, 에너지가 모일수록 컷을 빠르게 한다.
후렴 / 드롭
약속을 지키는 순간. 클로즈업, 선회, 가장 대담한 빛과 가장 큰 무빙 — 사람들이 기억하는 그 샷.
브리지 / 아웃트로
풀어내거나 마무리한다. 와이드로 당기고, 빛을 사그라뜨리며, 마지막 한 장면에 여운을 남긴다.
모든 샷, 네 개의 층
카메라
무빙이나 컷 방식 — "와이드에서 천천히 밀기", "고정 프레임", "클로즈업으로 컷".
피사체와 표정
이 박자에서의 핵심 동작과 표정 변화.
공간
피사체가 어디 있고 주변 장면이 어떻게 바뀌는가.
소리와 비트
이 샷에 무엇이 떨어지는가 — 다운비트, 드롭, 마음을 때리는 한 소절.
컷은 시계가 아니라 비트에 맞추세요. 순서대로 무슨 일이 일어나는지 묘사하고 컷이 리듬에 떨어지게 두세요 — 정확한 초를 못 박으면("0~3초") 모델을 헷갈리게 하고 결과를 망치기 쉽습니다.
보컬을 같은 사람으로 유지하기
컷마다 얼굴이 바뀌는 것만큼 뮤직비디오를 망치는 건 없습니다. 참고 이미지와 규율 있는 프롬프트가 캐릭터를 첫 프레임부터 마지막까지 고정합니다.
2~3개 특징으로 정체성 고정
의상, 머리, 상징적인 소품 같은 안정적이고 분명한 특징 몇 개로 피사체를 묘사하세요. 언급할 때마다 똑같은 묘사를 그대로 다시 쓰세요.
클로즈업 + 전신을 함께 쓰기
깔끔한 상반신 초상은 얼굴을 고정하고, 전신 샷은 의상과 비율을 고정합니다. 둘을 함께 쓰면 한 장보다 정체성을 훨씬 잘 붙들 수 있습니다.
중요한 참고를 맨 앞에
참고는 일찍 나올수록 비중이 커집니다. 이 샷에서 가장 중요한 한 장을 맨 앞에 두세요.
참고를 너무 많이 넣지 말 것
이미지가 많다고 좋은 게 아닙니다. 서로 부딪치는 참고가 너무 많으면 AI의 '무엇이 중요한가' 감각이 흐려집니다. 강하고 또렷한 두세 장이 약한 한 무더기를 이깁니다.
SunoMV에서는 캐릭터와 장소를 '장면 참고'로 저장한 뒤 각 샷의 프롬프트가 그것을 가리키게 할 수 있습니다 — 그래서 같은 보컬이 매번 다시 묘사하지 않아도 곡의 모든 소절을 관통합니다.
AI 뮤직비디오를 망치는 실수들
실망스러운 결과의 거의 전부는 아래 중 하나로 거슬러 올라갑니다. 일찍 알아채면 적중률이 빠르게 올라갑니다.
정체성 흔들림
컷 사이에 얼굴이 바뀐다. 깔끔한 클로즈업 참고, 일관된 2~3개 특징 묘사, 그리고 핵심 참고를 맨 앞에 두어 해결하세요.
화면에 원치 않는 텍스트
무작위 자막이나 깨진 글자가 나온다. "자막 없음, 텍스트 없음"을 더하고 와이드 화면을 우선하세요 — 세로 프레임은 군더더기 텍스트가 더 자주 생깁니다.
화풍 흔들림
애니메이션 의도가 실사로 렌더링된다. 스타일을 명시하고, 강한 화풍이 필요하면 이미 그 화풍인 참고 이미지에서 시작하세요.
의도치 않은 쌍둥이
같은 사람이 프레임에 두 번 나온다. 각 피사체를 자기 참고에 묶고, "외모가 같은 중복 인물 금지" 제약을 더하세요.
너무 많은 움직임
빠르고 격한 동작은 얼굴과 팔다리를 일그러뜨립니다. 큰 움직임을 컷으로 나누고 각 샷은 차분하게 이어지게 하세요.
참고 과부하
서로 부딪치는 다섯 장은 결과를 흐립니다. 강한 참고 두세 장만 쓰고 나머지는 프롬프트에 맡기세요.
정확한 초 못 박기
딱딱한 타임코드("2초에 컷")는 생성을 불안정하게 만듭니다. 순서를 묘사하고 컷이 비트를 타게 하세요.
한 소절 안에서 언어 섞기
한 대사 안에서 언어를 바꾸면 발음이 엉킵니다. 각 소절은 한 언어로. 흔한 단어일수록 가장 깔끔하게 렌더링됩니다.
세 개의 프롬프트, 처음부터 끝까지
골격을 따라 하고 당신의 곡을 끼워 넣으세요. 각 예시는 오늘 바로 붙여넣을 수 있는 멀티 샷 프롬프트로, 위의 구성 요소로 짜였습니다.
멜랑콜리한 인디 발라드
은밀하고, 비에 젖고, 한 명의 캐릭터, 느리고 감성적.스타일: 시네마틱 실사, 차가운 필름 질감. 피사체: 흠뻑 젖은 회색 코트를 입은 젊은 여성, 젖은 검은 머리가 얼굴에 들러붙어 있다. 샷 1 — 설정용 와이드 샷, 밤의 텅 빈 거리, 앰버색 가로등 아래 가는 비가 내리고, 그녀는 프레임 속에 작게 서 있다. 천천히 밀기. 샷 2 — 미디엄 샷, 그녀가 천천히 고개를 숙이고 빗물이 뺨을 타고 흐르며 내쉬는 숨이 보인다. 샷 3 — 클로즈업, 눈물 한 방울이 고이지만 흐르지 않고, 그녀의 시선이 빛을 향해 올라간다. 차가운 푸른 색조, 젖은 아스팔트의 은은한 반사, 고해상도, 필름 질감. 자막 없음, 워터마크 없음.
통하는 이유: 고정된 한 명의 캐릭터, 단계적으로 좁혀지는 세 샷 사이즈, 한 샷에 카메라 무빙 하나, 몸으로 드러내는 감정, 그리고 깔끔한 제약 한 줄.
경쾌한 신스팝
밝고, 역동적이며, 색이 튀고, 후렴 드롭을 중심으로 구성.스타일: 화사한 3D 애니메이션, 광택 있고 컬러풀. 피사체: 네온 트레이닝복에 흰 운동화를 신은 댄서. 샷 1(벌스) — 미디엄 트래킹으로, 색 블록 벽의 햇살 가득한 복도를 지나는 그녀를 따라간다. 샷 2(고조) — 로우 앵글, 그녀가 웅크릴 때 밀고 들어가며 빛이 점점 밝게 맥동한다. 샷 3(후렴 드롭) — 그녀가 두 팔을 번쩍 들자 360° 선회, 색종이가 터지고, 짙은 핑크와 시안의 빛. 경쾌하고, 에너지 넘치게, 고해상도. 화면에 텍스트 없음, Logo 없음.
통하는 이유: 샷이 곡 섹션에 대응하고, 가장 큰 무빙과 가장 밝은 빛을 드롭에 남겨두며, 에너지가 정신없는 한 샷이 아니라 컷 안에 살아 있다.
시네마틱 사이버펑크 / 힙합
스타일리시, 네온, 음울, 실제보다 큰 스케일.스타일: 3D 사이버펑크 SF 애니메이션, 차가운 청보라 색조. 피사체: 빛나는 테두리가 있는 검은 후드 재킷을 입은 아티스트. 샷 1 — 항공 드론이 밤의 비에 젖은 네온 도시로 하강한다. 샷 2 — 로우 앵글 미디엄 샷, 그가 홀로그램 광고 사이를 카메라 쪽으로 걸어오며 고개를 들어 렌즈를 맞이한다. 느린 트래킹. 샷 3 — 클로즈업, 네온의 반사가 그의 얼굴을 스치고, 그가 훅을 입모양으로 따라 부른다. 고정 프레임. 음울한 볼류메트릭 라이트, 깊은 그림자, 필름 그레인. 자막 없음, 워터마크 없음, Logo 없음.
통하는 이유: 명시된 강한 스타일이 시퀀스 전체를 묶고, 로우 앵글이 존재감을 빚으며, 각 샷이 정확히 무빙 하나만 쓴다 — 하강, 트래킹, 고정.
한 화면 요약
위 내용을 압축했습니다. 캡처해서 프롬프트 입력창 옆에 두세요.
피사체 + 동작 + 장면 + 빛과 색 + 카메라 + 스타일 + 화질 + 제약할 것
- 캡션이 아니라 샷 리스트를 쓴다.
- 2~3개 안정적인 특징으로 피사체를 고정하고 반복해 쓴다.
- 한 샷에 카메라 무빙 하나 — 나머지는 컷으로.
- 감정은 형용사가 아니라 몸으로 드러낸다.
- 샷을 곡 섹션에 대응시키고, 컷을 비트에 맞춘다.
- 마지막은 제약으로 마무리. 텍스트 없음, 워터마크 없음, Logo 없음.
하지 말 것
- 밀기 + 패닝 + 줌을 한 샷에 욱여넣지 말 것.
- 정확한 타임코드를 못 박지 말 것.
- 한 샷에서 격렬하고 폭발적인 동작을 요구하지 말 것.
- 서로 부딪치는 참고 이미지로 프롬프트를 과부하시키지 말 것.
- 사실적인 참고 옆에서 스타일을 빠뜨리지 말 것.
- 한 대사 안에서 언어를 바꾸지 말 것.
뮤직비디오 프롬프트 자주 묻는 질문
뮤직비디오 프롬프트 설계란 무엇인가요?
한 곡을 AI 영상 모델에 묘사해, 실제로 머릿속에 그린 샷을 돌려받는 기술입니다. 곡의 각 부분에 피사체, 동작, 카메라 무빙, 조명, 스타일을 골라 넣는 것이죠. 막연한 묘사를 입력하고 운에 맡기는 대신에요. 잘하면, 평범한 클립과 연출된 뮤직비디오의 차이가 됩니다.
좋은 프롬프트를 쓰려면 영화 용어를 알아야 하나요?
알면 도움이 되고, 금방 배웁니다 — 밀기, 패닝, 클로즈업, 로우 앵글. 이 페이지의 어휘면 평생 쓸 만큼은 거의 다 됩니다. AI 모델은 이 표준 용어에 정확히 반응하므로 몇 마디로 샷 전체를 프레이밍할 수 있습니다.
같은 캐릭터를 영상 전체에 유지하려면 어떻게 하나요?
참고 이미지를 쓰세요 — 이상적으로는 깔끔한 클로즈업과 전신 샷을 함께. 그리고 매번 같은 2~3개 특징으로 캐릭터를 묘사하세요. SunoMV에서는 캐릭터를 '장면 참고'로 저장하고 모든 샷이 그것을 가리키게 할 수 있어, 첫 소절부터 마지막까지 일관됩니다.
제 AI 뮤직비디오에 무작위 텍스트나 자막이 나오는 이유는요?
모델이 가끔 화면 텍스트를 스스로 지어냅니다. 프롬프트에 "자막 없음, 텍스트 없음" 같은 제약을 더하고 와이드 화면을 우선하세요 — 세로 영상은 군더더기 텍스트가 더 자주 생깁니다. 나중에 세로로 잘라낼 수도 있습니다.
긴 프롬프트 하나를 쓸까요, 아니면 여러 샷으로 나눌까요?
여러 샷으로요. 샷 1, 샷 2, 샷 3으로 번호를 매기고 순서대로 묘사해 곡 섹션에 대응시키세요. 또렷한 샷의 연속이, 한 단락으로 한꺼번에 다 하려는 것보다 훨씬 안정적입니다.
동작이 녹아내리거나 일그러져 보이는 이유는요?
대개 한 샷에 움직임이 너무 많아서입니다. 느리고 연속적이며 신체 부위까지 구체적인 움직임을 우선하고, 큰 동작은 컷으로 나누세요. 차분한 샷을 이어 붙이면 높은 에너지로 읽히지만, 정신없는 한 샷은 그저 일그러질 뿐입니다.
이 기법을 어떤 AI 영상 모델에서나 쓸 수 있나요?
네. 이 공식 — 피사체, 동작, 장면, 빛, 카메라, 스타일, 제약 — 은 보편적인 기술입니다. SunoMV는 여러 첨단 영상 모델 중에서 골라 자유롭게 전환할 수 있게 해주지만, 프롬프트를 쓰는 방식은 그 모두에 통용됩니다.
SunoMV에서는 구체적으로 어디서 하나요?
곡을 붙여넣거나 새로 만든 뒤 에디터를 여세요. 가사의 각 줄이 개별적으로 프롬프트를 쓸 수 있는 샷이 되고, 장면 참고로 캐릭터와 장소를 일관되게 유지합니다. 무료로 시작해서 아래에서 첫 영상을 연출해 보세요.
이제, 당신의 곡을 연출하세요
공식도, 카메라 언어도, 예시도 손에 넣었습니다. 곡을 붙여넣고 첫 샷 리스트를 쓴 뒤, AI가 그것을 찍어내는 걸 지켜보세요.