ChatGPT로 AI 뮤직비디오 만들기|YuE2 음악 + MiniMax H3로 직접 유튜브에 올려봤습니다
ChatGPT, YuE2, MiniMax H3 같은 생성형 AI를 이용하면 혼자서도 음악을 만들고 뮤직비디오까지 제작해 YouTube에 올릴 수 있을까요?
이번에는 단순히 AI 음악이나 짧은 AI 영상을 테스트하는 데서 끝내지 않고, 실제로 한 곡을 만들고 약 3분 분량의 뮤직비디오를 제작해 YouTube에 공개하는 것까지 직접 진행해봤습니다.
완성한 곡은 〈긴소매〉입니다.
음악 생성에는 YuE2, 영상 생성에는 MiniMax H3, 전체 기획과 스토리 구성·프롬프트 설계·실패 분석에는 ChatGPT를 활용했습니다.
이번 글에서는 단순한 결과물 소개가 아니라, 제가 실제로 어떤 순서로 AI 뮤직비디오를 만들었고 무엇이 잘 안 됐으며 어떻게 해결했는지 처음부터 끝까지 정리해보겠습니다.
- YuE2로 AI 음악을 만드는 방법과 개인 크리에이터 수익화 여부
- ChatGPT로 뮤직비디오 스토리와 컷을 설계하는 방법
- MiniMax H3로 이미지 한 장을 영상으로 만드는 방법
- AI 영상에서 자주 발생하는 실패와 해결 방법
- AI 영상을 실제 뮤직비디오처럼 연결하는 편집 방법
- YouTube 업로드와 Shorts를 이용한 본편 연결 방법
먼저 결과물부터 공개합니다
이번 과정을 통해 완성한 것이 바로 아래의 〈긴소매〉 Official Music Video입니다.
완성된 영상만 보면 하나의 AI가 3분짜리 영상을 통째로 생성했다고 생각할 수도 있습니다. 하지만 실제 제작 방식은 완전히 달랐습니다.
하지만 실제 제작 방식은 완전히 달랐습니다.
짧은 AI 영상을 여러 개 만든 뒤, 각 영상에서 가장 좋은 몇 초만 골라 하나의 뮤직비디오로 다시 조립했습니다.
이번 프로젝트에서 가장 중요했던 것이 바로 이 방식입니다.
AI 뮤직비디오 제작에 사용한 도구
| 도구 | 용도 |
|---|---|
| ChatGPT | 기획, 가사 분석, 스토리, 컷 구성, 프롬프트, 실패 분석 |
| YuE2 | AI 음악 생성 |
| MiniMax H3 | Image-to-Video 영상 생성 |
| ComfyUI Cloud | MiniMax H3 영상 생성 환경 |
| CapCut | 영상 편집 및 최종 MV 제작 |
직접 작업해보니 특정 AI 하나가 모든 것을 해결해 주는 구조보다는 각 AI가 잘하는 일을 나누고 서로 연결하는 방식이 훨씬 효율적이었습니다.
1. YuE2로 AI 음악 만들기
가장 먼저 필요한 것은 당연히 음악입니다.
이번에는 AI 음악 생성 모델인 YuE2를 이용해 〈긴소매〉라는 곡을 제작했습니다.
AI 음악을 이용해 YouTube 채널을 운영하려는 사람이라면 여기서 가장 먼저 궁금해지는 것이 하나 있습니다.

YuE2로 만든 음악은 YouTube에서 수익화할 수 있을까?
결론부터 말하면 개인 크리에이터라면 가능합니다.
현재 YuE2 공식 라이선스 안내에 따르면 개인 사용자, 콘텐츠 크리에이터, 뮤지션은 YuE2로 생성한 결과물을 사용하고 수익화할 수 있습니다.
생성한 결과물의 수익에 대해 YuE2 측에 별도의 이용료나 로열티를 지급할 필요도 없습니다.
또한 YuE2 또는 #YuE2라고 표기하는 것은 권장사항이지만 현재 개인 크리에이터에게 의무적인 표기 조건은 아닙니다.
저처럼 직접 AI 음악을 만들어 YouTube에 지속적으로 업로드하려는 사람에게는 상당히 중요한 부분입니다.
다만 여기서 한 가지는 구분할 필요가 있습니다.
YuE2 라이선스가 생성 결과물의 수익화를 허용한다는 것과 그 음악이 모든 국가에서 자동으로 저작권 보호를 받는다는 것은 서로 다른 문제입니다.
또한 기존 노래를 지나치게 모방하거나 타인의 저작물을 그대로 사용한 경우에는 별도의 저작권 문제가 발생할 수 있기 때문에 주의해야 합니다.
💡 핵심
YuE2 자체의 개인 크리에이터 수익화 허용 여부와 내가 생성한 노래의 저작권 인정 여부는 별도로 생각하는 것이 좋습니다.
2. 음악이 만들어졌다고 바로 영상을 만들지 않았다
여기서 바로 MiniMax H3를 실행하지 않았습니다.
먼저 ChatGPT에게 〈긴소매〉 가사를 분석하도록 했습니다.
그리고 가사에서 반복적으로 등장하는 시각적 요소들을 정리했습니다.
- 긴소매
- 가을바람
- 버스 정류장
- 식어가는 커피
- 보내지 못한 메시지
- 휴대전화
- 혼자 걷는 거리
- 낙엽
하지만 이 물건들을 그대로 영상으로 만들지는 않았습니다.
먼저 전체 이야기를 한 문장으로 만들었습니다.

떠난 사람을 위해 남겨두었던 습관이 조금씩 자신의 일상으로 돌아오는 이야기.
이 한 문장이 생기고 나니 어떤 장면이 필요하고 어떤 장면이 필요 없는지가 훨씬 명확해졌습니다.
3. ChatGPT를 프롬프트 작성기가 아니라 감독처럼 사용했다
이번 작업에서 가장 효과가 좋았던 방법입니다.
처음에는 ChatGPT에게 다음처럼 요청할 수도 있습니다.
가을 거리를 걷는 여자의 영상 프롬프트를 만들어줘.
물론 이렇게 해도 결과는 나옵니다.
하지만 저는 조금 다르게 접근했습니다.
각 장면을 만들기 전에 먼저 질문했습니다.
이 장면에서 관객이 무엇을 느껴야 하는가?
그다음 감정을 눈에 보이는 행동으로 바꾸었습니다.
예를 들어 버스 정류장 장면
단순히 여성이 정류장에 서 있는 장면을 만드는 대신,
여성이 정류장 옆에서 잠시 발걸음을 늦췄다가 정류장을 지나 그대로 걸어가도록 만들었습니다.
그러면 대사가 하나도 없어도 이런 감정을 전달할 수 있습니다.
기다릴 수도 있지만 오늘은 기다리지 않는다.
AI 영상에서도 결국 중요한 것은 예쁜 그림보다 행동을 통해 이야기를 전달하는 것이었습니다.
4. 실제로 사용한 ChatGPT 지시 방식
비슷한 작업을 해보고 싶다면 아래처럼 요청하는 것이 좋습니다.
[ChatGPT 프롬프트 예시]
아래 가사를 분석해서 뮤직비디오 스토리를 만들어줘.
가사의 내용을 그대로 화면으로 번역하지 말고,
주인공의 감정 변화가 행동으로 보이도록 구성해줘.
각 장면에는 하나의 핵심 행동만 넣고,
이전 장면과 다음 장면에 인과관계가 있도록 만들어줘.
각 장면은 5~6초 AI 영상으로 제작할 예정이며,
인물·의상·소품·계절·시간대가 자연스럽게 이어지도록 구성해줘.
이렇게 하면 단순한 이미지 아이디어가 아니라 영상 제작에 실제로 사용할 수 있는 장면 단위의 설계가 나오기 시작합니다.
5. MiniMax H3에서는 한 장면에 한 행동만 넣었다
MiniMax H3를 사용하면서 가장 많이 시행착오를 겪은 부분입니다.
6초밖에 안 되는 영상이라고 생각하면 욕심이 생깁니다.
예를 들어,
걷는다 → 뒤돌아본다 → 휴대전화를 확인한다 → 미소 짓는다 → 카메라가 회전한다
같은 동작을 하나의 영상에 넣고 싶어집니다.
하지만 실제로 해보면 여러 행동을 동시에 요구할수록 오류가 빠르게 증가했습니다.
그래서 제가 최종적으로 사용한 방식은 다음과 같습니다.
휴대전화를 뒤집는 장면이라면
- 손이 휴대전화 옆에 놓여 있다.
- 손가락으로 휴대전화 가장자리를 잡는다.
- 손목을 돌려 휴대전화를 뒤집는다.
- 테이블 위에 내려놓는다.
- 손을 떼고 정지한다.
끝입니다.
행동을 단순하게 만들수록 결과는 오히려 더 자연스러워졌습니다.

6. 6초짜리 영상을 6초 모두 사용할 필요는 없었다
이것도 실제로 제작하면서 알게 된 중요한 부분입니다.
AI가 6초짜리 영상을 만들었다고 해서 6초를 모두 사용해야 할 이유는 없습니다.
실제 편집에서는 생성 영상 중 가장 자연스러운 2초 또는 3초만 사용하는 경우가 많았습니다.
예를 들어 처음 2초의 움직임은 훌륭한데, 마지막에 손이나 얼굴이 깨진다면 마지막 부분을 과감하게 버립니다.
AI 영상의 품질을 가장 쉽게 높이는 방법 중 하나는 '좋은 부분만 사용하는 것'입니다.
7. AI 영상에서 실제로 발생했던 실패들

| 문제 | 해결 방법 |
|---|---|
| 휴대전화가 2개로 늘어남 | 행동을 하나로 줄이고 새로운 오브젝트 생성 금지 |
| 손가락과 손 모양 오류 | 복잡한 손동작을 줄이고 짧은 구간만 사용 |
| 휴대전화 글자가 깨짐 | 텍스트는 AI 영상에서 만들지 않고 편집 단계에서 합성 |
| 영상이 예쁘지만 너무 심심함 | Push-in, Tracking, Top View 등 카메라 움직임 추가 |
| 인물이 다른 사람처럼 변함 | 기준 이미지와 의상·헤어·소품을 반복적으로 고정 |
| 장면에 없던 물건 등장 | 프롬프트에서 기존 오브젝트 유지와 추가 생성 금지를 명확히 지정 |
8. 얼굴보다 의상과 소품의 연속성도 중요했다
AI 뮤직비디오를 만들 때 흔히 캐릭터의 얼굴만 일관되게 유지하면 된다고 생각합니다.
실제로 작업해보니 꼭 그렇지는 않았습니다.
같은 인물이라는 느낌을 유지하는 데는 다음 요소들도 상당히 중요했습니다.
- 헤어스타일
- 상의와 하의
- 가방
- 휴대전화
- 컵
- 장소
- 시간대와 조명
얼굴이 조금 달라도 같은 옷과 같은 장소가 이어지면 시청자는 어느 정도 같은 사람으로 받아들입니다.
반대로 얼굴이 비슷해도 갑자기 옷이나 가방이 바뀌면 영상의 연결감이 바로 깨집니다.

9. AI에게 글자를 맡기지 않았다
〈긴소매〉에는 휴대전화가 중요한 소품으로 등장합니다.
처음에는 화면에 실제 메시지까지 AI로 생성하려고 했습니다.
하지만 영상 생성 AI는 작은 UI와 글자를 유지하는 데 여전히 어려움이 있습니다.
글자가 깨지고, 스마트폰 디자인이 바뀌고, 심하면 새로운 스마트폰이 하나 더 생기기도 했습니다.
결국 다음과 같이 역할을 나눴습니다.
영상 AI = 인물과 휴대전화의 움직임
편집 프로그램 = 화면 UI와 텍스트
AI에게 모든 작업을 맡기는 것보다 AI가 잘하는 것과 편집 프로그램이 잘하는 것을 구분하는 것이 훨씬 효율적이었습니다.
10. 모든 실패 장면을 다시 만들지는 않았다
생성형 AI를 사용하면 한 가지 위험이 있습니다.
조금만 마음에 들지 않아도 계속 다시 생성하게 됩니다.
그러다 보면 제작 시간이 끝없이 늘어납니다.
그래서 중간부터 기준을 하나 정했습니다.
스토리를 이해하는 데 반드시 필요한 장면만 다시 만든다.
그리고 인물의 얼굴이 필요하지 않은 부분에는
- 낙엽
- 가을 거리
- 커피
- 손
- 휴대전화
- 창밖 풍경
같은 디테일 컷을 적극적으로 넣었습니다.
오히려 이런 장면들이 영상의 호흡을 조절하는 데 도움이 됐습니다.
11. 먼저 러프컷을 만들고 부족한 영상만 추가 생성했다
처음에는 모든 AI 영상을 완성한 뒤 편집하려고 했습니다.
하지만 실제로는 반대 방식이 더 효율적이었습니다.
- 우선 필요한 장면을 대략 생성한다.
- CapCut에서 음악에 맞춰 러프컷을 만든다.
- 전체 영상을 처음부터 끝까지 재생한다.
- 스토리상 부족한 부분을 찾는다.
- 필요한 장면만 다시 생성한다.
이 방식으로 바꾸면서 불필요한 AI 영상 생성 횟수를 크게 줄일 수 있었습니다.

12. 결국 AI보다 중요한 것은 '감독'이었다
이번 프로젝트를 시작할 때는 AI 뮤직비디오에서 가장 중요한 것이 최신 영상 생성 모델이라고 생각했습니다.
하지만 직접 만들어보니 생각이 조금 달라졌습니다.
AI가 영상을 만드는 것과 뮤직비디오를 만드는 것은 서로 다른 일이었습니다.
뮤직비디오에서는,
- 어떤 장면을 사용할지 결정하고
- 이전 장면과 다음 장면을 연결하고
- 감정의 강도를 조절하고
- 음악의 박자와 움직임을 맞추고
- 실패한 결과를 버리고
- 필요한 장면을 다시 만들어야 합니다.
이 역할을 결국 사람이 해야 합니다.
이번 작업에서는 ChatGPT를 이런 기획자 + 감독 + 피드백 파트너 역할로 활용했습니다.
13. 영상이 완성된 뒤에는 YouTube 업로드 전략도 같이 만들었다
영상을 완성하고 나니 새로운 문제가 생겼습니다.
그래서 이 영상을 사람들이 어떻게 발견하게 만들까?
ChatGPT와 함께 제목, 설명, Shorts, 고정 댓글, 본편 연결 방식까지 다시 검토했습니다.
최종적으로 본편 제목은 단순한 곡 제목보다 감정을 먼저 보여주는 방향으로 구성했습니다.
헤어지고도 남는 건, 습관이었다 | 긴소매 Official MV
그리고 기존에 업로드했던 Shorts에서 YouTube의 관련 동영상 기능을 이용해 본편 〈긴소매〉로 연결했습니다.
즉 Shorts를 단순한 짧은 영상이 아니라 본편 뮤직비디오로 들어오는 입구로 활용하는 방식입니다.
AI로 만들었다는 사실은 어떻게 표시했을까?
이번 영상에서는 AI를 사용했다는 사실을 숨기지 않았습니다.
YouTube 설명에 다음과 같은 문장을 넣었습니다.
AI 도구를 활용해 제작한 오리지널 음악과 뮤직비디오입니다.
하지만 영상 제목에 AI라는 단어를 전면에 내세우지는 않았습니다.
제가 만들고 싶은 것은 'AI 영상을 보여주는 채널'이 아니라 AI를 제작 도구로 활용해 음악과 영상을 만드는 Neuro Sounds라는 콘텐츠 브랜드이기 때문입니다.
MiniMax H3를 사용할 때는 라이선스도 확인할 것
⚠️ 여기에는 한 가지 체크할 부분이 있습니다.
AI 모델은 모델마다 오픈소스·상업 이용·지역·호스팅 조건이 서로 다릅니다.
특히 MiniMax H3는 현재 공개된 Community License에 지역 제한이 있기 때문에, 직접 모델을 설치하는 방식과 외부 API·클라우드 서비스를 이용하는 방식에서 적용 조건이 달라질 수 있습니다.
따라서 상업 콘텐츠를 제작한다면 내가 이용하는 플랫폼과 모델 버전의 최신 라이선스를 함께 확인하는 것이 좋습니다.
처음 AI 뮤직비디오를 만든다면 이렇게 시작해보세요
처음부터 3분짜리 음악을 만들 필요는 없습니다.
저라면 처음에는 이렇게 시작하겠습니다.
- 30초 정도의 음악을 준비합니다.
- ChatGPT에게 음악과 가사의 감정을 분석하게 합니다.
- 4~5개의 장면으로 나눕니다.
- 각 장면의 기준 이미지를 만듭니다.
- Image-to-Video 모델로 5~6초 영상을 만듭니다.
- 각 영상에서 가장 좋은 2~3초만 골라냅니다.
- 음악 위에 순서대로 배치합니다.
- 부족한 부분만 추가 생성합니다.
이 정도만 해도 AI 뮤직비디오 제작의 거의 모든 과정을 한 번 경험할 수 있습니다.
3분짜리 완성작을 처음부터 목표로 하는 것보다 30초 영상을 완성해보는 것이 훨씬 빠르게 배우는 방법입니다.
AI 뮤직비디오를 만들어보면서 알게 된 핵심 5가지
1. AI에게 많은 행동을 한 번에 시키지 않는다.
2. 6초를 생성해도 좋은 2초만 사용하면 된다.
3. 얼굴뿐 아니라 의상과 소품의 연속성이 중요하다.
4. AI가 못하는 부분은 편집 프로그램으로 해결한다.
5. 최신 AI 모델보다 전체를 조율하는 감독 역할이 더 중요하다.
AI 음악과 AI 영상, 실제로 어디까지 가능할까?
이번 프로젝트를 하기 전에는 AI가 사람 대신 작품을 만들어주는 도구라고 생각했던 부분이 있었습니다.
직접 만들어본 뒤에는 조금 다르게 느껴졌습니다.
AI는 제작자를 없애는 도구라기보다 한 사람이 작은 제작팀을 가질 수 있게 해주는 도구에 가까웠습니다.
음악을 만드는 AI, 영상을 만드는 AI, 이미지를 만드는 AI가 있고,
ChatGPT를 이용해 그 사이의 기획과 스토리, 연출을 연결할 수 있었습니다.
하지만 어떤 장면을 사용할지, 무엇을 버릴지, 어떤 이야기를 전달할지는 여전히 제작자가 결정해야 했습니다.
그리고 완성된 〈긴소매〉
그 과정을 반복하면서 완성한 첫 번째 결과물이 〈긴소매〉입니다.
AI 음악과 AI 영상을 단순히 이어 붙이는 것이 아니라 한 편의 짧은 뮤직비디오처럼 보이도록 만드는 것을 목표로 했습니다.
영상을 보면서 어떤 부분이 AI로 만들어진 것처럼 느껴지는지, 어떤 장면은 실제 영상처럼 자연스럽게 보이는지 비교해서 보셔도 재미있을 것 같습니다.
자주 궁금해하는 질문
Q. YuE2로 만든 음악을 YouTube에서 수익화할 수 있나요?
현재 YuE2 공식 정책상 개인 사용자, 콘텐츠 크리에이터 및 뮤지션은 YuE2 생성 결과물을 수익화할 수 있습니다. YuE2 측에 별도의 이용료나 로열티도 요구되지 않습니다.
Q. 그렇다면 YuE2 음악은 자동으로 내 저작권이 되나요?
수익화가 허용된다는 것과 법률상 저작권이 자동으로 인정된다는 것은 다른 문제입니다. 가사, 편곡, 편집 등 사람이 직접 기여한 창작 요소도 함께 구분해서 생각하는 것이 좋습니다.
Q. ChatGPT가 뮤직비디오를 직접 만들어주나요?
이번 작업에서는 ChatGPT가 영상을 직접 렌더링하기보다는 스토리 설계, 컷 구성, 프롬프트 작성, 결과 분석과 수정 방향을 정하는 감독 역할에 가깝게 활용했습니다.
Q. AI 영상 제작을 처음 시작한다면 무엇부터 하는 것이 좋나요?
3분짜리 영상보다 먼저 음악 30초 + 장면 4~5개 정도의 짧은 프로젝트를 완성해보는 것을 추천합니다.
다음에는
이번 글에서는 AI 음악부터 뮤직비디오 완성까지 전체 과정을 정리했습니다.
다음에는 실제 제작 과정에서 가장 많은 시행착오가 있었던 MiniMax H3에서 이미지 한 장을 자연스러운 6초 영상으로 만드는 프롬프트 작성법을 따로 정리해보겠습니다.
특히,
- 사람이 갑자기 변하지 않게 만드는 방법
- 손과 휴대전화 오류를 줄이는 방법
- 카메라 움직임을 자연스럽게 넣는 방법
- 한 장면 안에서 행동의 인과관계를 만드는 방법
같은 실제 제작 노하우를 중심으로 다뤄볼 예정입니다.
🎵 긴소매 | Neuro Sounds
AI 도구를 활용해 제작한 오리지널 음악과 뮤직비디오입니다.