오늘 아침, 여느 때처럼 집 근처 물길을 따라 산책을 나섰습니다. 안개 너머로 부드럽게 떠오르는 해, 모내기를 막 끝낸 논물에 거울처럼 비친 하늘, 그 위를 유유히 지나는 비행기, 그리고 논 한가운데 서 있던 왜가리 한 마리. 유난히 평화로운 풍경에 이끌려 휴대폰을 꺼내 들고 아홉 장의 사진을 찍었습니다.
그리고 이 평범한 사진들은 그날 저녁이 되기 전, 4분 39초짜리 AI 노래와 뮤직비디오 형태의 영상 두 편으로 다시 만들어졌습니다. 노래의 멜로디도, 서정적인 가사도, 영상의 조립도 모두 오늘 하루 동안 실험해 본 결과물입니다.
개발 지식이 많지 않은 비개발자의 입장에서, 전문 장비 없이 어떻게 휴대폰 사진 몇 장을 AI와 협업하여 새로운 콘텐츠로 만들어냈는지 그 실전 제작 과정을 공유합니다.
💡 만들기 전에 알아둘 것
- 스마트폰 사진 9장을 바탕으로 AI 노래와 뮤직비디오 2편을 제작했다.
- 이번 실험에서 추가 AI 이미지 생성 비용은 약 100원 수준이었다.
- 전체 비용은 SUNO 요금제, 이미지 생성 도구, 개인 PC 환경에 따라 달라질 수 있다.
- 가장 중요한 교훈은 AI가 만든 결과물을 사람이 검수하고 선택해야 한다는 점이었다.
🛠️ 비개발자를 위한 AI 도구 역할 분담
저는 코드를 직접 짜는 전문 개발자가 아닙니다. 대신 각기 다른 장기를 가진 AI 도구들과 역할을 나누어 작업을 진행합니다. 이번 실험에 사용된 도구들과 각자의 역할은 다음과 같습니다.
| 담당 | 주요 역할 |
|---|---|
| 사람 / 운영자 | 사진 촬영, 전체 방향성 설정, 결과물 검수 및 최종 선택 |
| 대화형 AI | 사진 분위기 해석, 공통 정서 추출, 가사 방향 잡기 |
| SUNO | 가사와 분위기를 기반으로 음악 생성 |
| Claude Code | 로컬 환경에서 음원 분석과 영상 합성을 돕는 제작 도구 구성 지원 |
🏃♂️ 사진 9장이 노래가 되는 4단계 실전 과정
전체 제작 과정은 AI가 모든 것을 알아서 해주는 마법이 아닙니다. 사람이 재료를 주고 방향을 잡으면, AI가 결과물을 돕고 사람이 다시 다듬는 유기적인 협업으로 진행되었습니다.
1단계: 사진 속에서 정서와 가사 찾아내기
가장 먼저 아침에 찍은 사진 9장을 대화형 AI에게 보여주며 "이 사진들의 분위기에 맞는 노래 가사를 만들어 줘"라고 요청했습니다. AI는 논물과 운하가 하늘을 비추는 모습에 주목하여 '두 개의 하늘'이라는 제목과 가사를 제안했습니다. 단순한 사물 묘사가 아니라 그날 아침의 공기와 감성을 읽어낸 문장들이었습니다.
2단계: AI 작곡가에게 노래 부탁하기
SUNO는 가사와 스타일 문구를 입력하면 보컬과 멜로디가 포함된 곡을 만들어주는 AI 음악 생성 도구입니다. 완성된 가사와 원하는 음악 스타일(잔잔한 어쿠스틱 발라드)을 SUNO에 입력했습니다. 곧바로 두 가지 버전의 노래가 완성되었고, 노래의 템포와 보컬의 명확도를 비교해 보며 아침 산책의 서정적인 분위기에 가장 잘 맞는 버전을 선택했습니다.
3단계: 영상 제작 파이프라인으로 조립하기
Claude Code의 지원을 받아 미리 구성해 둔 로컬 영상 제작 도구를 활용했습니다. 이 파이프라인은 노래의 박자와 가사 타이밍을 분석하고 장면을 배치하는 역할을 합니다. "왜가리 한 마리"라는 가사에는 제가 찍은 진짜 왜가리 사진이, "물 위에 비친 도시"라는 가사에는 물에 비친 아파트 사진이 나타나도록 맞췄습니다. 부족한 장면 일부만 AI 생성 이미지로 채웠습니다.
4단계: 두 가지 버전 비교 및 최종 선택
AI 생성 이미지를 섞은 혼합 버전과, 오직 제가 찍은 실제 사진 9장만 활용한 버전을 비교해 보았습니다. 화려한 AI 이미지를 섞은 버전보다, 실제 사진 9장에 확대와 이동 효과만 주어 만든 버전이 훨씬 몰입감이 높았습니다. 거친 스마트폰 사진이라도 "진짜 그 자리에 내가 있었다"는 진정성이 담겨 있었기 때문입니다.
⚠️ 초보자가 AI 콘텐츠를 만들 때 주의할 점
직접 실행해 보며 느낀 한계와 주의할 점입니다. AI 도구를 처음 접하시는 분들은 다음 사항을 참고하시면 시행착오를 줄일 수 있습니다.
- 결과물은 반드시 사람이 검수해야 합니다: AI에게 이미지를 생성시키면 초여름 풍경에 앙상한 겨울나무를 그려 넣는 등의 오류가 섞여 나옵니다. 이를 그대로 믿기보다, 사람이 직접 확인하여 불량만 골라 다시 만들어야 합니다.
- 자동화를 맹신하지 말고 수동 보정을 병행하세요: 보컬이 속삭이는 구간 등은 AI 음성 인식이 완벽하지 않아 자막 싱크가 어긋날 수 있습니다. 이때는 소리의 크기 변화를 보며 사람이 직접 타이밍을 맞춰주어야 완성도가 올라갑니다.
- 처음부터 큰 규모를 욕심내지 마세요: 자동 제작 파이프라인을 구축하려면 별도의 도구와 환경 설정이 필요합니다. 개발 지식이 없다면 처음부터 완전 자동화나 긴 영상을 목표로 하기보다는, 작은 단계부터 시작해 1분 미만의 짧은 영상으로 감을 익히는 것이 현실적입니다.
❓ 자주 묻는 질문 (FAQ)
Q1. 개발 지식이 없는데 이런 영상 제작 과정을 따라 할 수 있을까요?
A1. 네, 개발 지식이 없어도 작은 단계부터 시작할 수 있습니다. 한 번에 모든 것을 자동화하려고 하면 어렵지만, 대화형 AI에게 사진을 주고 가사를 받는 것, SUNO에 가사를 넣어 음악을 만들어 보는 것은 누구나 바로 해볼 수 있습니다.
Q2. 제작에 드는 비용은 어느 정도인가요?
A2. 이번 실험에서 영상을 풍성하게 만들기 위해 추가로 AI 이미지를 생성하는 데 든 비용은 약 100원 수준이었습니다. 다만 이는 음원 분석과 영상 합성을 제 컴퓨터(로컬)에서 무료 도구로 처리했기 때문이며, SUNO 요금제 등 개인의 사용 환경에 따라 전체 비용은 달라질 수 있습니다.
Q3. AI가 만든 음악을 유튜브나 블로그에 올려도 저작권 문제가 없나요?
A3. SUNO를 비롯한 AI 도구들의 저작권 정책은 요금제(무료/유료)와 생성 시점의 약관에 따라 상업적 사용 가능 여부가 크게 달라질 수 있습니다. 따라서 콘텐츠를 외부에 공개하거나 활용하기 전에는 최신 약관을 확인한 뒤 활용 범위를 정하는 것이 안전합니다.
🎬 마무리: 서랍 속 사진으로 시작하는 콘텐츠 실험
일상에서 무심코 찍은 사진 한 장도 AI와 적절히 협업하면 새로운 콘텐츠 재료가 됩니다. 이번 작업은 단순한 기술 자랑이 아니라, 내 사진을 노래와 영상으로 바꿔보는 즐거운 '새로운 콘텐츠 제작 실험'이었습니다.
다음 글에서는 명령어 입력 없이 버튼만 눌러 직관적으로 작업을 진행할 수 있도록 Claude Code와 함께 구성한 로컬에서 실행되는 작은 제작 화면을 소개해 드리겠습니다.
![]() |
| Claude Code와 협업하여 구축한 로컬 기반의 영상 제작 파이프라인(UI) 시각화 및 다음 글 예고용 |
관련된 AI 협업 실험과 운영 기록은 chulbuji.com에도 따로 정리하고 있습니다.
🏃♂️ 지금 바로 실행해 볼 힌트: 휴대폰 갤러리를 열어 지난 여행이나 산책길에 찍은 사진 5~10장을 골라보세요. 그 사진들을 대화형 AI에게 보여주고 어떤 가사를 써주는지 확인해 보는 것부터가 첫 시작입니다.
함께 보면 좋은 글
다음 행동
AI 음악이나 영상 제작을 시작하려면 먼저 사진이나 짧은 영상 3개를 고르고, 어떤 분위기의 음악과 연결할지 간단한 제작 메모를 작성해 보세요.

댓글
댓글 쓰기