Skip to content
Back to Blog
[TUTORIAL]

영상 편집, 말로 시키면 되나요? 바이브 비디오로 클로드 모션 영상 만든 노하우 (2026 기준)

퀀텀점프클럽 정상록퀀텀점프클럽 정상록8 min read1 views

Free Resource

PDF · Free

말로 시켜 영상을 만드는 법, 바이브 비디오 5원칙 — 비개발자를 위한 쉬운 가이드

Get the practical guide first, before diving into the full article.

영상 편집, 말로 시키면 되나요? 바이브 비디오로 클로드 모션 영상 만든 노하우 (2026 기준)

영상 편집을 말로 시켜서 정말 끝낼 수 있나요?

바이브 비디오로 영상 편집을 끝낼 수 있습니다. 단 규칙을 넣을 곳과 뺄 곳을 나눠야 하고 마지막 검수는 사람이 맡아야 해요. 이 글은 퀀텀점프클럽 유튜브 영상 "영상작업도 AI로 끝 / 바이브코딩X 바이브비디오O 클로드 모션"을 글로 정리한 것입니다. 영상은 https://youtu.be/gibWxcUdcL4 에서 볼 수 있어요.

"그냥 AI에게 말로 시키면 쓸 만한 결과가 나오나요?" 이런 의문은 당연합니다. 진행자도 영상에서 "영상은 찍는 것보다 그 뒤가 훨씬 오래 걸립니다"라고 말하니까요. 영상 제작 기록에 따르면 2026-09-26부터 2026-10-01까지 처음부터 만든 모션 영상이 10편, 다른 영상을 가져와 다시 편집한 작업이 2편입니다. 진행자는 이 영상들이 "전부 편집 프로그램 없이 만들어졌습니다"라고 밝혔어요.

내용은 세 묶음으로 풉니다. 바뀐 것, 감독이 되는 5원칙, 모션 영상 5단계 순서입니다.

바이브 코딩과 바이브 비디오는 뭐가 다른가요?

"바이브 코딩"은 Andrej Karpathy가 2025-02-02 X 게시물에서 처음 쓴 말입니다. 원문은 이렇습니다. "There's a new kind of coding I call 'vibe coding', where you fully give in to the vibes, embrace exponentials, and forget that the code even exists." 분위기에 몸을 완전히 맡기고 코드가 있다는 사실마저 잊는 방식이라는 뜻이에요.

영상의 진행자는 이 말을 영상 작업에 빗댔습니다. "편집을 직접 하지 않고 말로 시켜서 영상을 만들기 때문에 저는 바이브 비디오라고 부릅니다." 이 이름은 진행자가 붙인 것입니다. 2026-10-05 조사 기준 업계 표준 용어는 아니에요.

바이브 비디오란? 컷 편집·자막·화면 모션·소리를 직접 만지지 않고 AI에게 말로 결과를 주문해 영상을 완성하는 작업 방식입니다. 영상 진행자가 바이브 코딩에 빗대 붙인 이름이며 업계 표준 용어는 아닙니다.

숫자로 보면 이렇습니다. 2시간 반 가까운 영상 하나에 레퍼런스 숏폼 하나를 붙이고 "이 영상을 기반으로 최대한 많은 숏폼을 제작해 줘"라고 시키자 숏폼 63개와 롱폼 7편이 나왔다고 해요.

사용한 모델은 Claude Opus 5.5입니다. Anthropic은 2026-09-22 이 모델을 공개했고 TechCrunch도 같은 날 출시를 보도했습니다. Sonnet 5.5는 2026-09-28에 공개됐으며 진행자는 이 모델도 잘 만든다고 말합니다.

처음부터 말만으로 잘 됐나요?

아니요. 진행자가 영상에서 밝힌 시행착오는 이렇습니다.

  • 2026-01: 영상을 만들라는 말부터 다시 해야 했습니다. "아니 영상을 제작하라고"라고 AI에게 말한 기억이 남아 있다고 해요.
  • 2026-03: 10분짜리 영상을 맡겼는데 69초짜리가 돌아왔습니다.
  • 2026-03-16: 숏폼 만드는 도구가 없던 때라 14번을 다시 시도하며 위치·크기·색·배경음악을 고쳤어요.
  • 2026-08: AI가 장면을 생성하고 진행자의 얼굴을 합성하는 방식으로 광고를 6버전까지 만들었다가 전부 버렸습니다.
  • 2026-09: 하네스(AI에게 주는 규칙·메모리 묶음)를 전부 뺀 "순정" 환경으로 광고를 만들었더니 42초짜리 가로·세로 2버전이 나왔어요.

2026-09 광고에서 따로 건 조건은 둘뿐입니다. 로고는 원본 파일 그대로 쓰고 가격·일정 정보는 화면에 넣지 않기. 문구와 나레이션은 평소 규칙대로 준비하고 화면과 소리는 순정 모델에게 맡겼습니다. 결과를 본 진행자는 "와 이게 되네" 하며 놀랐다고 합니다. 그 뒤 진행자가 한 일은 이 영상을 쓸지 말지 검수하고 결정하는 것이었어요.

시간과 컴퓨터는 어떻게 달라졌나요?

"비용은 얼마나 드나요?" 많이 나오는 질문입니다. 영상이 꼽은 필요 조건은 컴퓨터와 Claude 구독이에요. 대신 사람이 쓰는 시간은 크게 줄었다고 진행자는 말합니다.

항목영상에서 밝힌 내용
시간처음 도구 세팅에 투자 필요. 이후 프롬프트를 주면 AI가 거의 전부 제작. 수정은 두세 번
사람의 일무엇을 만들지 정하기, 결과 검토와 개선 방향, 카피 수정, 최종 검수
병목한 컴퓨터에서 Claude 세션 약 60개, Codex까지 약 90개를 동시에 돌려 메모리가 바닥남

진행자가 프롬프트를 내리는 시간은 "거의 몇 분밖에 안 되죠"라고 합니다. 2026-09-16부터 2026-09-28까지의 작업 기록에서는 진행자가 한 번 말할 때 AI가 스무 번 넘게 움직였어요.

병목은 컴퓨터입니다. 세션을 많이 돌린 탓에 맥미니 한 대와 맥 스튜디오 두 대를 원격 연결(SSH)로 묶어 쓰는데도 중간에 멈추는 경우가 있다고 하네요. 작업 구조는 이렇습니다. 감독인 진행자가 대화창에 메시지를 보내면 조감독 AI가 받아 편집·렌더·업로드를 눈에 보이지 않는 뒤에서 돌립니다. 이유는 "그래야 컨텍스트를 아낄 수 있기 때문입니다". 컨텍스트는 AI가 한 번에 기억하는 대화 용량이에요.

감독이 되는 5원칙은 무엇인가요?

진행자가 영상에서 번호를 붙여 말한 원칙은 다섯 가지입니다.

1. 결과를 말로 주문한다

편집 방법을 가르치지 않고 원하는 결과를 말합니다. 진행자가 클로드 코드에 실제로 내린 지시는 이렇습니다. "내가 처음부터 영상을 새로 넣으면 영상에 나온 음성을 전수 검사해서 그 음성을 바탕으로 컷 편집의 기본을 잡아주고 점프 컷 해주고 말 더듬거나 쓸데없는 의성어로 이야기하는 부분들 다 삭제하고 이어줘"

2. 말보다 예시를 보여 준다

AI가 박수 소리를 못 지웠을 때 진행자는 "내가 편집한 거와 이 영상을 비교해 봐"라고 했습니다. AI는 박수 소리와 말소리의 볼륨을 비교해 박수를 지웠어요. 영상 제작 기록에 따르면 진행자의 컷본은 13분을 조금 넘고 말소리 비율이 80%이며 1초 넘는 무음이 없습니다. 이 숫자들이 채점표로 쓰였어요.

3. 잘 고쳐진 건 "기억해"로 남긴다

자막이 화면을 다 가린 영상이 나온 적이 있습니다. 진행자는 "화면이 다 가려지고 집중이 안 된다"고 지적하며 "기억해라"고 했어요. 그 뒤로 같은 실수가 나오지 않았다고 합니다. 반대로 남기지 않은 지적은 반복돼요. 진행자 표현으로는 "그 지적을 규칙으로 저장하지 않으면 AI는 매번 처음 만나는 사람처럼 다시 일을 하게 됩니다". 그래서 "다음에도 이 퀄리티로 나오게끔 하네스를 업데이트해" 같은 말을 붙입니다.

4. 반복은 스킬로, 검수는 두 겹으로

처음에는 AI가 개인정보를 그대로 노출한 채 편집해 줬다고 진행자는 털어놓습니다. 그래서 "개인 정보가 나오는 부분은 블러를 처리해야 된다"고 말했어요. 이후 AI가 1초에 한 장씩 화면을 살피며 모자이크를 처리합니다. 한 영상에서 이미지가 2,800장 넘게 나왔습니다. 만든 뒤에는 만든 쪽과 다른 회사의 AI 모델(Antigravity, Codex, Grok 등)에게 한 번 더 검수를 맡깁니다.

5. 창작은 규칙을 빼고 맡긴다

앞의 네 원칙과 반대 방향입니다. 진행자는 2026-08까지 만든 광고가 두꺼운 하네스와 조건 때문에 품질이 떨어졌다고 말합니다. X에서 다른 사람이 순정 환경으로 모션을 만든 글을 보고 규칙과 메모리를 뺀 순정 클로드 코드로 똑같이 해 봤어요. 규칙을 넣었던 2026-08까지의 광고보다 연출과 음악이 좋아졌다고 합니다.

다만 지시를 간단히 줬을 때 AI는 3D 도구는 스스로 골랐지만 음악 도구는 쓰지 않고 코드로 음악을 합성했습니다. 진행자가 샘플·신스·오디오 플러그인은 필수라는 말과 도구별 설치 위치·사용법을 몇 줄 적어 주자 AI가 "그 도구를 하나도 빠짐없이 전부 다 써서" 영상을 만들어 왔어요. 순정 유지도 쉽지 않습니다. 하네스나 사용자 설정의 "규칙들이 새어 들어가게 되면 순정이 아니기 때문이죠".

Claude Code 팀의 Thariq은 2026-09-23 X에서 "클로드가 한 번에 만들었다"는 게시물의 실제 프롬프트가 "10k characters with good takes plus skills, examples and API keys"였다고 짚었습니다(좋아요 2,234). 한 줄 주문처럼 보이는 결과 뒤에도 도구 정보와 예시가 붙는다는 뜻이고 영상의 5번 원칙과 같은 방향이에요.

모션 영상은 어떤 순서로 만드나요?

"편집 프로그램 없이"가 어떻게 가능한지부터 짚겠습니다. 2026-09-24 Hacker News 스레드(431 points, 댓글 223개)의 한 댓글은 Opus 5.5가 영상 생성 모델이 아니라 코드를 쓰고 고쳐 가며 렌더한다고 구분했어요. 영상 편집 자동화의 실체는 AI가 화면을 그리는 코드를 쓰고 그 코드를 MP4로 렌더하는 일입니다.

진행자가 영상 끝에서 공유한 5단계는 이렇습니다.

  1. 틀리면 안 되는 것(팩트 체크, 문구, 로고 쓰는 법)은 규칙대로 미리 준비합니다.
  2. 화면은 순정 모델에게 맡깁니다. 렌더 전용 맥이 소리 없이 화면만 만들고 문장마다 어디에 놓을지와 박자·타격 지점(음악이 맞춰야 할 지점)을 적은 표를 함께 만들어요.
  3. 소리는 진행자의 맥에서 만듭니다. 오디오 장비와 샘플이 그 맥에만 있어서예요. 소리를 만드는 동안 화면은 한 프레임도 건드리지 않습니다.
  4. 소리를 입히기 전에 다른 AI에게 화면을 검수시킵니다. 진행자는 Antigravity CLI를 추천해요.
  5. 마지막은 사람이 직접 검토합니다.

Google은 2026-05-19 Gemini CLI를 Antigravity CLI로 전환한다고 발표했습니다. 다만 영상 검수 성능을 비교한 독립 자료는 2026-10-05 조사에서 찾지 못했어요. 4단계 추천은 진행자의 경험담으로 읽으면 됩니다.

5단계에서 사람이 직접 보는 이유는 영상에 이렇게 나옵니다. "저희가 원하는 결과물과 AI가 만든 결과물이 원하는 니즈가 서로 다를 가능성이 굉장히 높아요".

반복에는 규칙, 창작에는 여백이라는 말은 무슨 뜻인가요?

진행자의 정리는 이렇습니다. "창작을 할 때는 하네스를 다 빼버리고 여백을 줘버리는 겁니다". 반복 작업에는 규칙을 넣습니다. 로고나 링크처럼 꼭 들어가야 하는 값, 꼭 써야 하는 도구, 소리 크기 체크는 규칙으로 고정해요.

시선이 모두 호의적인 건 아닙니다. 2026-09-24 Hacker News 스레드에는 "화려한 슬라이드 덱일 뿐"이라는 비판과 "설명 영상은 원래 슬롭(저품질 양산물)"이라는 반응이 함께 올라왔어요. 2026-09-25 Stephan Livera는 X에 Opus 5.5에 한 줄을 주고 만든 15초 쇼릴을 올려 좋아요 17,026개를 받았습니다. 놀라움과 우려가 같이 도는 셈입니다. 검수를 두 겹으로 두는 이유도 여기에 있어요.

이 원칙은 정답이라기보다 진행자가 2026-09-26부터 2026-10-01까지의 작업에서 얻은 경험칙입니다.

마무리

바이브 비디오로 클로드 모션 영상을 만든다는 건 사람이 편집자에서 감독으로 자리를 옮기는 일입니다. 영상의 정리 문장은 이렇습니다. "편집은 AI에게 넘기고 검수는 꼭 사람이 해야 된다". 처음이라면 반복 편집 작업 하나만 골라 규칙으로 남겨 보세요. 창작 쪽은 여백을 주고 결과만 검수하면 됩니다.

전체 과정은 영상에서 확인해보세요: https://youtu.be/gibWxcUdcL4


자주 묻는 질문

프롬프트 한 줄이면 모션 영상이 나온다는 말, 사실인가요?

한 줄 주문으로 쇼릴이 나온 사례는 있지만 같은 품질을 반복하려면 도구 정보와 예시가 필요합니다. Stephan Livera는 2026-09-25 X에 한 줄 프롬프트로 만든 15초 쇼릴을 올렸고 좋아요가 17,026개였어요. 반면 Claude Code 팀의 Thariq은 2026-09-23 "원샷" 게시물 뒤의 실제 프롬프트가 1만 자 분량이었다고 짚었습니다. 영상 진행자도 도구 사용법을 몇 줄 적어 주고서야 AI가 도구를 전부 썼다고 밝혔어요.

영상에 개인정보나 회사 화면이 나오면 어떻게 하나요?

규칙으로 남기고 검수를 두 겹으로 합니다. 진행자는 처음에 AI가 개인정보를 그대로 노출한 채 편집했다고 말합니다. 그 뒤로 AI가 1초에 한 장씩 화면을 살피며 블러를 처리하고 한 영상에서 이미지가 2,800장 넘게 나왔어요. 완성 뒤에는 다른 회사 AI가 한 번 더 검수하고 마지막은 사람이 확인합니다.

편집 프로그램 없이 영상은 어떻게 만들어지나요?

AI가 장면을 그리는 코드를 쓰고 그 코드를 렌더해 MP4로 만듭니다. 2026-09-24 Hacker News 스레드(431 points)의 한 댓글은 Opus 5.5가 영상 생성 모델이 아니라 코드를 생성하고 반복해 렌더한다고 구분했어요. HeyGen이 2026-04-17 공개한 HyperFrames처럼 같은 방식을 지원하는 오픈소스가 있습니다. 다만 영상에서 쓴 도구인지는 2026-10-05 기준 확인하지 못했습니다.


참고 자료