본문으로 건너뛰기
블로그로 돌아가기
2026년 AI 영상 클리핑 도구 autoclip은 영상이 아니라 자막을 읽습니다: 한국어 적용 주의점
[AI 도구]

2026년 AI 영상 클리핑 도구 autoclip은 영상이 아니라 자막을 읽습니다: 한국어 적용 주의점

퀀텀점프클럽 정상록퀀텀점프클럽 정상록10분 읽기4 views

무료 자료

PDF · 무료

영상을 보지 않고 하이라이트를 골라내는 AI 도구, 비개발자를 위한 쉬운 가이드

긴 글을 다 읽기 전에, 실무 가이드부터 먼저 챙겨가세요.

2026년 AI 영상 클리핑 도구 autoclip은 영상이 아니라 자막을 읽습니다: 한국어 적용 주의점

긴 영상에서 하이라이트를 자동으로 잘라내는 오픈소스 autoclip은 화면이 아니라 자막을 읽습니다. 한국어는 받아쓰기와 화면까지만 지원되고, 판단 프롬프트 35개는 중국어로 남아 있어요.

핵심 요약: autoclip은 자막 텍스트만 읽어 하이라이트를 고릅니다. 한국어 전사와 화면은 공식 지원이지만, 판단 프롬프트 35개는 중국어로 남아 있어요.

목차

  • 자막 6단계로 돌아가는 구조
  • 8,705 스타와 사흘 연속 릴리스
  • 잘 맞는 영상과 맞지 않는 영상
  • 한국어 지원이 계층별로 갈립니다
  • 프롬프트 파일 교체가 실제 개조 지점입니다
  • 기본 산출물은 30초 숏폼이 아닙니다
  • 설치 경로와 자막이 밖으로 나가는 지점
  • 저작권은 도구가 책임지지 않습니다
  • 확인되지 않은 것들
  • 자주 묻는 질문

자막 6단계로 돌아가는 구조

backend/pipeline/ 디렉터리의 파일 이름이 그대로 처리 단계예요. 개요 추출, 구간 타임스탬프 확정, 점수 산정, 제목 생성, 주제 군집화, ffmpeg 컷 순서로 돕니다(backend/pipeline 소스).

여섯 단계 전부 자막 텍스트를 LLM에 넣어 처리해요. 음성 볼륨, 웃음소리, 표정, 화면 전환 같은 신호는 파이프라인 어디에도 들어가지 않습니다. 구간 점수를 매기는 ClipScorer도 자막을 청크로 묶어 LLM에 배치 평가를 맡기는 방식이죠.

점수 임계값 기본치는 0.7입니다. 클립이 하나도 안 나오면 0.5까지 내려보라고 공식 FAQ가 안내하는데, 내린다고 반드시 나온다는 보장은 없다는 단서도 같이 붙어 있어요.

8,705 스타와 사흘 연속 릴리스

트렌딩 페이지에 뜬 "266 stars today"는 하루치 증가분이에요. 2026-09-23에 GitHub API로 직접 확인한 총합은 8,705 stars, 1,608 forks입니다(GitHub 저장소).

8,705 스타와 사흘 연속 릴리스8,705 스타와 사흘 연속 릴리스

자료: 본문 데이터 · QJC 재구성

오픈소스 클리핑 도구스타 수
zhouxiaoka/autoclip8705
Anil-matcha/AI-Youtube-Shorts-Generator5088
xixihhhh/hotclip219

급등 배경에는 릴리스가 몰린 사흘이 있어요. CLI와 MCP 서버, 8개 언어 화면, 자동 발행이 이 구간에 연달아 들어갔습니다(릴리스 목록).

릴리스 버전공개일오늘 기준 경과일
v1.2.12026-09-0617
v1.3.02026-09-203
v1.3.12026-09-212
v1.3.22026-09-221

잘 맞는 영상과 맞지 않는 영상

판단 재료가 말뿐이라 소재 궁합이 뚜렷하게 갈려요. 인터뷰, 팟캐스트, 강의와 웨비나 녹화, 라이브 다시보기, 대담형 롱폼처럼 말이 정보의 본체인 콘텐츠에 맞습니다.

반대로 브이로그, 리액션, 예능 편집물, 음악과 퍼포먼스 영상은 맞지 않아요. 메인테이너도 "순수 시각 액션이나 음악 영상은 효과가 제한적일 수 있다"고 README에 직접 적어뒀습니다(공식 한국어 README).

한국어 지원이 계층별로 갈립니다

이 부분이 한국 실무자에게 가장 중요한 대목이에요. "한국어 지원"이라는 한 문장 안에 상태가 다른 세 계층이 섞여 있습니다.

받아쓰는 계층은 한국어를 명시 지원해요. speech_recognizer.py의 언어 코드 목록에 KOREAN = "ko"가 들어 있고, 이 값이 faster-whisper로 그대로 전달됩니다(speech_recognizer.py).

화면과 문서 계층도 공식 지원이죠. v1.3.1에서 한국어를 포함한 8개 언어 화면과 README가 들어갔고, 저장소 루트에 README-KO.md가 있어요.

판단하고 생성하는 계층이 남은 문제입니다. backend/prompt/ 아래 7개 카테고리 35개 프롬프트 파일이 전부 중국어이고 언어 분기가 없어요(backend/prompt 디렉터리). 제목 생성 프롬프트는 이렇게 시작합니다.

당신은 최고의 숏폼 콘텐츠 기획자이자 B站(빌리빌리) '제목 낚시' 킬러로서 폭발적 제목의 창작 논리에 정통하다.

공식 README도 선을 그어뒀어요. 번역된 README 언어가 앱 화면이나 전사 모델이 지원하는 언어 범위를 뜻하지는 않는다고 명시합니다. 한국어 README에는 원본 미디어와 생성 콘텐츠의 언어가 변경되지 않는다는 문장도 있고요.

프롬프트 파일 교체가 실제 개조 지점입니다

여기에 쓸 만한 레버가 하나 있어요. 그 35개 프롬프트가 코드가 아니라 평문 .txt 파일입니다. 포크하거나 다시 빌드하지 않고 텍스트만 바꿔 끼울 수 있죠.

한국어 실무화 순서

순서는 이렇게 잡으면 안전해요.

  1. 보유한 한국어 SRT를 --srt로 먼저 넣어 전사 품질 변수를 제거합니다.
  2. 3~5분 샘플로 한 번 돌려봅니다. 공식 README가 권하는 방식이에요.
  3. 나온 제목과 추천 사유의 언어와 톤을 눈으로 확인합니다.
  4. 어색하면 标题生成.txt(제목)와 推荐理由.txt(추천 사유)부터 한국어로 교체합니다. 한국 채널용이면 B站 지향 문구를 반드시 들어냅니다.

기본 산출물은 30초 숏폼이 아닙니다

여기서 기대치를 한 번 조정하셔야 해요. 구간 길이 프롬프트가 최소 90초 미만 구간은 인접 주제와 병합하도록 강제하고, 목표 길이를 3~6분, 최대 8분으로 잡습니다.

v1.3.2에 들어간 발행 기능도 세로 계정용으로 9:16을 만들되 60초로 자르지는 않는다고 못 박았어요. 바로 업로드할 30초 클립을 기대하고 들어가면 결과물이 어긋납니다. 숏폼이 목적이라면 산출 구간을 후속 편집에서 다시 쪼개거나 길이 프롬프트를 직접 손봐야 하죠.

설치 경로와 자막이 밖으로 나가는 지점

실행 경로 네 가지

실행 방법은 네 가지예요. macOS Apple Silicon과 Windows x64용 데스크톱 설치본, Docker 구성, CLI, 그리고 MCP 서버입니다. Intel Mac과 Linux는 데스크톱 패키지가 없어 Docker나 CLI로 가야 해요.

GPU는 필수가 아닙니다. faster-whisper를 device="auto"compute_type="int8"로 호출하고 Mac에서는 CPU 경로로 돌아가요. 소프트웨어 자체는 MIT 무료이고 과금은 선택한 모델 제공사에 직접 발생하니, Ollama 같은 로컬 모델을 쓰면 LLM 사용료가 들지 않습니다.

자막이 외부로 나가는 조건

데이터 경계는 짚고 넘어갈 만해요. 영상 편집은 로컬에서 끝나지만 클라우드 모델을 고르면 자막 텍스트가 그 제공사로 전송됩니다. 완성본은 발행을 누른 뒤에만 기기를 떠나고요. 미공개 사내 영상을 다룬다면 로컬 모델 쪽이 맞습니다.

배포 서명은 아직 갖춰지지 않았어요. macOS 공증과 Windows 코드 서명이 적용되지 않아 설치할 때 운영체제가 막을 수 있습니다. 미서명 바이너리 설치가 금지된 조직이라면 Docker나 CLI 경로를 쓰세요.

저작권은 도구가 책임지지 않습니다

MIT 라이선스는 소프트웨어에만 적용돼요. 처리 대상 영상의 권리와는 아무 관계가 없습니다. 저장소 설명 자체가 2차 창작 도구를 표방하고 YouTube와 Bilibili 링크 입력을 받지만, 남의 영상을 잘라 올리는 행위의 적법성까지 도구가 보장하지는 않아요. README도 예시 영상마다 사용 권리는 본인 부담이라는 표기를 붙여뒀습니다.

그래서 시작은 자사 보유 영상으로 하시는 편이 안전해요. 자체 촬영한 강의, 웨비나, 사내 세미나 녹화가 첫 대상으로 적합합니다. 타인 영상 2차 창작은 권리 확인을 끝내기 전에 파이프라인에 태우지 않는 게 좋고요. 이 정리는 법률 자문이 아니며, 상업적으로 쓰기 전에 권리 확인이 먼저입니다.

확인되지 않은 것들

추측으로 메우지 않고 공백으로 남긴 항목도 밝혀둘게요. 한국어 영상의 실제 전사 정확도, 한국어 자막을 넣었을 때 제목이 어느 언어로 나오는지, 한국어 콘텐츠에서의 하이라이트 선별 품질은 모두 확인되지 않았습니다.

확인되지 않은 것들확인되지 않은 것들

이미지 출처: github.com

품질 검증 체계 자체가 아직 없다는 점도 참고하세요. 클립 품질 대조와 점수 백엔드 플러그화가 로드맵 미완 항목으로 열려 있어, 중국어 콘텐츠에서조차 품질이 정량 검증된 상태가 아닙니다(메인테이너 고정 이슈 #96). 3~5분 샘플 검증 단계가 필요한 이유가 여기 있어요.

자주 묻는 질문

한국어 영상에 그대로 써도 되나요?

돌아가기는 합니다. 다만 받아쓰기는 한국어로 되고 하이라이트 판단은 중국어 프롬프트로 도는 구조라, 3~5분 샘플로 먼저 확인한 다음 프롬프트를 한국어로 교체하는 순서를 권합니다. 무검증 투입은 이릅니다.

GPU가 없어도 되나요?

됩니다. 전사 모델을 device="auto"와 int8 연산으로 호출해서 Mac에서는 CPU 경로로 처리해요. 다만 GPU를 썼을 때 속도가 얼마나 빨라지는지, 영상 1분당 처리 시간이 몇 초인지는 공개 자료가 없습니다.

유튜브 영상을 잘라서 올려도 되나요?

도구가 링크 입력을 받는 것과 그 클립을 올려도 되는지는 다른 문제예요. MIT 라이선스는 소프트웨어에만 적용되고 영상 권리는 그대로 원저작자에게 있습니다. 자체 보유 영상부터 적용하시고, 타인 영상은 권리 확인을 먼저 하세요.

마무리

AI 영상 클리핑 도구를 검토하신다면 설치보다 먼저 열어볼 파일이 backend/prompt/ 아래 텍스트들이에요. 그 안의 문장이 내 채널 문법과 얼마나 먼지 보면, 도입 여부와 개조 범위가 같이 잡힙니다. 손에 있는 3~5분짜리 강의 녹화 하나로 첫 샘플을 돌려보세요.

관련 글

출처