Get started
Voice Studio — 대본 한 장이 방송급 음성·유튜브 영상이 됩니다

Voice Studio — 대본 한 장이 방송급 음성·유튜브 영상이 됩니다

마이크도, 녹음실도, 편집 툴도 없이 대본 한 장으로 유튜브에 바로 올릴 영상을 만듭니다. 4개 신경망 TTS 엔진(edge·Kokoro·OpenAI·ElevenLabs) 중 골라 나레이션을 합성하고, BGM을 자동 덕킹으로 깔고, 유튜브 표준 -14 LUFS로 마스터링한 뒤, 커버/웨이브폼 비주얼과 자막(SRT)까지 얹은 mp4로 패키징 — 명령 4줄이면 끝납니다. 2인 팟캐스트 대화 합성, 쇼츠 세로 영상, 로컬 Whisper 전사(회의록·자막)까지 지원. 기본 엔진은 무료·API 키 불필요, 설치는 uv가 전부 자동. TTS 엔진별 상업 이용 라이선스 가이드와 2026 유튜브 AI 콘텐츠 정책 가이드를 정직하게 동봉했습니다.
#Social Media#Video#Education
Rating
More ratings needed
Sold
1
How to use
Download

🎙️ Voice Studio — 대본 한 장이 방송급 음성·유튜브 영상이 됩니다

목소리를 녹음하지 않고도, 오늘 밤 유튜브에 영상을 올릴 수 있습니다.

콘덴서 마이크, 방음 부스, 오디오 인터페이스, DAW 사용법… 콘텐츠를 시작하려다 장비와 후반작업 앞에서 멈춰본 적 있으시죠? 목소리를 공개하는 것 자체가 부담이라 시작조차 못 한 분도 많습니다. 대본은 이미 머릿속에 있는데, "녹음과 편집"이라는 벽이 그 대본을 세상에 못 나오게 막고 있습니다.

Voice Studio는 그 벽을 명령 4줄로 치웁니다. 대본 txt 파일 하나 → 신경망 TTS 나레이션 → BGM 자동 믹싱 → 방송 규격 마스터링 → 자막 포함 유튜브 mp4까지, 전 과정을 에이전트가 알아서 처리합니다.


🔧 파이프라인 — 대본에서 업로드 버튼 앞까지

tts.py  →  mix.py  →  master.py  →  youtube.py
(음성 합성)  (BGM+덕킹)   (-14 LUFS)    (mp4+자막 패키징)

실제로 입력하는 명령은 이게 전부입니다.

uv run scripts/tts.py --dialogue ep1.txt --cast "호스트=ko-KR-SunHiNeural,게스트=ko-KR-InJoonNeural" --out ep1.mp3
uv run scripts/mix.py ep1.mp3 --bgm bgm.mp3 --intro 2 --outro 3 --out mixed.mp3
uv run scripts/master.py mixed.mp3 --preset youtube --out final.m4a
uv run scripts/youtube.py final.m4a --waveform --resolution 1080p --out episode.mp4

각 단계가 하는 일을 정직하게 설명드리면:

  1. 음성 합성 (tts.py) — 4개 신경망 TTS 엔진 중 선택합니다. 기본 엔진(edge)은 무료이고 한국어 여성/남성 보이스(SunHi, InJoon 등)를 지원하며, --srt 옵션으로 엔진 타임스탬프 기반의 정확한 자막을 동시에 생성합니다(재전사 방식보다 빠르고 정확). Speaker: 대사 형식 대본 하나로 2인 이상 팟캐스트 대화도 합성됩니다.
  2. BGM 믹싱 (mix.py) — 배경음악을 깔면 말하는 구간에서 BGM이 자동으로 낮아지는 사이드체인 덕킹(실측 최대 17dB)이 적용됩니다. 인트로/아웃트로 여백, 루프 처리까지 자동입니다.
  3. 마스터링 (master.py) — 유튜브는 모든 오디오를 -14 LUFS로 정규화하기 때문에, 마스터링 없이 올리면 다른 영상보다 작고 힘없게 들립니다. 유튜브(-14)/팟캐스트(-16)/방송(-23) 프리셋으로 2-pass 정밀 타겟팅하며(실측 오차 ±0.4 이내), 노이즈 제거·무음 트림·페이드도 지원합니다.
  4. 영상 패키징 (youtube.py) — 커버 이미지 또는 웨이브폼/스펙트럼 비주얼로 1080p·4K·쇼츠(1080×1920) mp4를 만듭니다. H.264 High + AAC-LC 48kHz + faststart, 유튜브 권장 규격 그대로입니다. 챕터 파일을 넘기면 규칙(00:00 시작, 3개 이상 등)을 검증해 설명란용 텍스트까지 뽑아줍니다.

여기에 보너스로 로컬 Whisper 전사(stt.py) 가 포함됩니다. 회의 녹음이나 영상을 txt·srt·vtt·json으로 변환 — 클라우드 업로드 없이 전부 내 컴퓨터에서 처리됩니다.


📦 포함 구성 (실제 파일 그대로)

구성 내용
scripts/tts.py 멀티 엔진 TTS — 단일 나레이션, 멀티 스피커 대화, SRT 자막 동시 생성, 보이스/엔진 비교
scripts/mix.py BGM 자동 덕킹 믹서 — 인트로/아웃트로, 루프, 덕킹 깊이 조절
scripts/master.py LUFS 라우드니스 마스터링 — 유튜브/팟캐스트/방송/음악 프리셋, 노이즈 제거, 무음 트림
scripts/youtube.py mp4 패키징 — 커버/웨이브폼/스펙트럼, 1080p·4K·쇼츠, 자막 번인, 챕터 검증
scripts/stt.py 로컬 Whisper(faster-whisper) 전사 — txt/srt/vtt/json, 영어 번역 모드
scripts/engines/ edge · Kokoro-82M(오프라인) · OpenAI TTS · ElevenLabs 엔진 모듈
guides/RECIPES.md 오디오북·팟캐스트·쇼츠·더빙·회의록 엔드투엔드 레시피 (소요시간·팁 포함)
guides/YOUTUBE.md 2026 기준 유튜브 업로드 스펙, AI 콘텐츠 고지 정책, 수익화(YPP) 주의점
guides/LICENSING.md 엔진별 상업 이용 안전성·가격 비교 — 리스크까지 정직하게

모든 스크립트는 PEP 723 self-contained 방식이라 venv 설정이 필요 없습니다. uv run 한 줄이면 의존성이 자동으로 준비됩니다. 구형 macOS의 휠 호환 함정(onnxruntime/av)도 미리 버전을 고정해 두었습니다.


💡 이렇게 쓰세요 — 실제 사용 예시 3가지

① 2인 팟캐스트를 유튜브 영상으로

호스트: 안녕하세요! 형식의 대본 하나면 여성/남성 보이스가 번갈아 말하는 에피소드가 나옵니다. BGM 덕킹 → -14 LUFS → 커버 이미지 mp4까지, 10분 분량 기준 합성 약 3분 + 믹스/마스터 1분 + 렌더 2~5분. 대본에 짧은 맞장구("네", "맞아요")를 섞으면 기계적인 느낌이 크게 줄어든다는 팁까지 레시피에 들어 있습니다.

② 쇼츠 나레이션 (세로 + 번인 자막)

uv run scripts/tts.py --file hook.txt --srt --rate +10% --out short.mp3
uv run scripts/master.py short.mp3 --preset youtube
uv run scripts/youtube.py short.m4a --preset shorts --srt short.srt --burn --out short.mp4

60초 쇼츠가 전 과정 2~3분에 나옵니다. 쇼츠는 무음 시청이 많아 자막 번인이 사실상 필수인데, TTS 타임스탬프 기반 SRT라 싱크가 정확합니다.

③ 오디오북 / 회의록

긴 원고를 챕터 단위로 나눠 --rate -5% 낭독 속도로 합성하고 팟캐스트 프리셋(-16 LUFS)으로 마스터링하면 청취 앱 표준 오디오북이 됩니다. 반대로 회의 녹음 1시간을 넣으면 10~15분 만에 로컬 전사 완료 — 에이전트가 결정사항·액션아이템 요약까지 이어서 해 줍니다.


✅ 필요한 준비물 (정직하게 말씀드립니다)

  • 필수: uv(Python 패키지 러너)와 ffmpeg. 둘 다 무료이며, 나머지 의존성은 uv가 자동 설치합니다.
  • 기본 엔진(edge)은 API 키가 필요 없습니다. 무료이고 한국어 품질도 좋습니다. 단, 네트워크 연결이 필요하고, Microsoft의 비공식 엔드포인트를 쓰기 때문에 상업 이용(수익화 채널·판매 제품)에는 약관 위반 리스크가 있습니다. 이 부분은 동봉된 LICENSING.md에서 감추지 않고 상세히 다룹니다 — 수익화 채널이라면 Azure Speech 정식 API(월 50만 자 무료, edge와 동일 보이스) 등으로 갈아타는 경로를 안내합니다.
  • 선택: OpenAI TTS는 OPENAI_API_KEY, ElevenLabs는 ELEVENLABS_API_KEY가 필요합니다(유료). Kokoro 엔진은 완전 오프라인·무료·상업 안전(Apache-2.0)이지만 한국어를 지원하지 않습니다(영어 콘텐츠 전용).
  • Whisper/Kokoro 모델은 첫 실행 시 다운로드(약 140~460MB)되며 이후 캐시됩니다. 전사는 이후 완전 오프라인으로 동작합니다.
  • Claude Code 등 에이전트 환경에서 스킬로 사용하도록 설계되었습니다.

👍 이런 분께 추천 / 👎 이런 분께는 비추천

추천드립니다:

  • 목소리 공개 없이 유튜브·쇼츠·팟캐스트를 시작하고 싶은 분
  • 대본은 쓸 수 있는데 녹음·믹싱·마스터링·인코딩이 벽인 분
  • 오디오북, 강의 나레이션, 회의록 전사를 반복 작업으로 자동화하고 싶은 분
  • "왜 내 영상만 소리가 작지?" — 라우드니스 규격을 몰라 손해 보던 분

비추천드립니다:

  • 실제 사람 목소리의 녹음·편집이 필요한 분 (이 스킬은 합성 음성 파이프라인입니다)
  • 영상 편집(컷 편집, 트랜지션, 모션그래픽)을 기대하는 분 — 산출물은 오디오 중심의 정적 비주얼 영상입니다
  • API 키 없이 한국어 콘텐츠로 즉시 수익화까지 하려는 분 — 무료 기본 엔진은 상업 이용 리스크가 있어, 수익화 시 정식 API 전환(무료 티어 있음)을 권장합니다

❓ 자주 묻는 질문 (FAQ)

Q1. 정말 API 키 없이 되나요?
네. 기본 엔진(edge)과 로컬 전사(Whisper), BGM 믹싱, 마스터링, mp4 패키징 모두 API 키 없이 동작합니다. OpenAI·ElevenLabs 엔진만 각자의 키가 필요한 선택 사항입니다.

Q2. 한국어 품질은 어떤가요?
기본 엔진이 SunHi(여성)·InJoon/Hyunsu(남성) 등 Microsoft 신경망 한국어 보이스를 사용합니다. 낭독 속도·피치 조절이 가능하고, 오디오북용 -5% 감속 같은 실전 팁이 레시피에 포함되어 있습니다.

Q3. 만든 영상으로 수익화해도 되나요?
두 가지를 확인하셔야 합니다. (1) 유튜브 정책 — AI 음성 자체는 수익화 금지가 아니며, 직접 쓴 대본과 편집·정보 가치가 있으면 가능합니다(YOUTUBE.md에 2026 기준 정리). (2) TTS 엔진 라이선스 — 기본 edge 엔진은 상업 이용 리스크가 있어, LICENSING.md의 안내대로 Azure 정식 API(월 50만 자 무료) 등 라이선스 확보 엔진 사용을 권장합니다.

Q4. 자막은 어떻게 만들어지나요?
tts.py --srt가 합성과 동시에 엔진 타임스탬프로 SRT를 생성합니다(기본 엔진 기준). 재전사 방식이 아니라 싱크가 정확합니다. 다른 엔진 사용 시엔 동봉된 stt.py로 자막을 만들 수 있고, 쇼츠용 번인(하드 자막)도 지원합니다.

Q5. 설치가 어렵지 않나요?
uv와 ffmpeg만 있으면 됩니다. 스크립트마다 의존성이 내장되어 있어 uv run 시 자동 설치되고, 별도의 가상환경 설정이 없습니다. 전 스크립트가 실기기 E2E 검증(LUFS 실측, ffprobe 규격 확인)을 거쳤고, 구형 macOS 호환 이슈도 미리 잡아 두었습니다.


🛒 구매 안내

  • 가격: $3 (1회 다운로드) — 월 구독이 아닙니다. 커피 한 잔 값으로 나레이션·믹싱·마스터링·패키징 파이프라인 전체와 3종 실전 가이드(레시피·유튜브 정책·라이선스)를 소장하세요.
  • 다운로드 즉시 Claude Code 스킬 폴더에 넣으면 바로 사용 가능합니다. 모든 스크립트에 --help가 있어 에이전트가 스스로 사용법을 찾아 실행합니다.
  • 스크립트 라이선스는 MIT — 자유롭게 수정·확장하실 수 있습니다. 각 TTS 엔진의 이용 조건은 동봉된 LICENSING.md를 참고하세요.

대본은 이미 준비되어 있지 않으신가요? 오늘 밤, 첫 영상을 올려 보세요. 🎬