Voicebox는 3초 만에 목소리를 복제한다 — 단, 주의점은

jamiepine/voicebox는 TTS 엔진 7개, 23개 언어 음성 복제, 시스템 전체 받아쓰기, MCP 연동, 로컬

Voicebox는 3초 만에 목소리를 복제한다 — 단, 주의점은
Share

지금 YouTube 브이로그에 "voice"라고 댓글을 달면 Voicebox 링크를 받게 됩니다. 3초짜리 오디오만으로 목소리를 복제하는 무료 로컬 ElevenLabs 대안으로 소개되는 도구입니다. 이 설명은 대체로 맞습니다. 다만 3초라는 숫자와 라이선스에는 단서가 붙습니다.

2026년 4월 Voicebox v0.5: 받아쓰기, 성격 프리셋, Whisper 레이어

Voicebox(repo jamiepine/voicebox)는 7개의 텍스트 음성 변환 엔진, 시스템 전역 Whisper 받아쓰기, 로컬 REST/MCP 인터페이스를 하나로 묶은 무료 MIT 라이선스 데스크톱 앱입니다. Meta가 2023년 6월 16일 발표했지만 오용 위험을 이유로 공개하지 않은 2023년 동명 연구 모델과는 관련이 없습니다 .

이 앱은 오픈소스 파일 탐색기 Spacedrive의 개발자인 Jamie Pine이 만들었습니다. 첫 공개 릴리스인 v0.1.0은 2026년 1월 27일 배포됐고, 현재 버전인 v0.5.0 "Capture" 릴리스는 2026년 4월 25일 나왔습니다 . 홈페이지는 다운로드 수가 100만 회 이상이라고 밝힙니다 . 구조적으로는 포트 17493의 Python FastAPI 백엔드 위에 Tauri 셸로 감싼 React 프런트엔드입니다 .

엔진모델 크기제로샷 복제언어
Kokoro (82M)~350 MB아니요(프리셋)영어
Qwen3-TTS 0.6B~1.2 GB다국어
Qwen3-TTS 1.7B~3.5 GB다국어
Chatterbox Multilingual~3.2 GB23개
Chatterbox Turbo다국어
HumeAI TADA 3B~8 GB다국어
LuxTTS다국어

만들기 전에 한 가지 주의할 점이 있습니다. MIT 라이선스가 적용되는 것은 래퍼 앱이지, 함께 제공되는 가중치가 아닙니다 . Alibaba의 Qwen, Chatterbox, TADA, Kokoro 등 각 업스트림 모델에는 별도로 확인해야 할 자체 조건이 있습니다.

디스크, RAM, 깨끗한 마이크: 시드 녹음 준비하기

Screenshot of https://github.com/jamiepine/voicebox/blob/main/README.md

무엇을 복제하기 전에 먼저 컴퓨터가 요구 조건을 충족하는지 확인하세요. Voicebox가 문서에 명시한 최소 사양은 macOS 11 이상, Windows 10 이상 또는 Linux, 8 GB RAM, 5 GB 저장 공간, 최신 멀티코어 CPU입니다. 권장 사양은 16 GB 이상 RAM, 10 GB 이상 저장 공간, CUDA 지원 NVIDIA GPU입니다 . GPU 백엔드는 NVIDIA(CUDA), AMD(ROCm), Intel Arc(DirectML)를 지원하며 CPU 폴백도 있습니다 .

첫 실행에는 시간과 디스크 공간을 따로 잡아두세요. 선택한 엔진이 모델을 자동으로 다운로드합니다 . 크기는 Kokoro 약 350 MB부터 Chatterbox Multilingual 약 3.2 GB, TADA 3B 약 8 GB까지 다양합니다. Whisper 계층은 Base 약 300 MB, Small 약 500 MB, Medium 약 1.5 GB, Turbo 약 1.5 GB, Large 약 3 GB가 추가됩니다 . Apple Silicon에서는 PyTorch보다 MLX-Whisper가 자동으로 우선 선택됩니다 .

Linux 사용자는 아직 사전 빌드된 바이너리가 없으므로 Docker로 실행해야 합니다 : repo를 git clone하고, docker compose up을 실행한 다음 http://localhost:17493을 여세요. 컨테이너는 127.0.0.1:17493에 바인딩되고 영구 데이터와 Hugging Face 캐시 볼륨을 마운트하지만, localhost 바인딩 외에는 내장 인증이 없습니다 . 따라서 이 포트를 외부에 노출하지 마세요.

Voicebox에서 성격을 복제하는 순서

Screenshot of https://github.com/jamiepine/voicebox/blob/main/README.md

Voicebox가 실행되면 Profiles 패널에서 6단계 흐름으로 목소리를 복제할 수 있습니다. 설정 파일도, API 키도 필요 없습니다. 아래 단계는 깨끗한 샘플을 이미 준비했다는 전제입니다. 먼저 설치하고 실행한 뒤, 위에서 아래로 진행하세요.

  1. 플랫폼에 맞게 설치합니다. macOS DMG(Apple Silicon 또는 Intel), Windows MSI를 받거나, 아직 사전 빌드 바이너리가 없는 Linux에서는 컨테이너를 실행하세요 .
  2. 실행한 뒤 Profiles 패널을 엽니다. 복제된 목소리와 프리셋 목소리가 모두 이곳에 있습니다 .
  3. Cloned 프로필을 만들고 복제를 지원하는 엔진을 고릅니다. 제로샷 복제는 Qwen3-TTS, Chatterbox Multilingual, Chatterbox Turbo, LuxTTS, TADA에서 작동합니다. Kokoro(82M)는 프리셋 전용이며 복제를 하지 않습니다 .
  4. 참조 음성을 업로드하거나 녹음합니다. 문서는 조용한 방에서 자연스럽고 완전한 문장으로 녹음한 10-30초 길이의 WAV를 권장합니다. WAV가 MP3, M4A, FLAC보다 권장됩니다 .
  5. 테스트 문구를 생성합니다. 프로필을 확정하기 전에 톤과 선명도를 확인하세요. 품질은 엔진과 샘플에 따라 달라집니다.
  6. 성격을 지정합니다 받아쓰기 또는 TTS 출력에 사용할 수 있습니다.

엔진별 동작만 비교하고 싶다면 녹음은 아예 건너뛰어도 됩니다. Voicebox에는 샘플을 저장하지 않고 내장 목소리를 가리키는 50개 이상의 프리셋 목소리가 포함되어 있습니다 . 각 엔진이 음성을 어떻게 렌더링하는지 들어본 뒤, 마음에 드는 엔진을 고르고 나서 자신의 샘플을 녹음하세요.

홈페이지가 말하지 않는 것: 현실적인 샘플 길이와 TTS 사용 책임

Cloning a Personality in Voicebox: the Numbered Procedure

홈페이지의 "a few seconds"는 문서화된 사양이 아니라 마케팅식 축약 표현입니다. Voicebox의 공식 빠른 시작과 프로필 문서는 데모에서 자주 언급되는 3초보다 더 길고 깨끗한 참조 음성을 권장합니다.

공식 프로필 문서에 따르면 "10–30 seconds of clear speech with minimal background noise and natural, complete sentences"가 권장됩니다 (source: Voicebox docs, 2026-04).

3초짜리 클립도 일부 제로샷 엔진에서는 작동할 수 있지만, 권장 범위보다 짧기 때문에 잡음, 압축, 평소와 다른 말투에 더 민감해집니다 . 비교하자면 ElevenLabs Instant Voice Cloning은 Starter 플랜에서 최소 1분, 이상적으로는 1~2분을 권장하며, Professional Voice Cloning은 Creator 플랜의 월 $22와 약 30분 분량의 오디오가 필요합니다. 이는 런타임 조건부 생성이 아니라 실제 파인튜닝에 가깝습니다 .

다운로드 버튼이 지나치는 항목이 두 가지 더 있습니다. 첫째, 라이선스입니다. MIT 라이선스는 jamiepine/voicebox 래퍼에 적용될 뿐, 함께 쓰이는 가중치에는 적용되지 않습니다. Qwen, Chatterbox, TADA, Kokoro는 각각 별도의 업스트림 조건을 갖고 있으므로 프로덕션 사용 전 확인해야 합니다 . 둘째, 노출 범위입니다. 백엔드는 기본적으로 127.0.0.1:17493에 바인딩됩니다. 이를 0.0.0.0으로 바꾸면 내장된 인증 시스템이 없기 때문에 유일한 장벽이 사라집니다 . 충실도 측면에서도 2026년 4월 기준 ElevenLabs와 비교한 독립적이고 재현 가능한 벤치마크는 없었습니다. 따라서 "무료 로컬 대안"이라는 주장은 검증된 동등성이 아니라 소유권과 비용에 기대고 있습니다.

동의는 명시적으로 유지해야 합니다. 아래 예시 스니펫은 Voicebox의 일부는 아니지만 실제로 실행되었으며, 세부 조건을 강제 게이트로 표현합니다.

"""Minimal Voicebox-style demo: 3 seconds in, but consent stays explicit."""


class Voicebox:
    def clone(self, voice_sample_seconds, text, consent=False):
        if voice_sample_seconds < 3:
            raise ValueError("Need at least a 3-second reference clip.")
        if not consent:
            raise PermissionError("Fine print: only clone a voice you own or have permission to use.")
        return f"[synthetic voice] {text}"


voicebox = Voicebox()
print(voicebox.clone(3, "This is a short consent-based voice clone demo.", consent=True))

복제 이후: 받아쓰기 단축키, Whisper 아카이브, HTTP 기반 Voicebox

일단 하나의 음성 개성이 만들어지면, Voicebox의 받아쓰기 레이어는 이를 시스템 전역 입력 장치로 바꿉니다. 어떤 애플리케이션에서든 다시 지정할 수 있는 키보드 조합을 누른 채 말하고 손을 떼면, 포커스가 있던 입력란에 전사문이 자동으로 붙여넣어집니다. 녹음, 전사, 다듬기 상태는 떠 있는 알약 형태의 표시로 나타납니다 . 선택 사항인 로컬 Qwen LLM 정리 단계는 군더더기 말을 제거하고, 문장부호를 고치며, Whisper가 가끔 내보내는 반복 루프를 없앱니다. 약 5초 미만의 클립에서는 언어 힌트를 제공하면 정확도가 좋아집니다 .

모든 캡처는 오디오와 전사문이 함께 보관되므로, 다시 녹음하지 않고도 같은 클립을 Base부터 Large 또는 Turbo까지 다른 Whisper 티어로 다시 전사할 수 있습니다 .

에이전트 워크플로에서는 Voicebox가 HTTP와 stdio를 통해 http://127.0.0.1:17493/mcp에서 로컬 MCP 서버를 실행하며, voicebox.speak, voicebox.transcribe, voicebox.list_captures, voicebox.list_profiles 네 가지 도구를 노출합니다 . Claude Code, Cursor, Windsurf, Cline의 MCP 서버 설정에 이 URL을 추가하면 에이전트가 복제된 음성 개성으로 말할 수 있습니다 .

핵심은 이렇습니다. Voicebox는 단일 기능이라기보다 복제, 받아쓰기, 보관, HTTP 노출로 이어지는 로컬 파이프라인이며, 동의 게이트를 강제하는 책임은 여전히 사용자에게 있습니다.

자주 묻는 질문

jamiepine/voicebox는 Meta의 Voicebox와 같은 제품인가요?

아닙니다. Meta의 Voicebox는 2023년 6월 발표된 연구 모델로, 50,000시간이 넘는 오디오로 학습됐고 6개 언어를 지원했지만, Meta는 오용 위험을 이유로 모델이나 코드를 공개하지 않았습니다 . 여기서 다루는 도구는 jamiepine/voicebox입니다. Spacedrive 파일 탐색기 개발자가 만든, Meta와 무관한 MIT 라이선스 데스크톱 앱이며 2026년 1월 27일 0.1.0으로 처음 공개됐습니다 . 이름은 같지만 계보는 다릅니다.

3초짜리 오디오 클립으로도 실제 음성 복제가 되나요?

될 때도 있지만, 문서에서 권장하는 이상적인 조건에는 못 미칩니다. 일부 제로샷 엔진은 3초짜리 시드도 처리하지만, 공식 문서는 깨끗하고 잡음이 적은 WAV 음성을 자연스럽고 완전한 문장으로 10~30초 제공할 것을 권장합니다 . 짧은 클립은 압축 노이즈와 배경 소음에 더 민감하므로, 홈페이지의 “3초” 문구는 실제 사용에서의 절충점을 생략한 표현입니다.

Voicebox는 Linux에서 실행되나요?

v0.5.0(2026년 4월 25일) 기준으로 사전 빌드된 Linux 바이너리는 없습니다. 팀은 이를 GitHub runner의 디스크 공간 제한 때문이라고 설명합니다 . Linux 사용자는 Docker(docker compose up, 포트 17493)로 실행하거나 소스에서 빌드해야 하며, 이 경우 Bun, Rust, Python 3.11 이상, Tauri 사전 요구 사항이 필요합니다 .

인터넷 연결 없이 Voicebox를 사용할 수 있나요?

예, 첫 실행 때 초기 모델 다운로드를 마친 뒤에는 가능합니다. 각 TTS 엔진과 Whisper ASR 모델은 한 번 받아두면 로컬에서 실행되므로, 생성과 받아쓰기는 오프라인에서도 작동합니다 . 선택형 유료 클라우드 백업 및 동기화 요금제는 계획되어 있지만, v0.5.0(2026년 4월) 기준으로는 아직 활성화되지 않았습니다 .

ElevenLabs와 비교하면 비용은 어떤가요?

Voicebox는 MIT 라이선스에 따라 로컬 사용이 무료입니다 . ElevenLabs는 호스팅 플랫폼입니다. Free는 $0에 10k 크레딧, Starter는 $5에 30k 크레딧(Instant Voice Cloning), Creator는 $22에 100k 크레딧(Professional Voice Cloning, 파인튜닝에 약 30분 분량의 오디오 필요)을 제공합니다 . Voicebox는 아직 출시되지 않은 유료 클라우드 백업 요금제를 계획하고 있으며, 2026년 4월 기준 통제된 테스트에서 ElevenLabs와 출력 품질이 동등한지는 검증되지 않았습니다 .

이 글이 도움이 되셨다면, 새 글이 올라올 때마다 이메일로 받아보세요.

구독하기