오늘 GeekNews 신규 AI 글 가운데 가장 바로 써볼 만한 프로젝트입니다. news.hada.io

VoiceStudio는 Windows·macOS·Linux에서 실행되는 오픈소스 음성 작업 suite입니다. 현재 16개 TTS engine과 11개 ASR engine을 하나의 UI에 묶고, 프로젝트 catalog 기준 646개 언어를 다룹니다. 실제 지원 품질과 언어 범위는 사용하는 engine에 따라 달라집니다. github.com

지원 기능은 상당히 넓습니다.

Voice cloning / TTS / STT / Video dubbing / Audiobook / Dictation / Batch processing

뿐 아니라 REST·SSE·WebSocket API와 OpenAI-compatible Audio API, MCP도 제공합니다. CUDA·Apple MPS/MLX·ROCm·CPU와 remote worker를 지원합니다. 기본적인 로컬 workflow에서는 계정·API key·subscription이 필요 없고 데이터도 로컬에 남습니다. github.com

Zero-shot cloning은 일반적으로 약 5~15초 정도의 깨끗한 음성 sample을 권장합니다. 프로젝트는 아직 Active Beta이고 개별 모델은 각각 별도 라이선스를 가질 수 있으므로 상업서비스에 쓸 때는 upstream model license를 확인해야 합니다. github.com

실무적으로 좋은 구조

특히 개인 AI나 음성비서를 만든다면:

Mic
 ↓
Local ASR
 ↓
Agent / LLM
 ↓
Local TTS
 ↓
Speaker

로 만들 수 있기 때문에 음성 원본을 cloud로 보내지 않는 구조가 가능합니다.

API compatibility가 있기 때문에 application code에서는 cloud STT/TTS와 local VoiceStudio를 provider처럼 교체하는 것도 가능합니다.

VoiceStudio GitHub