GeekNews 신규 목록에는 Hugging Face의 Speech-to-Speech 프로젝트도 올라왔습니다. news.hada.io, github.com
구조는 전형적인 음성 Agent pipeline입니다.
VAD
↓
STT
↓
LLM
↓
TTS
하지만 모든 단계가 교체 가능하도록 만들어졌고, 서버 인터페이스는 OpenAI Realtime API의 핵심 이벤트 규격과 호환됩니다. github.com
따라서 LLM 부분만:
- OpenAI
- Hugging Face Inference
- OpenRouter
- vLLM
- llama.cpp
등으로 교체할 수 있습니다. github.com
더 흥미로운 점은 필요한 모델을 미리 다운로드해두면 인터넷 연결 없이 완전히 로컬로 실행할 수 있다는 것입니다. 실제로 이 파이프라인은 수천 대의 Hugging Face Reachy Mini 로봇에서 conversation backend로 사용되고 있다고 프로젝트 측은 설명합니다. github.com
실무 시사점
음성 AI를 만들 때 더 이상:
마이크 → 특정 Voice API
에 전체 시스템을 종속시킬 필요가 없습니다.
STT / LLM / TTS를 각각 독립 계층으로 만들고 OpenAI-compatible interface를 내부 표준으로 쓰는 방식은 클라우드와 로컬을 교체하기에 상당히 좋은 구조입니다.