GeekNews 신규 목록에는 Hugging Face의 Speech-to-Speech 프로젝트도 올라왔습니다. news.hada.io, github.com

구조는 전형적인 음성 Agent pipeline입니다.

VAD
 ↓
STT
 ↓
LLM
 ↓
TTS

하지만 모든 단계가 교체 가능하도록 만들어졌고, 서버 인터페이스는 OpenAI Realtime API의 핵심 이벤트 규격과 호환됩니다. github.com

따라서 LLM 부분만:

  • OpenAI
  • Hugging Face Inference
  • OpenRouter
  • vLLM
  • llama.cpp

등으로 교체할 수 있습니다. github.com

더 흥미로운 점은 필요한 모델을 미리 다운로드해두면 인터넷 연결 없이 완전히 로컬로 실행할 수 있다는 것입니다. 실제로 이 파이프라인은 수천 대의 Hugging Face Reachy Mini 로봇에서 conversation backend로 사용되고 있다고 프로젝트 측은 설명합니다. github.com

실무 시사점

음성 AI를 만들 때 더 이상:

마이크 → 특정 Voice API

에 전체 시스템을 종속시킬 필요가 없습니다.

STT / LLM / TTS를 각각 독립 계층으로 만들고 OpenAI-compatible interface를 내부 표준으로 쓰는 방식은 클라우드와 로컬을 교체하기에 상당히 좋은 구조입니다.