핵심 내용
Microsoft AI는 10월 1일 실시간 음성인식 모델 MAI-Transcribe-2-Streaming과 음성합성 모델 MAI-Voice-2.1, 저지연 버전 MAI-Voice-2.1-Flash를 공개했다. Transcribe 모델은 60개 언어를 지원하고 입력 오디오를 받은 지 100ms를 조금 넘긴 시점부터 임시 transcript를 반환한다. 사용자가 말을 끝내기 전부터 Agent가 reasoning이나 tool call을 시작할 수 있도록 설계된 점이 핵심이다. Microsoft AI
Microsoft는 MAI-Transcribe-2-Streaming이 Artificial Analysis의 streaming transcription 평가에서 최종·중간 transcript 정확도 모두 선두라고 설명했다. 2026년 말까지의 introductory price는 오디오 1시간당 0.54달러다. 다만 benchmark는 특정 데이터셋을 기준으로 한 외부 평가이며 60개 언어 각각에서 동일한 성능을 보장한다는 뜻은 아니다. Microsoft AI
MAI-Voice-2.1은 23개 언어·26개 locale을 지원하며 같은 화자 정체성을 유지한 채 여러 언어를 오갈 수 있다. 가격은 100만 문자당 22달러다. Flash 버전은 45초 분량 음성을 약 150ms end-to-end latency로 생성할 수 있다고 Microsoft가 설명하며, 가격은 100만 문자당 15달러다. 세 모델은 Microsoft Foundry 등에서 이용할 수 있다. Microsoft AI
배경
실시간 음성 Agent의 전체 latency는 STT, LLM reasoning, tool call, TTS가 합쳐진 값이다. 이 중 앞뒤의 음성처리가 느리면 가장 강한 reasoning 모델을 사용해도 사람이 자연스럽게 느끼는 대화속도를 맞추기 어렵다. Streaming STT가 사용자의 문장 종료 전에 partial transcript를 제공하면 Agent가 미리 검색이나 도구 실행을 시작할 수 있어 실제 체감 지연을 줄일 수 있다. Microsoft AI
산업·시장에 미치는 영향
OpenAI, Google, ElevenLabs뿐 아니라 Microsoft 자체 모델까지 음성 stack을 직접 제공하면서 실시간 고객상담·예약·교육 Agent 시장의 가격과 latency 경쟁이 더 치열해질 수 있다. Microsoft는 Foundry와 Azure Voice Live를 통해 모델부터 배포환경까지 하나의 enterprise stack으로 묶을 수 있다는 강점이 있다. Microsoft AI
실무에서 바로 활용할 수 있는 시사점
음성 Agent를 평가할 때 STT WER 하나만 보지 말고 첫 partial까지의 시간, stable transcript 시간, interrupt 처리, tool-call 시작시점, TTS first-audio latency를 합친 end-to-end turn latency를 측정해야 한다. 한국어 workload도 공개 평균치에 의존하지 말고 실제 전화·소음 환경에서 별도로 검증하는 편이 좋다.
출처
Microsoft AI — Our first streaming transcription model debuts at no. 1 on Artificial Analysis Microsoft Learn — MAI-Transcribe-2-Streaming Realtime API