실시간 1등 음성인식 모델 등장: MAI-Transcribe-2-Streaming과 새 음성 모델 MAI-Voice-2.1

실시간 음성인식

Microsoft AI(MAI)가 2026년 10월 1일, 실시간 스트리밍 음성 인식 모델 MAI-Transcribe-2-Streaming과 함께 두 개의 새로운 음성 합성(TTS) 모델 MAI-Voice-2.1, MAI-Voice-2.1-Flash를 공개했습니다. MAI-Transcribe-2-Streaming은 Artificial Analysis 벤치마크에서 1위에 올랐으며, 음성 비서·콜센터 봇 같은 “음성 에이전트”를 만들 때 체감이 크게 달라지는 구성요소들입니다.

Microsoft 365 Copilot이나 Copilot Studio로 음성 기반 에이전트를 구축하는 국내 개발자·기업 입장에서, 이번 발표는 “말이 끝나기 전에 반응하는” 실시간 대화형 에이전트를 더 쉽고 저렴하게 만들 수 있는 토대가 된다는 점에서 주목할 만합니다.


MAI-Transcribe-2-Streaming: 실시간 전사, 정말 빠릅니다

MAI-Transcribe-2-Streaming은 60개 언어에 대해 저지연 실시간 전사(transcription)를 제공하며, 언어를 자동으로 연속 감지합니다.

  • Artificial Analysis에서 최종(final) 전사와 부분(partial) 전사 정확도 모두 1위
  • 정확도 대 지연시간(accuracy-vs-latency) 평가에서 파레토 프론티어(Pareto frontier)에 위치 — 더 높은 정확도를 위해 지연시간을 크게 희생하지 않는다는 의미
  • 오디오 수신 후 약 100ms 이내에 첫 “partial(잠정)” 전사 결과를 내놓고, 이후 맥락이 쌓이면서 결과를 보정하며 안정적인 최종 전사를 확정
  • 내부 평가 기준으로 실시간 받아쓰기·자막 작업에서 경쟁 모델 대비 2배 빠르게 단어가 화면에 나타남
  • 연말까지 도입 가격 시간당 $0.54로 제공

이 “잠정 결과”가 중요한 이유는, 음성 에이전트가 사용자의 말이 끝나기 전에 추론을 시작하거나 도구를 호출할 수 있게 해주기 때문입니다. 실시간 받아쓰기나 자막 생성에도 바로 활용할 수 있습니다.

MAI-Voice-2.1: 하나의 목소리로 23개 언어를 자연스럽게

MAI-Voice-2.1은 Microsoft AI의 가장 강력한 다국어 TTS(음성 합성) 모델입니다.

  • 23개 언어, 26개 로케일 지원
  • 하나의 “목소리”가 언어를 바꿔도 동일한 화자처럼 들리며, 각 언어의 억양을 자연스럽게 따라감 (영어 → 중국어 → 독일어로 전환해도 같은 목소리 유지)
  • 다국어 튜터링 앱이 교사를 바꾸지 않고 언어만 전환하거나, 다국어 어시스턴트가 질문 언어에 맞춰 응답하는 시나리오에 적합
  • 가격은 100만 자당 $22

MAI-Voice-2.1-Flash: 대량 트래픽을 위한 초고속 버전

MAI-Voice-2.1-Flash는 같은 언어·화자 전환 기능을 지원하면서, 지연시간에 민감한 대용량 워크로드에 맞게 최적화되었습니다.

  • 최대 45초 분량의 오디오를 생성
  • 종단 간(end-to-end) 지연시간 단 150ms
  • 기존 대비 55% 빠른 추론, 비교 모델 대비 약 60% 저렴
  • 가격은 업계 최고 수준인 100만 자당 $15

MAI-Transcribe-2-Streaming과 짝을 이루면, 자연스럽고 지연 없는 음성 에이전트 경험을 만드는 데 최적의 조합이 됩니다.

두 음성 모델 모두 몇 초의 참조 음성만으로 모든 지원 언어에 걸쳐 음성 클로닝이 가능하며, 오남용을 막기 위한 동의(consent) 가드레일이 내장되어 있습니다.


왜 이 조합이 중요한가: 음성 에이전트의 루프

음성 에이전트는 결국 “듣고 → 이해하고 → 결정하고 → 말하는” 루프입니다. 이 루프가 사람이 “대화”로 느끼는 시간 안에 끝나야 하죠. MAI-Transcribe-2-Streaming과 MAI-Voice-2.1-Flash를 함께 쓰면 양쪽 끝에서 시간을 절약해, 에이전트가 추론하고 도구를 쓰고 답을 검증할 여유를 벌어줍니다.

활용 예시:

  • 고객 서비스 에이전트: 말하는 대로 실시간 전사하고, 발화가 끝나기 전에 행동을 시작하고, 자연스러운 음성으로 응답
  • 다국어 어시스턴트: 언어를 자동 감지해 23개 언어 중 어떤 언어로도 같은 목소리·같은 억양으로 응답
  • 인터랙티브 학습·미디어: 튜터링, 롤플레이, 시뮬레이션, 내레이션에 언어별로 구분된 화자 활용

시작하기

Microsoft AI는 이 세 모델이 함께 동작하는 모습을 보여주는 새로운 데모 “Chatter”를 MAI Playground에 공개했습니다.

Copilot Studio나 Microsoft 365 Copilot 기반 에이전트에 음성 인터페이스를 더하려는 국내 개발팀이라면, 이번에 공개된 가격과 지연시간 수치를 PoC 설계에 참고할 만합니다.


출처: Our first streaming transcription model debuts at no. 1 on Artificial Analysis (Microsoft AI News, 2026-10-01) · 자세한 내용은 원문 참조