메뉴

#ASR

MP
MarkTechPost • 24일 전
IMP 6

메타, 음성 인식·화자 구분 하나로 통합한 'Muse Voice Transcribe' 공개

메타 슈퍼인텔리전스 연구소(Meta Superintelligence Labs)가 스트리밍 음성 인식(ASR), 화자 분리(Diarization), 발화 종료 감지(Endpointing)를 단일 자기회귀(autoregressive) 모델로 통합한 'Muse Voice Transcribe'를 공개했습니다. 기존 음성 시스템이 세 개의 모델을 연결해 지연과 장애 지점을 키웠다면, 이 모델은 하나로 통합해 실시간 처리에 유리합니다.

음성인식 메타 실시간처리
MP
MarkTechPost • 65일 전
IMP 8

2026년 최고의 공개 음성 인식 모델 비교

2026년에 접어들며 오픈소스 음성 인식(ASR) 생태계는 더 이상 OpenAI의 Whisper가 독점하지 않게 되었습니다. 이제 Cohere Transcribe, IBM Granite, MOSS-Transcribe 등 여러 오픈소스 모델들이 오차율 1% 미만의 비슷한 성능을 보여주고 있습니다. 이 글은 16개 모델의 인식률, 언어 지원, 스트리밍 속도 및 라이선스를 비교하고, 공개된 단순 평균 점수로 순위를 매기는 것이 무의미해진 이유를 설명합니다.

음성 인식 오픈소스 ASR