오픈AI 'GPT Transcribe' 공개, 성능 향상에도 경쟁사엔 못 미쳐
오픈AI가 사전 녹음 및 실시간 음성 인식에 특화된 두 가지 새로운 모델, GPT Transcribe와 GPT Live Transcribe를 API를 통해 공개했습니다. 전작 대비 전사 속도와 단어 오류율(WER)이 개선되고 가격이 인하되었지만, ElevenLabs나 구글 등 경쟁사의 오류율 기준에는 여전히 미치지 못합니다. 특히 미스트랄은 분당 0.003달러라는 저렴한 가격으로 시장 공략을 강화하고 있어 AI 음성 전사 시장의 경쟁이 더욱 치열해지고 있습니다.
오픈AI가 API를 통해 제공되는 두 가지 새로운 음성 인식 모델, GPT Transcribe와 GPT Live Transcribe를 공개했습니다. GPT Transcribe는 사전 녹음된 오디오 파일을 처리하며, 실시간 대비 약 34배 빠른 속도로 이를 변환합니다. GPT Live Transcribe는 짧은 지연 시간(latency)을 필요로 하는 실시간 스트리밍을 위해 설계되었습니다.
AA-WER 벤치마크를 운영하는 Artificial Analysis에 따르면, GPT Transcribe의 단어 오류율(WER)은 3.31%를 기록했습니다. 이는 1년 전 출시된 전작인 GPT-4o Transcribe 대비 0.7%p 개선된 수치입니다. 동시에 가격은 25% 인하되어 오디오 분당 0.0045달러에 제공됩니다. 두 모델 모두 전사 컨텍스트 제공용 텍스트, 키워드 입력, 그리고 다양한 언어의 입력을 지원합니다.
하지만 AA-WER 순위에서 오픈AI는 여전히 여러 경쟁사들의 뒤처져 있습니다. 일레븐랩스(ElevenLabs)의 Scribe v2가 2.3%의 오류율로 1위를 차지했으며, 이어서 구글의 Gemini 3 Pro(2.9%)와 미스트랄(Mistral)의 Voxtral Small(3%)이 그 뒤를 따르고 있습니다. 특히 미스트랄은 최근 분당 단 0.003달러부터 시작하는 Voxtral Transcribe V2를 출시하며 시장에서 가격 경쟁력을 앞세우고 있습니다.
자세한 내용은 오픈AI의 트랜스크립션 가이드에서 확인할 수 있습니다. 이번 새로운 전사 모델들은 오픈AI가 최근 발표한 실시간 음성 모델 라인업(여기에는 실시간 전사 모델인 GPT-Realtime-Whisper도 포함됨)을 보완하는 역할을 합니다.