그래디움, GPT 모델 능가하는 실시간 음성 번역 모델 공개
AI 기업 그래디움이 20개 이상의 언어 쌍을 지원하는 실시간 음성 번역 모델인 stt-translate와 s2s-translate를 공개했습니다. 이 모델들은 기존의 복잡했던 3단계 처리 방식을 단순화하여 GPT 및 제미나이 실시간 번역 모델들을 뛰어넘는 정확도와 처리 속도(저지연)를 달성했습니다. 또한 사용자가 원하는 출력 음성을 선택하거나 복제(클로닝)할 수 있는 기능까지 지원하여 실시간 통역 및 번역 분야의 패러다임을 전환할 중요한 모델로 평가받습니다.
그래디움(Gradium)은 영어, 프랑스어, 독일어, 스페인어, 포르투갈어를 포괄하는 20개의 언어 쌍을 지원하는 두 가지 실시간 음성 번역 모델, stt-translate와 s2s-translate를 발표했습니다. 이 모델들은 기존의 표준적인 3단계 모델 연쇄(cascade) 구조를 2단계로 압축하여, 단일 패스(single-pass) 전사 및 번역 방식과 그래디움의 TTS(Text-To-Speech) 단계를 하나의 양방향 웹소켓(WebSocket) 환경에서 결합합니다.
그래디움에 따르면, 이 모델들은 gpt-realtime-translate 및 gemini-3.5-live-translate와 비교했을 때 더 우수한 정확도와 지연 시간(latency)의 균형을 보여줍니다. 여기에 더해 출력 음성을 선택하고 복제(cloning)하는 기능도 함께 제공됩니다.
그래디움이 정확도와 속도 모두에서 gpt-realtime-translate를 능가하는 실시간 음성 번역 모델인 stt-translate와 s2s-translate를 출시했다는 기사는 MarkTechPost를 통해 처음 공개되었습니다.