구글 제미나이 3.5 트랜스크라이브, 85개 언어 실시간 음성 인식 및 자동 교정 지원
구글이 실시간 음성-텍스트 변환 모델 'Gemini 3.5 Transcribe'를 공개했습니다. 85개 이상 언어를 자동 인식하며, '음...' 같은 군더더기 표현을 제거하고 실언(말실수)을 자동 교정한 뒤 텍스트를 스스로 포맷팅합니다. 스트리밍 기준 단어 오류율 4.0%, 녹음 기준 2.6%를 기록했고 이전 모델인 Chirp 3 대비 지연시간이 70% 낮아졌습니다.
구글의 Gemini 3.5 Transcribe, 85개 언어로 음성을 텍스트로 변환하며 말실수까지 자동 교정 Matthias Bastian | 2026년 8월 27일
구글이 실시간 전사(轉寫)를 위한 음성-텍스트 변환 모델 'Gemini 3.5 Transcribe'를 출시했습니다. 이 모델은 85개 이상의 언어를 자동으로 인식하며, "음", "그러니까" 같은 군더더기 표현을 제거하고, 말실수를 교정하며, 텍스트 포맷도 스스로 정리합니다.
구글에 따르면 단어 오류율은 스트리밍 기준 4.0%, 녹음 오디오 기준 2.6%이며, 지연시간은 이전 모델인 Chirp 3 대비 70% 낮습니다. 또한 '함수 호출(Function Calling)' 기능을 통해 이미지 생성이나 웹 검색 같은 작업을 다른 Gemini 모델에 위임할 수 있습니다.
이 모델은 두 가지 인터페이스로 제공됩니다. 'Live API'(gemini-3.5-transcribe-live)는 매우 낮은 지연시간으로 실시간 스트리밍을 처리하며, 'Interactions API'(gemini-3.5-transcribe)는 화자 구분과 타임스탬프를 포함해 녹음된 오디오를 처리합니다.
현재 Google AI Studio와 Gemini Enterprise Agent Platform에서 사용할 수 있으며, 안드로이드 Gboard("Rambler" 기능)와 macOS용 Gemini 앱에도 이미 탑재되어 있습니다. Chrome 지원은 곧 추가될 예정입니다.
출처: 구글