메뉴
BL
MarkTechPost 26일 전

인터페이즈, 6개국어 지원 오픈소스 디퓨전 ASR 모델 공개

IMP
6/10
핵심 요약

인터페이즈(Interfaze)는 기존 자기회귀 방식이 아닌 디퓨전(Diffusion) 기술을 적용하여 6개 국어를 전사할 수 있는 다국어 음성 인식(ASR) 모델을 오픈소스로 공개했습니다. 이 모델은 구글의 언어 모델에 약 4,200만 개의 매개변수(Parameter)를 가진 어댑터(Adapter)를 결합해 음성 입력을 처리하며, 전사 비용이 텍스트 길이가 아닌 노이즈 제거(Denoising) 단계에 따라 결정된다는 점에서 큰 의의가 있습니다.

번역된 본문

인터페이즈(Interfaze)는 자기회귀(Autoregression) 방식이 아닌 디퓨전(Diffusion)을 통해 텍스트를 전사하는 다국어 음성 인식(ASR) 모델인 'diffusion-gemma-asr-small'을 오픈소스로 공개했습니다. 이 모델은 약 4,200만 개의 매개변수(Parameter)를 가진 어댑터(Adapter)를 사용하여 구글의 동결된(Frozen) DiffusionGemma 모델에 오디오 기능을 추가합니다. 단 하나의 어댑터로 6개 국어를 처리하며, 전사 비용은 출력될 텍스트의 길이가 아닌 노이즈 제거(Denoising) 단계에 따라 결정됩니다.

인터페이즈가 DiffusionGemma의 병렬 노이즈 제거 디코더를 통해 6개 국어를 전사하는 오픈소스 디퓨전 ASR 모델인 diffusion-gemma-asr-small을 출시했다는 이 기사는 MarkTechPost에 처음 게재되었습니다.

원문 보기
원문 보기 (영어)
Interfaze open-sourced diffusion-gemma-asr-small, a multilingual ASR model that transcribes via diffusion, not autoregression. It adds audio to Google's frozen DiffusionGemma using a ~42M-parameter adapter. One adapter covers six languages, with transcription cost set by denoising steps, not transcript length. The post Interfaze Ships diffusion-gemma-asr-small, an Open-Source Diffusion ASR Model Transcribing Six Languages via DiffusionGemma’s Parallel Denoising Decoder appeared first on MarkTechPost.