메뉴

#텍스트음성변환

HN
Hacker News • 2일 전
IMP 7

구글, 제미나이 3.8 TTS 음성 생성 모델 공개

구글이 감정, 억양, 속도 등을 자연어 프롬프트로 세밀하게 조절할 수 있는 텍스트 음성 변환(TTS) 모델 'Gemini 3.8 Flash TTS'와 'Gemini 3.8 Flash-Lite TTS'를 공개했습니다. 100개 이상 언어로 맞춤 음성을 처음부터 만들거나 30초 샘플로 기존 음성을 재현할 수 있어 오디오북, 팟캐스트, 게임, 실시간 음성 에이전트 등에 활용 가능합니다.

음성생성 텍스트음성변환 구글
MP
MarkTechPost • 25일 전
IMP 5

그래디움 AI, 신규 기본 TTS 모델 공개

Gradium AI가 새 기본 TTS(텍스트 음성 변환) 모델을 발표했다. 5개 언어의 어려운 문장 500개에 대해 사람 평가 기준 81.0% 통과율을 기록했으며, Coval 환경에서 첫 오디오까지 216ms(P50)라는 빠른 응답 속도를 보였다. 평가 데이터셋은 Hugging Face에서 CC BY 4.0 라이선스로 공개되어 있다.

텍스트음성변환 음성합성 TTS
MP
MarkTechPost • 67일 전
IMP 7

알리바바 통이랩, 16개국어 지원 TTS 모델 출시

알리바바 통이( Tongyi ) 연구소가 실시간 상호작용용인 Flash와 고품질 생성용인 Plus, 두 가지 버전의 텍스트 음성 변환(TTS) 모델 'Qwen-Audio-3.0-TTS'를 출시했습니다. 이 모델들은 알리바바 클라우드를 통해 호스팅되는 API 형태로 제공되며, 현업 개발자들이 실제 서비스 환경에서 직면하는 다양한 문제(다국어 지원 등) 해결에 초점을 맞췄다는 점이 특징입니다.

알리바바 통이랩 텍스트음성변환