메뉴

#음성합성

MP
MarkTechPost • 2일 전
IMP 7

구글, 프롬프트 기반 음성 설계 지원하는 Gemini 3.8 Flash TTS 공개

구글이 Gemini API와 Google AI Studio를 통해 새로운 텍스트 음성 변환(TTS) 모델인 Gemini 3.8 Flash TTS와 Flash-Lite TTS를 공개했습니다. Flash TTS는 100개 이상 언어에서 자연어 프롬프트로 새로운 음성을 설계할 수 있으며, Hume AI 음성 설계 벤치마크에서 71.4점으로 1위를 기록했습니다. Flash-Lite TTS는 대량 더빙과 음성 에이전트용으로 저비용에 최적화된 모델입니다.

구글 제미나이 TTS
TD
The Decoder • 2일 전
IMP 7

알리바바, Qwen Audio 3.1 출시… AI 오디오 가격 최대 95% 인하

알리바바의 AI팀 Qwen이 음성 인식(ASR), 음성 합성(TTS), 실시간 상호작용용 모델 5종으로 구성된 Qwen-Audio-3.1을 공개했습니다. 다국어·방언 인식 개선, 감정·환경음 감지, 텍스트 프롬프트만으로 감정과 스타일 제어, 동시 듣기·말하기 지원 등이 핵심 기능입니다. 아울러 TTS 약 70%, 실시간 약 85%, ASR 최대 95% 가격을 인하해 AI 오디오 시장에서 공격적인 경쟁에 나섰습니다.

음성인식 음성합성 알리바바
MP
MarkTechPost • 5일 전
IMP 6

2026년 최고의 음성 복제 API 비교

MarkTechPost가 10초짜리 음성 샘플을 7개 음성 복제 API 플랫폼에 복제해 성능을 비교했습니다. 평가 기준은 참조 오디오 요구 사항, 화자 유사도, 동의(Consent) 검증, 라이선스 정책, 그리고 100만 자당 가격입니다. 음성 합성 서비스 도입을 검토하는 실무자에게 유용한 벤치마크 자료입니다.

음성복제 음성합성 API
MP
MarkTechPost • 25일 전
IMP 5

그래디움 AI, 신규 기본 TTS 모델 공개

Gradium AI가 새 기본 TTS(텍스트 음성 변환) 모델을 발표했다. 5개 언어의 어려운 문장 500개에 대해 사람 평가 기준 81.0% 통과율을 기록했으며, Coval 환경에서 첫 오디오까지 216ms(P50)라는 빠른 응답 속도를 보였다. 평가 데이터셋은 Hugging Face에서 CC BY 4.0 라이선스로 공개되어 있다.

텍스트음성변환 음성합성 TTS
MP
MarkTechPost • 39일 전
IMP 6

카르테시아, Sonic-3.6 공개 — 스피치 아레나 양대 리더보드 1위

Cartesia(카르테시아)가 트랜스포머가 아닌 상태 공간 모델(state space model) 기반의 스트리밍 TTS(텍스트 음성 변환) 모델 Sonic-3.6을 공개했습니다. 이 모델은 Artificial Analysis의 두 음성 리더보드에서 모두 1위를 차지했으며(Provider Voice 1,283 Elo, Controlled Voice 1,123 Elo), 첫 오디오 출력까지 90ms 미만의 지연 시간을 자랑합니다. 현재 Cartesia 자체 API에서 베타로 이용할 수 있습니다.

음성합성 TTS Cartesia