메뉴

#음성인식

TD
The Decoder • 2일 전
IMP 7

알리바바, Qwen Audio 3.1 출시… AI 오디오 가격 최대 95% 인하

알리바바의 AI팀 Qwen이 음성 인식(ASR), 음성 합성(TTS), 실시간 상호작용용 모델 5종으로 구성된 Qwen-Audio-3.1을 공개했습니다. 다국어·방언 인식 개선, 감정·환경음 감지, 텍스트 프롬프트만으로 감정과 스타일 제어, 동시 듣기·말하기 지원 등이 핵심 기능입니다. 아울러 TTS 약 70%, 실시간 약 85%, ASR 최대 95% 가격을 인하해 AI 오디오 시장에서 공격적인 경쟁에 나섰습니다.

음성인식 음성합성 알리바바
MP
MarkTechPost • 7일 전
IMP 7

SpaceXAI, 음성인식 정밀도 2배 개선한 'Grok Voice Transcribe 2.0' 출시

SpaceXAI가 배치 및 스트리밍 오디오용 음성-텍스트 변환(Speech-to-Text) 모델 'Grok Voice Transcribe 2.0'을 출시했습니다. 19개 언어에서 짧은 구문 단어 오류율이 20.6%에서 6.8%로 대폭 감소했으며, 가격은 기존과 동일하게 배치 시간당 $0.10, 스트리밍 시간당 $0.20입니다. 동일한 비용으로 정확도가 크게 향상되어 음성 처리 서비스 구축 실무자에게 중요한 소식입니다.

음성인식 AI모델 API
GB
Google AI Blog • 10일 전
IMP 8

모든 언어를 위한 AI: 300개 언어, 70억 인구를 잇다

구글은 AI 번역 기술을 300개 이상 언어(전 세계 인구의 86%)로 확장하며, 단순 텍스트 번역을 넘어 감정·어조·속어, 코드 스위칭까지 이해하는 원어음 오디오 인텔리전스로 발전시키고 있습니다. Gemini 3.5 Live Translate와 Transcribe, 1,000개 언어 지원 이니셔티브를 통해 데이터가 부족한 언어에도 교차 언어 전이 학습 기법으로 접근성을 높이는 것이 핵심입니다.

구글 다국어AI 음성인식
WR
Wired AI • 19일 전
IMP 5

휴대폰에 속삭이는 불만, 고객 피드백의 미래

음성 받아쓰기 기술이 정교해지면서 스타트업 '보이스박스(Voicebox)'는 QR코드나 NFC로 매장에서 음성 피드백을 받아 자동 전사·감정 분석까지 제공한다. 이는 통화 대기 없이 20초 말하기만 하면 되는 방식으로, 고객 피드백 수집 방식을 근본적으로 바꿀 수 있다는 점에서 주목할 만하다.

음성인식 고객피드백 AI스타트업
TD
The Decoder • 20일 전
IMP 7

메타, 끊김 없이 듣는 AI 어시스턴트의 기반 실시간 오디오 모델 공개

메타 슈퍼인텔리전스 랩스가 음성을 실시간 전사하고 화자를 20명 이상 구분하며 문장 경계까지 감지하는 'Muse Voice Transcribe' 모델을 공개했습니다. 시간당 0.18달러라는 경쟁사보다 낮은 가격과 70개 이상 언어 지원이 핵심 경쟁력이며, 이미 메타 AI와 메타 모델 API에서 사용할 수 있습니다.

메타 음성인식 실시간전사
MP
MarkTechPost • 24일 전
IMP 6

메타, 음성 인식·화자 구분 하나로 통합한 'Muse Voice Transcribe' 공개

메타 슈퍼인텔리전스 연구소(Meta Superintelligence Labs)가 스트리밍 음성 인식(ASR), 화자 분리(Diarization), 발화 종료 감지(Endpointing)를 단일 자기회귀(autoregressive) 모델로 통합한 'Muse Voice Transcribe'를 공개했습니다. 기존 음성 시스템이 세 개의 모델을 연결해 지연과 장애 지점을 키웠다면, 이 모델은 하나로 통합해 실시간 처리에 유리합니다.

음성인식 메타 실시간처리
HN
Hacker News • 29일 전
IMP 8

구글, 실시간 지능형 음성인식 'Gemini 3.5 Transcribe' 공개

구글이 배경 소음, 전문 용어, 말더듬 등 기존 음성인식 모델의 약점을 극복한 음성-텍스트 변환 모델 'Gemini 3.5 Transcribe'를 공개했습니다. 스트리밍 기준 단어 오류율(WER) 4.0%, 비스트리밍 2.6%를 달성했으며, 85개 이상 언어를 자동 감지하고 맞춤 어휘, 화자 구분, 함수 호출 기능을 지원합니다. 개발자는 Live API와 Interactions API를 통해 실시간 스트리밍 및 사전 녹음 오디오 처리에 활용할 수 있습니다.

음성인식 Gemini 구글
TD
The Decoder • 30일 전
IMP 7

구글 제미나이 3.5 트랜스크라이브, 85개 언어 실시간 음성 인식 및 자동 교정 지원

구글이 실시간 음성-텍스트 변환 모델 'Gemini 3.5 Transcribe'를 공개했습니다. 85개 이상 언어를 자동 인식하며, '음...' 같은 군더더기 표현을 제거하고 실언(말실수)을 자동 교정한 뒤 텍스트를 스스로 포맷팅합니다. 스트리밍 기준 단어 오류율 4.0%, 녹음 기준 2.6%를 기록했고 이전 모델인 Chirp 3 대비 지연시간이 70% 낮아졌습니다.

구글 제미나이 음성인식
WR
Wired AI • 30일 전
IMP 5

키보드 대신 AI 마이크로 말하기만 하세요

영국 런던의 스타트업 Relay가 고품질 음성-텍스트 변환을 위한 전용 휴대용 마이크 'Relay Q'와 macOS 앱을 선보였다. Google Gemini 기반으로 필러 워드 제거, 문맥상 작업(Skills) 실행 등이 가능하지만, 광범위한 시스템 권한 요구로 인한 프라이버시 우려와 변환 정확도의 한계도 존재한다.

음성인식 Relay Gemini
TD
The Decoder • 31일 전
IMP 7

IBM, 에이전틱 기능 내장 오픈 웨이트 '그라나이트 4.2' 공개

IBM이 Apache 2.0 라이선스로 3B·8B·30B 크기의 오픈 웨이트 언어모델 Granite 4.2를 공개했습니다. 약 15조 토큰으로 처음부터 학습되었으며 최대 51만 2천 토큰 컨텍스트와 '사고/비사고' 모드 전환을 지원하고, 8B와 30B는 도구 사용·코드 실행·웹 검색을 실제 샌드박스 환경에서 학습하는 '에이전틱 RL' 훈련을 거쳤습니다. 또한 4억 7천만 파라미터의 Granite Speech 5.0 Turbo CTC 음성모델도 함께 출시되어 오픈소스 생태계에서 상업적 활용 가능한 경쟁력 있는 선택지가 늘었다는 점에서 중요합니다.

오픈소스 IBM 그라나이트
MP
MarkTechPost • 36일 전
IMP 6

Superwhisper, 462MB 오픈 웨이트 텍스트 정규화 모델 'S1-mini' 공개

Superwhisper가 ASR(음성인식) 결과 후처리용 오픈 웨이트 텍스트 정규화 모델 S1-mini를 공개했습니다. 크기가 462MB에 불과해 로컬 환경에서 실행할 수 있으며, 말버릇·군더더기 표현을 제거하고 자기 수정을 정리해 음성 인식 원본 텍스트를 깔끔한书面 텍스트로 변환합니다. ASR 파이프라인 후단 정규화 단계를 경량화한 것이 핵심입니다.

음성인식 오픈소스 텍스트정규화
TC
TechCrunch AI • 39일 전
IMP 7

위스퍼(Wispr), 200억 달러 기업가치로 2억 8천만 달러 유치

AI 받아쓰기(dictation) 스타트업 위스퍼(Wispr)가 Menlo Ventures가 이끄는 시리즈 B 라운드에서 2억 8천만 달러(약 4,000억 원)를 20억 달러 기업가치로 유치했습니다. 이번 자금은 회의록 작성 도구 등 받아쓰기 외 새로운 영역 확장에 활용될 예정이며, 오류율을 30%에서 10% 미만으로 낮추는 새 음성 인식 모델 'Canto'도 함께 공개했습니다.

투자유치 음성인식 받아쓰기
HN
Hacker News • 50일 전
IMP 7

뉴올리언스, AI 기반 911 비상 통화 분류 소프트웨어 테스트

미국 루이지애나주 뉴올리언스는 911 비상 전화 폭주를 해결하기 위해 AI를 도입하여 통화를 우선 분류(Triage)하고 인력 부담을 줄이는 시스템을 테스트하고 있습니다. 이 시스템은 동일한 사건에 대한 중복 전화를 AI가 걸러내어 신속하게 안내를 제공하거나 인간 상담원에게 연결해 주지만, 특정 억양 인식 실패나 편향된 데이터로 인한 차별 문제 등의 잠재적 위험도 안고 있습니다.

AI 응급통화 공공안전 음성인식
TD
The Decoder • 58일 전
IMP 7

오픈AI 'GPT Transcribe' 공개, 성능 향상에도 경쟁사엔 못 미쳐

오픈AI가 사전 녹음 및 실시간 음성 인식에 특화된 두 가지 새로운 모델, GPT Transcribe와 GPT Live Transcribe를 API를 통해 공개했습니다. 전작 대비 전사 속도와 단어 오류율(WER)이 개선되고 가격이 인하되었지만, ElevenLabs나 구글 등 경쟁사의 오류율 기준에는 여전히 미치지 못합니다. 특히 미스트랄은 분당 0.003달러라는 저렴한 가격으로 시장 공략을 강화하고 있어 AI 음성 전사 시장의 경쟁이 더욱 치열해지고 있습니다.

오픈AI 음성인식 GPT-Transcribe
HN
Hacker News • 60일 전
IMP 7

모델 다운로드 없이 온디바이스로 구동되는 맥용 음성 입력기 'Yap'

macOS 26(Tahoe)에 새롭게 추가된 온디바이스 음성 인식 프레임워크를 활용해 별도의 AI 모델 다운로드 없이 매우 빠르고 가벼운 음성 입력(Dictation)을 제공하는 오픈소스 앱입니다. 기존 무거운 모델을 다운로드해야 하거나 웹 엔진 기반으로 무거웠던 타 앱들과 달리, 4MB 크기의 네이티브 앱으로 메모리와 네트워크를 절약하면서도 Apple 자체 모델을 통해 뛰어난 인식률을 제공하는 것이 특징입니다.

오픈소스 macOS 음성인식
TD
The Decoder • 80일 전
IMP 7

코히어, 아랍어 전용 최고 정확도 오픈소스 음성 인식 모델 공개

코히어(Cohere)가 아랍어 음성 인식의 까다로운 문제를 해결하기 위해 20억 개의 매개변수(Parameter)를 가진 오픈소스 모델 'Cohere Transcribe Arabic'을 공개했습니다. 이 모델은 다양한 방언과 아랍어-영어 혼용 대화(Code-switching)를 훌륭하게 처리하며, 기존의 Whisper Large V3 등 경쟁 모델들을 성능 벤치마크에서 능가하는 가장 정확한 아랍어 STT(Speech-to-Text) 시스템입니다. 아파치 2.0(Apache 2.0) 라이선스로 허깅페이스(Hugging Face) 및 코히어 API를 통해 제공되어 실무자들의 즉각적인 도입과 활용이 가능합니다.

음성인식 오픈소스 인공지능모델
TC
TechCrunch AI • 95일 전
IMP 6

아마존, 인도서 힌디어 지원 '알렉사 플러스' 테스트

아마존이 차세대 대화형 AI 어시스턴트인 알렉사 플러스(Alexa+)의 인도 진출을 준비하며, 현지 사용자를 대상으로 한 힌디어 버전의 베타 테스트를 진행하고 있습니다. 6억 명 이상이 사용하는 거대한 힌디어 음성 시장을 공략하기 위한 움직임으로, 알렉사 플러스는 프라임 고객에게 무료로 제공될 예정입니다.

아마존 알렉사 생성형AI
WR
Wired AI • 100일 전
IMP 8

제미나이 탑재 구글 홈 스피커, 드디어 출시

구글이 기존 어시스턴트 대신 최신 AI 모델인 제미나이(Gemini)를 탑재한 새로운 스마트 스피커 '구글 홈 스피커'의 판매를 공식 시작했습니다. 이번 기기는 자연스러운 대화형 질의응답, 다중 명령 처리, 제미나이 라이브(Live) 기능 등을 지원하여 스마트 홈의 상호작용 방식을 획기적으로 개선한다는 점에서 중요합니다. 기기 자체의 하드웨어 개선뿐만 아니라 구독형 서비스(Premium)와 결합하여 사용자에게 더욱 고도화된 스마트 홈 경험을 제공하는 것이 핵심입니다.

구글 제미나이 스마트홈
WR
Wired AI • 123일 전
IMP 6

AI를 너무 잘 다뤄서 사람들이 당신을 AI로 착각할 7가지 방법

최신 AI 도구를 업무와 일상에 완벽하게 통합하는 'AI 네이티브'로 거듭나기 위한 7가지 실전 팁을 소개합니다. 단순한 챗봇을 넘어 자동화 에이전트를 활용하고, 음성 입력을 취하며, AI에게 충분한 컨텍스트를 제공해 개인화된 결과물을 얻는 방법을 다룹니다. 보안과 할루시네이션(환각)에 주의하면서도 적극적으로 AI를 활용하는 것은 미래의 핵심 생산성 경쟁력이 될 것입니다.

생산성 AI-에이전트 업무-자동화