메뉴

#음성 AI

TD
The Decoder • 23시간 전
IMP 7

구글, AI가 대신 전화 걸어주는 'Call for Me' 테스트

구글은 제미나이(Gemini)가 사용자를 대신해 업체에 전화를 걸어주는 'Call for Me' 기능을 테스트하고 있습니다. 예약, 일정 변경, 재고 확인 등의 업무를 AI가 전화를 통해 처리하며, 사용자는 실시간 통화 내역을 보다가 언제든지 직접 개입할 수 있습니다. 현재는 미국 내 유료 제미나이 구독자 중 픽셀 11 사용자만 베타 버전 폰 앱으로 이용 가능합니다.

구글 제미나이 AI 에이전트
TC
TechCrunch AI • 1일 전
IMP 7

일레븐랩스 CEO 인터뷰, 기업가치 220억 달러 평가

AI 음성 합성 기업 일레븐랩스(ElevenLabs)가 연 반복 매출(ARR) 6억 달러를 기록 중이며, 투자자들로부터 220억 달러의 기업가치를 평가받고 있다고 전해졌다. 클라르나, 도이체 텔레콤, 시스코 등 대형 고객은 물론 여러 정부 고객을 확보했으며, 창립 4년 만에 음성 AI 시장을 선도하고 있다. CEO 마티 스타니셰프스키는 대화형 AI 튜링 테스트 통과가 다음 목표라고 밝혔다.

ElevenLabs 음성 AI 기업가치
TC
TechCrunch AI • 1일 전
IMP 7

구글, 젬미니가 대신 전화 걸어주는 'Call for Me' 기능 테스트

구글이 AI 어시스턴트 젬미니(Gemini)가 사용자를 대신해 업체에 전화를 걸어 예약, 재고 확인, 약속 변경 등을 처리하는 'Call for Me' 기능을 실험적으로 출시했다. 미국 내 젬미니 유료 구독자 중 픽셀 11 사용자가 안드로이드 폰 앱 베타 버전을 통해 이용할 수 있으며, 통화 중 사용자가 실시간으로 지켜보다 언제든 개입할 수 있다는 점이 핵심이다.

구글 젬미니 AI 에이전트
MP
MarkTechPost • 2일 전
IMP 6

NVIDIA, 화자 8명 실시간 추적하는 오픈 웨이트 화자 구분 모델 공개

NVIDIA가 1억 파라미터 규모의 오픈 웨이트 화자 구분(speaker diarization) 모델 'Nemotron 3 Diarization'을 허깅페이스에 공개했습니다. 이 모델은 대화에서 '누가 언제 발언했는지'를 추적하며, 최대 8명의 화자를 음성이 겹치는 상황에서도 실시간으로 구분할 수 있습니다. 하나의 체크포인트로 오프라인 녹음과 실시간 스트리밍 모두 처리 가능하며, 웨이트가 공개되어 실무 배포가 가능하다는 점이 중요합니다.

NVIDIA 화자 구분 오픈 웨이트
MP
MarkTechPost • 3일 전
IMP 7

큐타이, 강화학습으로 음성 수학을 푸는 음성 네이티브 모델 'Voice of Reason' 공개

프랑스 연구소 큐타이(Kyutai)가 GLM-4-Voice-9B 기반의 오픈 웨이트 음성 대 음성(speech-to-speech) 모델 'Voice of Reason' 2종을 공개했습니다. 지도 미세조정(SFT)과 강화학습(RL)을 통해 음성 기반 GSM8K 수학 정답률을 27.3%에서 77.1%로 끌어올렸으며, 전사(transcription)나 텍스트 LLM 없이 순수 음성만으로 추론합니다. 두 체크포인트는 허깅페이스에 공개되어 있고 H100 GPU 한 장으로 실행 가능합니다.

음성 AI 강화학습 오픈소스
TC
TechCrunch AI • 9일 전
IMP 6

아이슬란드 트레블, 음성 AI 시뮬레이션 플랫폼으로 1,800만 달러 투자 유치

아이슬란드 스타트업 트레블(Treble)이 음성 AI 모델·로봇·하드웨어 기업을 위한 음향 시뮬레이션 플랫폼 구축을 목표로 시리즈 A 확장 라운드에서 1,800만 달러를 유치했다. 아마존과 로지텍을 고객으로 보유한 이 회사는 물리 기반 정확한 시뮬레이션을 통해 합성 음향 데이터를 생성하고 다양한 조건에서 음성 AI 모델을 평가하는 사업을 확장 중이며, 최근 스마트 글래스·웨어러블·로봇 등 피지컬 AI 영역으로 사업을 넓히고 있다.

음성 AI 투자 유치 시뮬레이션
MP
MarkTechPost • 10일 전
IMP 8

구글, 프로덕션급 음성 에이전트용 '제미나이 3.8 라이브' 공개

구글이 실시간 대화 모델 최신버전인 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 출시했습니다. 두 모델은 대화가 이어지는 동안 백그라운드에서 도구·API 호출을 실행하고, 실시간 영상 입력을 처리하며, 대화 중 97개 언어 간 전환이 가능합니다. Extended Thinking은 Artificial Analysis 음성-음성 품질 지수에서 82.6점으로 1위를 차지했으며, 분당 0.005달러의 오디오 입력 요금으로 Gemini API와 Google AI Studio에서 즉시 사용할 수 있습니다.

구글 제미나이 음성 AI
TD
The Decoder • 10일 전
IMP 7

구글, 저렴한 가격의 Gemini 3.8 Live 출시…오픈AI GPT-Live-1에 정면 도전

구글 딥마인드가 음성 AI 모델 'Gemini 3.8 Live'와 '3.8 Live Extended Thinking'을 공개했습니다. Extended Thinking 버전은 Artificial Analysis 음성 대 음성 리더보드에서 82.6%로 1위를 차지하며 오픈AI의 GPT-Live-1을 제쳤습니다. 가격은 분당 입력 $0.005, 출력 $0.018로 오픈AI보다 훨씬 저렴하지만, 오픈AI 모델이 풀 듀플렉스 덕분에 더 자연스러운 대화 품질을 제공하는 것으로 보입니다.

구글 Gemini 음성 AI
HN
Hacker News • 10일 전
IMP 8

구글, 젬미니 3.8 라이브 및 확장 사고 모델 공개

구글이 음성 대화 특화 AI 모델인 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 공개했습니다. 두 모델은 실시간 시각 맥락 이해, 병렬 추론, 대화 중단 없는 백그라운드 작업 처리를 지원하며, Artificial Analysis 음성-음성 품질 지수에서 1위(82.6점)를 차지했습니다. Gemini API, 구글 워크스페이스, 젬미니 앱에서 즉시 사용할 수 있습니다.

Gemini 음성 AI 구글
HN
Hacker News • 15일 전
IMP 8

OpenAI, GPT-Live-1 API 공개

OpenAI가 ChatGPT에 먼저 도입됐던 전이중(Full-Duplex) 음성 대화 모델 GPT-Live-1을 API로 개방했습니다. STT-LLM-TTS를 연결하는 기존 구조와 달리 하나의 모델로 듣고 말하는 것을 동시에 처리해 지연 시간을 줄이고 끊김 없는 자연스러운 대화가 가능합니다. 개발자는 시스템 프롬프트로 톤과 말하기 속도를 조절하고, 깊은 추론은 GPT-6 Astra 등 백엔드 모델에 위임하며, 전화 상담 등 실무 음성 에이전트 구축에 활용할 수 있습니다.

음성 AI OpenAI API
TD
The Decoder • 15일 전
IMP 8

OpenAI, 동시에 듣고 말하는 GPT-Live-1 API 공개

OpenAI가 음성 모델 GPT-Live-1을 API로 개방했습니다. 이 모델은 '풀듀플렉스(full-duplex)' 방식으로 말을 하면서 동시에 들을 수 있어, 개발자가 자연스러운 실시간 음성 앱을 만들 수 있습니다. 분당 0.05달러로 저렴하지는 않지만, 벤치마크에서 이전 모델을 크게 앞서며 Yelp 등이 이미 전화 예약 서비스에 적용했습니다.

OpenAI 음성 AI API
TC
TechCrunch AI • 16일 전
IMP 6

리슨랩스, 1조5천억 원 투자 대신 세일즈포스 인수 협상으로 전환

음성 AI로 고객 인터뷰를 자동화하는 스타트업 리슨랩스(Listen Labs)가 멘로 벤처스 주도로 1억2,500만 달러 시리즈 C 투자(기업가치 15억 달러) 조건서에 서명했지만, 세일즈포스와 약 20억 달러 규모 인수 협상이 진행되면서 이를 파기했습니다. 연 매출 약 3,000만 달러 규모인 이 회사는 AI 고객 리서치 시장의 선두 주자로, 인수 협상이 결렬될 경우 20억 달러 이상의 밸류에이션으로 투자 시장에 복귀할 것으로 전망됩니다.

M&A 세일즈포스 벤처캐피탈
WR
Wired AI • 23일 전
IMP 7

AI 면접의 최종 귀착점은 봇끼리 대화하는 것

미국의 한 구직자가 AI 채용봇 '라일리(Riley)'와의 반복되는 무성과 면접에 지쳐, 결국 ChatGPT 음성 에이전트를 대신 앞세워 AI끼리 면접을 진행시켰습니다. 구직자와 채용자 모두 AI를 활용하는 '봇 대 봇' 면접이 현실화되고 있으며, 이는 AI 채용의 다음 논리적 단계로 평가받지만 인력 시장의 신뢰 문제를 드러냅니다.

AI 채용 음성 AI ChatGPT
TC
TechCrunch AI • 31일 전
IMP 6

인도 음성 AI 스타트업 링, 피크 XV에서 1,000만 달러 투자 유치

월 2,000만 건의 통화 시도를 처리하는 인도 음성 AI 스타트업 링(Ringg)이 피크 XV 파트너스로부터 시리즈 A 연장으로 1,000만 달러를 유치해 시리즈 A 총액이 1,550만 달러에 달했다. 링은 단순 아웃바운드 콜을 넘어 의료 예약, 이커머스 장바구니 복구, 핀테크 KYC 등 복잡한 기업 워크플로를 음성 에이전트로 자동화하는 플랫폼으로 전환 중이며, 크레드, 플립카트, 프랙토, 그로우, 폴리시바자르 등이 고객이다.

음성 AI 스타트업 투자 인도
HN
Hacker News • 39일 전
IMP 6

Speko (YC S26) 출시 – 음성 AI를 위한 '오픈라우터'

YC S26 배경 스타트업 Speko가 OpenRouter의 음성 AI 버전을 출시했습니다. 모든 음성 모델(STT·LLM·TTS·음성간 변환)을 언어별·목적별 벤치마크 데이터에 기반해 하나의 API로 라우팅해줍니다. OpenAI 호환 API를 제공해 LiveKit, Pipecat 등 기존 프레임워크에서 호스트명만 바꾸면 바로 사용할 수 있다는 점이 핵심입니다.

음성 AI API 라우터 STT
TC
TechCrunch AI • 50일 전
IMP 7

AI 고객지원 플랫폼 오밀리아(Omilia), 670억 원 규모 시리즈 B 투자 유치

2002년부터 고객지원 자동화 분야를 선도해 온 그리스의 AI 스타트업 오밀리아(Omilia)가 670억 원의 시리즈 B 투자를 유치했습니다. 이 회사는 모든 업무에 생성형 AI를 투입하는 경쟁사들과 달리, 단순 문의에는 기존 기술을 혼합하여 사용하는 실용적인 접근 방식을 강조합니다. 이번 자금은 미국 시장 공략 및 영업 마케팅 조직 확충에 집중적으로 투입될 예정입니다.

AI 고객지원 음성 AI 스타트업 투자
TC
TechCrunch AI • 72일 전
IMP 7

음성 AI 스타트업 림(Rime), 240억 원 투자 유치

기업용 맞춤형 음성 AI 모델을 개발하는 스타트업 림(Rime)이 2,400만 달러(약 320억 원)의 시리즈 A 투자를 유치했습니다. 이 회사는 웹 스크래핑 대신 자체 녹음 스튜디오에서 수집한 실제 대화 데이터로 모델을 학습시켜, 산업별 전문 용어의 발음을 정확하게 구현하며 고객의 재학습 부담을 줄이는 것이 특징입니다. 지연 시간 단축과 자연스러운 대화 흐름을 위해 STT-Speech-to-Text, TTS-Text-to-Speech를 거치는 기존 방식을 넘어 통합형 Speech-to-Speech 모델로 전환하며 기업 고객들의 통화 체류 시간을 크게 늘리고 있습니다.

음성 AI 시리즈 A Rime
TC
TechCrunch AI • 73일 전
IMP 7

힌지 창립자, AI 오디오 데이트 서비스 '오버톤' 위해 180억 원 투자 유치

데이팅 앱 힌지(Hinge)의 창립자 저스틴 맥로드가 AI 기반의 새로운 오디오 중심 데이팅 서비스 '오버톤(Overtone)'을 위해 180억 원(1800만 달러)의 시드 투자를 유치했습니다. 기존 데이팅 앱의 피로감과 무한 스크롤의 한계를 극복하고자 오버톤은 사용자의 목소리로 깊은 이해도를 파악하고, 관계 과학을 바탕으로 AI가 소수의 최적화된 매칭만을 큐레이션하여 중개하는 새로운 방식을 제시합니다.

AI 데이팅 오버톤 힌지
TD
The Decoder • 79일 전
IMP 9

동시에 듣고 말하는 오픈AI 'GPT-Live' 등장

OpenAI가 사람처럼 대화하며 듣고 말하는 동시 처리가 가능한 새로운 음성 모델 GPT-Live를 공개했습니다. 이 모델은 대화를 주도하는 역할만 하며, 복잡한 질문이나 검색이 필요한 작업은 백그라운드에서 GPT-5.5 모델에 위임하여 처리함으로써 기존 음성 AI의 지능적 한계를 극복했습니다. 실시간 자연스러운 대화와 최고 수준의 추론 능력을 결합함으로써 AI 음성 비서의 혁신을 이끌고 있다는 점에서 매우 중요합니다.

OpenAI 음성 AI GPT-Live
TD
The Decoder • 112일 전
IMP 8

0.4초마다 침묵과 발언을 결정하는 오픈소스 음성 AI

중국, 홍콩, 싱가포르 연구진이 대화, 번역, 전사, 일상 소리 인식을 하나로 통합한 새로운 오픈소스 음성 AI 모델을 발표했습니다. 이 모델은 오디오 스트림을 0.4초 단위로 나누어 실시간으로 청취와 발화를 병렬 처리하며, 반응 대기 시간을 최소화합니다. 결과적으로 최신 상용 모델들을 능가하는 주변 소리 탐지 및 처리 능력을 보여줍니다.

음성 AI 실시간 스트리밍 오픈소스 모델
TC
TechCrunch AI • 114일 전
IMP 7

골드만·메타 출신 창업자, 외면받는 시장을 겨냥하다

아프리카와 중동이라는 신흥 시장의 언어적, 인프라적 한계를 극복하기 위해 설립된 음성 AI 스타트업 AethexAI가 300만 달러의 시드(Pre-seed) 투자를 유치했습니다. 이 회사는 낮은 지연 시간(Latency)과 방언 처리를 위해 소규모 자체 AI 모델과 오케스트레이션(Orchestration) 레이어를 백지부터 구축하여 하루 17,000건 이상의 통화를 처리하며 빠르게 성장하고 있습니다.

음성 AI 신흥 시장 AethexAI
TC
TechCrunch AI • 129일 전
IMP 7

구글 지메일, 대화형 AI 기능으로 이메일 검색 혁신

구글이 지메일(Gmail)에 자연어로 질문하면 답변해주는 대화형 AI 기능인 'Gmail Live'를 도입했습니다. 이 기능은 이메일에 묻혀있는 항공편, 예약 번호 등의 정보를 빠르고 직관적으로 찾을 수 있게 도와줍니다. 기존 검색창을 대체하는 것이 아니라 새로운 옵션으로 추가되며, 올여름부터 구글 AI 구독자들을 대상으로 순차적으로 제공될 예정입니다.

구글 지메일 젬미나이
TC
TechCrunch AI • 129일 전
IMP 7

구글, 문서·킵·지메일에 음성 프롬프트 도입

구글이 I/O 개발자 회의에서 워크스페이스 앱(문서, 킵, 지메일)에 음성 기반 프롬프트 기능을 추가한다고 발표했습니다. 사용자는 음성으로 긴 문장을 한 번에 입력해 문서를 작성하거나, 캘린더·항공편 등의 정보를 대화형으로 검색할 수 있으며, 구글의 AI(Gemini)가 문맥을 파악해 즉시 반영합니다. 이는 최근 길고 복잡한 요청을 음성으로 처리하려는 사용자 트렌드를 반영한 것으로, 관련 시장의 경쟁이 심화될 것으로 보입니다.

구글 음성 AI 지미나이
HN
Hacker News • 130일 전
IMP 8

음성 AI, 인간이 들을 수 없는 오디오 공격에 취약해

최근 연구에 따르면 인간의 귀에는 들리지 않는 특수 주파수의 소리가 음성 AI 모델의 동작을 강제로 제어할 수 있는 것으로 나타났습니다. 이는 음성 인식 기반 시스템과 자율주행 등 실생활 AI 서비스 전반에 심각한 보안 취약점을 노출하는 사안입니다. 따라서 실무자들은 모델 설계 단계부터 이러한 숨겨진 오디오 공격(Hidden Audio Attacks)에 대한 방어 메커니즘을 강구해야 합니다.

음성 AI 보안 취약점 오디오 공격
TC
TechCrunch AI • 136일 전
IMP 8

메디케어의 새로운 AI 맞춤형 결제 모델

미국 연방 의료보험인 메디케어가 환자의 건강 결과에 따라 보상하는 10년 단위의 새로운 결제 모델을 시범 도입합니다. 이는 AI 기반의 환자 관리 시스템이 의료 현장에서 정식으로 수가를 인정받을 수 있는 최초의 제도적 장치 마련이라는 점에서 큰 의의가 있습니다. 실리콘밸리의 주목을 덜 받았던 Pair Team 같은 기업들이 이 프로그램에 참여하여 음성 AI 상담원 등을 활용해 만성질환자 및 취약계층의 건강 관리를 주도할 전망입니다.

헬스케어 AI 메디케어 결제 모델
TD
The Decoder • 136일 전
IMP 8

미라 무라티 Thinking Machines, 오픈AI 비판하며 첫 음성 AI 공개

오픈AI 전 CTO 미라 무라티가 설립한 Thinking Machines Lab이 첫 AI 모델을 공개했습니다. 이 모델은 200밀리초 단위로 오디오와 비디오, 텍스트를 동시 처리하여 기존의 딱딱한 질의응답 방식을 넘어선 자연스러운 실시간 대화를 구현합니다. 실시간 상호작용 품질 및 지연 시간 벤치마크에서 오픈AI와 구글의 최신 모델을 능가하며, 빠른 반응 속도와 깊은 추론 능력을 결합한 것이 핵심 기술적 의의입니다.

음성 AI 실시간 상호작용 오픈AI 경쟁사
TC
TechCrunch AI • 139일 전
IMP 7

인도 시장 도전하는 음성 AI 스타트업 위스프르 플로우

미국의 AI 음성 입력 스타트업 Wispr Flow(위스프르 플로우)는 복잡한 언어 환경으로 성공하기 어려운 인도 시장을 공략하고 있습니다. 힌디어와 영어가 혼합된 '힌글리시(Hinglish)' 음성 모델을 beta 테스트하고 안드로이드 버전을 출시하며 현지화에 나선 결과, 인도는 미국에 이어 두 번째로 큰 시장으로 부상했습니다. 이러한 현지 맞춤형 전략과 적극적인 마케팅을 통해 월간 사용자 성장률이 약 100%로 급증하며, 음성 AI 기술의 새로운 주요 돌파구를 보여주고 있습니다.

음성 AI 인도 시장 위스프르 플로우
TC
TechCrunch AI • 141일 전
IMP 8

오픈AI, 실시간 음성 지능 API 새 기능 공개

오픈AI가 개발자가 애플리케이션 내에서 대화, 번역, 전사 기능을 구현할 수 있도록 돕는 새로운 실시간 음성 지능 기능들을 API에 추가했습니다. 이번 업데이트에는 GPT-5 수준의 추론 능력을 갖춘 'GPT-Realtime-2', 실시간 다국어 번역을 제공하는 'GPT-Realtime-Translate', 그리고 실시간 음성-텍스트 변환 기능인 'GPT-Realtime-Whisper'가 포함되었습니다. 이러한 기능들은 고객 서비스, 교육, 미디어 등 다양한 산업군에서 활용될 전망이며, 오픈AI는 스팸 및 사기와 같은 악용을 막기 위해 강력한 가드레일도 함께 적용했습니다.

오픈AI 음성 AI Realtime API
TD
The Decoder • 141일 전
IMP 8

오픈AI 실시간 음성 모델, GPT-5 수준 추론 능력 탑재

오픈AI가 실시간 추론, 번역, 전사 기능에 특화된 3종的新 음성 모델(GPT-Realtime-2, Translate, Whisper)을 공개했습니다. 특히 핵심 모델인 GPT-Realtime-2는 기존 텍스트 모델과 비견되는 GPT-5 수준의 추론 능력과 12만 8천 토큰의 긴 문맥 처리 능력을 제공합니다. 이를 통해 개발자들은 단순한 질의응답을 넘어 도구 사용과 복잡한 문맥을 이해하는 수준 높은 실시간 음성 AI 에이전트를 구축할 수 있게 되었습니다.

음성 AI GPT-5 실시간 추론
OA
r/OpenAI • 141일 전
IMP 9

실시간 음성 앱 혁신, 세 가지 오디오 API 공개

사람이 말하는 동시에 추론, 번역, 전사가 가능한 차세대 실시간 음성 모델 3종이 API를 통해 공개되었습니다. 개발자들은 이 모델을 활용하여 단순한 대화를 넘어 실시간으로 작업을 수행하고 도구를 활용하는 지능형 음성 인터페이스를 구축할 수 있게 되었습니다.

음성 AI API 실시간 번역