메뉴

#실시간 대화

MP
MarkTechPost • 10일 전
IMP 8

구글, 프로덕션급 음성 에이전트용 '제미나이 3.8 라이브' 공개

구글이 실시간 대화 모델 최신버전인 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 출시했습니다. 두 모델은 대화가 이어지는 동안 백그라운드에서 도구·API 호출을 실행하고, 실시간 영상 입력을 처리하며, 대화 중 97개 언어 간 전환이 가능합니다. Extended Thinking은 Artificial Analysis 음성-음성 품질 지수에서 82.6점으로 1위를 차지했으며, 분당 0.005달러의 오디오 입력 요금으로 Gemini API와 Google AI Studio에서 즉시 사용할 수 있습니다.

구글 제미나이 음성 AI
HN
Hacker News • 10일 전
IMP 8

구글, 젬미니 3.8 라이브 및 확장 사고 모델 공개

구글이 음성 대화 특화 AI 모델인 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 공개했습니다. 두 모델은 실시간 시각 맥락 이해, 병렬 추론, 대화 중단 없는 백그라운드 작업 처리를 지원하며, Artificial Analysis 음성-음성 품질 지수에서 1위(82.6점)를 차지했습니다. Gemini API, 구글 워크스페이스, 젬미니 앱에서 즉시 사용할 수 있습니다.

Gemini 음성 AI 구글
HN
Hacker News • 15일 전
IMP 8

OpenAI, GPT-Live-1 API 공개

OpenAI가 ChatGPT에 먼저 도입됐던 전이중(Full-Duplex) 음성 대화 모델 GPT-Live-1을 API로 개방했습니다. STT-LLM-TTS를 연결하는 기존 구조와 달리 하나의 모델로 듣고 말하는 것을 동시에 처리해 지연 시간을 줄이고 끊김 없는 자연스러운 대화가 가능합니다. 개발자는 시스템 프롬프트로 톤과 말하기 속도를 조절하고, 깊은 추론은 GPT-6 Astra 등 백엔드 모델에 위임하며, 전화 상담 등 실무 음성 에이전트 구축에 활용할 수 있습니다.

음성 AI OpenAI API
TD
The Decoder • 15일 전
IMP 8

OpenAI, 동시에 듣고 말하는 GPT-Live-1 API 공개

OpenAI가 음성 모델 GPT-Live-1을 API로 개방했습니다. 이 모델은 '풀듀플렉스(full-duplex)' 방식으로 말을 하면서 동시에 들을 수 있어, 개발자가 자연스러운 실시간 음성 앱을 만들 수 있습니다. 분당 0.05달러로 저렴하지는 않지만, 벤치마크에서 이전 모델을 크게 앞서며 Yelp 등이 이미 전화 예약 서비스에 적용했습니다.

OpenAI 음성 AI API