메뉴

#음성 에이전트

HN
Hacker News • 15일 전
IMP 8

OpenAI, GPT-Live-1 API 공개

OpenAI가 ChatGPT에 먼저 도입됐던 전이중(Full-Duplex) 음성 대화 모델 GPT-Live-1을 API로 개방했습니다. STT-LLM-TTS를 연결하는 기존 구조와 달리 하나의 모델로 듣고 말하는 것을 동시에 처리해 지연 시간을 줄이고 끊김 없는 자연스러운 대화가 가능합니다. 개발자는 시스템 프롬프트로 톤과 말하기 속도를 조절하고, 깊은 추론은 GPT-6 Astra 등 백엔드 모델에 위임하며, 전화 상담 등 실무 음성 에이전트 구축에 활용할 수 있습니다.

음성 AI OpenAI API
MP
MarkTechPost • 26일 전
IMP 6

음성·실시간 에이전트용 최저 지연 추론 API 벤치마크

음성 에이전트는 지능 문제보다 지연(latency) 문제로 먼저 실패한다는 관점에서, 첫 토큰까지의 시간(TTFT)을 핵심 지표로 삼아 LLM, STT, TTS, 음성-음성(S2S) 등 음성 스택 전 계층의 추론 API를 비교한 벤치마크입니다. 각 수치는 2026년 8월 30일 기준 1차 소스로 검증되었으며, 독립 측정·벤더 공개·벤더 자체 측정 여부가 명시되어 있어 추론 API를 선택하는 실무자에게 유용한 자료입니다.

음성 에이전트 벤치마크 지연 시간
HN
Hacker News • 43일 전
IMP 6

LLM 꼬리 지연시간의 간단한 해결책

실시간 음성 에이전트에서 LLM 응답이 가끔 10~20초씩 느려지는 문제를, 비싼 우선 처리 티어(priority tier) 대신 각 요청을 두 번 보내고 빠른 응답을 취하는 방식으로 해결한 사례다. 실측 결과 이 방법은 우선 티어보다 최악의 응답 완료 시간을 9.8초에서 3.5초로 줄이며, 동일한 비용으로 더 나은 지연시간을 제공한다. 느린 응답이 드물고 독립적일 때 특히 효과적이다.

LLM 지연시간 음성 에이전트 실시간 처리