OpenAI, GPT-Live-1 API 공개
OpenAI가 ChatGPT에 먼저 도입됐던 전이중(Full-Duplex) 음성 대화 모델 GPT-Live-1을 API로 개방했습니다. STT-LLM-TTS를 연결하는 기존 구조와 달리 하나의 모델로 듣고 말하는 것을 동시에 처리해 지연 시간을 줄이고 끊김 없는 자연스러운 대화가 가능합니다. 개발자는 시스템 프롬프트로 톤과 말하기 속도를 조절하고, 깊은 추론은 GPT-6 Astra 등 백엔드 모델에 위임하며, 전화 상담 등 실무 음성 에이전트 구축에 활용할 수 있습니다.
2026년 9월 10일 제품 출시
API의 GPT-Live-1로 더 자연스러운 음성 경험 구축하기
GPT-Live-1은 ChatGPT의 자연스러운 전이중(Full-Duplex) 대화를 API로 가져오며, 음성 에이전트가 말하고 행동하는 방식을 더 세밀하게 제어할 수 있게 합니다.
우리는 GPT-Live-1을 API로 출시하며, 개발자에게 음성 지원 앱과 비즈니스 워크플로우를 구축할 수 있는 강력하고 자연스러운 음성 모델을 제공합니다. ChatGPT에서 처음 선보인 GPT-Live-1은 듣고 말하는 것을 동시에 할 수 있으며, Codex와 ChatGPT Work에서 볼 수 있듯이 함께 연동되는 모델과 도구에 더 깊은 추론과 작업을 위임할 수 있습니다.
GPT-Live-1의 API 출시에서는 개발자가 자신의 사용자, 워크플로우, 목표에 맞게 음성 경험을 조정하고 커스터마이징할 수 있는 새로운 기능에 집중했습니다. GPT-Live-1의 핵심 강점인 매끄러운 인터럽션(끼어들기) 처리는 이미 비즈니스 성과를 내고 있습니다. 초기 평가에서 Speak는 GPT-Live-1이 언어 학습 튜터가 응답하기 전에 학습자에게 더 많은 생각할 시간을 주었으며, 기존 턴 기반 시스템 대비 인터럽션을 거의 80% 줄였다는 것을 발견했습니다.
API에서 GPT-Live-1의 주요 강점:
- 인터럽션 처리: 하나의 모델이 입력·출력 오디오를 함께 추론하여 인터럽션 처리를 개선함으로써, STT–LLM–TTS를 연결하는 아키텍처의 지연 시간과 취약한 전환 문제를 해결합니다.
- 추론 및 도구 호출 위임: GPT-Live-1은 추론과 도구 호출을 GPT-6 Astra 같은 백엔드 텍스트 모델이나 서드파티 모델에 위임할 수 있습니다.
- 톤, 속도, 스타일: 시스템 프롬프트를 통해 에이전트의 톤, 말하기 속도, 대화 스타일을 조정할 수 있습니다.
- 조용한 컨텍스트 관리 및 배경 소음: 대화를 중단하거나 모든 단계를 소리 내어 설명하지 않고도 배경 소음과 침묵을 더 잘 처리합니다.
- 긴 세션 안정성: 장기간 상호작용에서 컨텍스트 유지력과 대화 품질을 개선했습니다.
- 전화(Telephony) 지원: 레스토랑 예약부터 고객 지원까지, 전화 통화를 위한 전이중 음성 에이전트 배포를 가능하게 합니다.
GPT-Live-1 체험해보기
세션을 시작하고 자연스럽게 말해보세요. 끼어들고, 웃고, 마음을 바꿔보세요. 집에서 또는 커피숍이나 도시 거리처럼 시끄러운 곳에서 시도해보세요.
무엇을 할 수 있는지 확인해보세요:
- 자연스럽게 말을 겹쳐보세요. 도움을 요청한 뒤, 응답 중간에 끼어들어 질문을 바꾸거나 세부 사항을 추가해보세요.
- 들고 다녀보세요. 야외를 걸으면서나 일상적인 배경 소음 속에서 대화를 시도해보고, 대화가 잘 유지되는지 확인해보세요.
- 장난스럽게 해보세요. 웃고, 머뭇거리고, 짧게 맞장구를 치거나, 잠시 옆 사람과 말한 뒤 대화를 이어가보세요.
이 데모는 시간 제한이 있습니다. 사용 시 OpenAI 이용약관에 동의하며 개인정보처리방침을 인지하는 것으로 간주됩니다.
음성 에이전트 아키텍처 단순화하고 음성 지연 시간 줄이기
전통적인 음성 에이전트는 음성-투-텍스트(STT), 추론 모델, 텍스트-투-음성(TTS)을 연결해서 만듭니다. 각 전환 단계마다 지연이 추가되고, 타이밍·컨텍스트·대화의 자연스러운 리듬을 잃을 기회가 늘어납니다. 누군가 끼어들거나, 멈추거나, 방향을 바꿀 때 무슨 일이 일어나는지 조율하는 것은 결국 개발자의 몫이 되곤 했습니다.
GPT-Live-1은 하나의 모델로 듣기와 말하기를 처리하여 음성 계층을 단순화합니다. 인터럽션과 맞장구에 실시간으로 반응하는 동시에, 더 깊은 추론은 백엔드에 위임할 수 있습니다. 이를 통해 백그라운드에서 작업이 진행되는 동안에도 대화를 계속 이어갈 수 있습니다.
개발자는 대화 뒤에 있는 모델, 도구, 에이전트 하니스를 직접 선택합니다. 예를 들어 일정 관리나 주문 업데이트 같은 대량 처리 작업에는 Luna 같은 모델을 GPT-Live-1과 연결하고, 추론이 필요한 복잡한 고객 문제에는 Astra 같은 모델을 사용할 수 있습니다. 이러한 유연성 덕분에 개발자는 각 작업에 맞게 추론 깊이, 속도, 비용을 조정할 수 있습니다.
GPT-Live-1은 네이티브로 ASR 전사文本와 응답 텍스트를 제공합니다. 또한 강력한 영숫자 이해 능력을 갖추고 있으며 키워드 바이어싱(Keyword Biasing)을 지원합니다. GPT-Live-1은 턴 기반 모델은 아니지만, 턴 감지(Turn Detection)를 네이티브로 지원하므로 개발자는 기존 방식을 계속 사용할 수 있습니다.
원문 보기 (영어)
OpenAI, AI 개발 공동 속도 조절 검토…의회에 합법성 문의
OpenAI가 다른 AI 기업들과 협의해 AI 개발 속도를 늦추는 것이 셔먼 반독점법에 위반되지 않는지 의회에 문의했습니다. 최고과학자 야쿠브 파초츠키는 공동 안전 기준이 마련될 때까지 업계 전반의 개발 속도 조절을 촉구했으며, 이는 OpenAI 에이전트의 해킹 사고 등 일련의 안전 사건이 계기가 되었습니다.
OpenAI, 에이전트 API 공개 베타 출시
OpenAI가 Codex와 ChatGPT를 구동하는 것과 동일한 인프라를 개발자에게 제공하는 Agents API를 공개 베타로 출시했습니다. 이 API로 개발자는 수 시간 동안 실행되고 코드 실행과 파일 처리가 가능한 클라우드 기반 에이전트를 구축할 수 있으며, 자동 컨텍스트 관리, 병렬 도구 사용, 하위 에이전트 작업 위임 등이 주요 기능입니다. 추가 요금 없이 토큰 사용량 기준으로만 과금되며, 오픈소스 Codex 하네스 기반에 MCP와 웹 검색 등 내장 도구를 지원합니다.