텐센트 '간더', 작업 수행 중에도 대화 지속하는 AI 모델
텐센트 혼연(Hunyuan) 음성 팀이 발표한 'Gander'는 실시간 대화를 담당하는 '소뇌(cerebellum)'와 복잡한 에이전트 작업을 처리하는 교체 가능한 '뇌(brain)'를 분리해 대화 반응성과 작업 정확도를 동시에 추구하는 AI 모델입니다. 음성·이미지·텍스트를 동시에 처리하며 사용자가 언제든 끼어들 수 있고, 타이밍 벤치마크에서 상용 모델(GPT-Realtime, Gemini Live 등)보다 사용자를 덜 방해했지만 작업 정확도는 다소 뒤처지는 것으로 나타났습니다. 팀은 모델 가중치와 학습 데이터 공개를 계획 중이며 코드용 GitHub 저장소도 이미 마련되어 있습니다.
텐센트의 연구 모델 Gander는 실시간 대화와 AI 에이전트 기능을 결합합니다. '소뇌(cerebellum)'가 대화를 담당하고, 교체 가능한 '뇌(brain)'가 복잡한 작업을 수행합니다. 사용자는 언제든 끼어들 수 있지만, 테스트 결과 대화 타이밍과 작업 정확도 사이의 트레이드오프가 있는 것으로 나타났습니다.
텐센트 혼연(Hunyuan) 음성 팀과 여러 대학의 연구자들은 말하고, 보고, 작업하는 것을 동시에 할 수 있는 AI 모델 'Gander'를 소개했습니다. 기술 보고서에 따르면 Gander는 음성, 이미지, 텍스트를 동시에 처리하며 실시간 대화를 유지하고, 에이전트로서 더 복잡한 작업도 수행합니다.
연구자들은 현재의 음성 비서가 대부분 사용자와 순서를 번갈아 가며 대화한다고 지적합니다. 사용자가 말하면 모델이 응답하고, 다시 사용자 차례가 되는 식입니다. 반면 사람들은 서로 끼어들고 짧게 피드백을 주며, 상대가 말하는 동안 듣기도 합니다. Gander는 이런 교환을 더 자연스럽게 만들기 위해 비디오, 음성, 텍스트를 지속적으로 입력받습니다. 사용자는 언제든 끼어들 수 있고, 모델은 스스로 후속 질문을 던지거나 진행 상황을 보고할 수 있습니다.
대화와 추론을 분리해 대화 반응성 유지
연구자들은 인체 해부학에서 빌려온 '소뇌'와 '뇌'라는 두 역할로 모델을 나눴습니다. 소뇌는 실시간 대화를 처리하고, 뇌는 추론과 파일 검색이나 코드 작성 같은 까다로운 작업을 맡습니다.
이러한 분리는 트레이드오프를 해결하기 위한 것입니다. 대화에는 빠른 응답이 필요하지만 복잡한 작업에는 계획에 시간이 걸립니다. 연구자들은 단일 모델은 필연적으로 속도와 추론 능력 사이에서 균형을 잡아야 한다고 주장합니다.
Codex나 Claude Code 같은 기존 에이전트 시스템처럼, 대화 모델을 재학습하지 않고도 '뇌'를 교체할 수 있습니다. 테스트에서는 OpenAI의 GPT-5.6 계열의 특정 모델이 뇌 역할을 수행했습니다. 기반 모델이 개선되면 시스템 전체가 직접 그 혜택을 받습니다.
타이밍은 정확하지만 작업 정확도는 뒤처져
소뇌의 반응성을 유지하기 위해 Gander는 대화를 1초 단위로 나눕니다. 매초 모델은 듣기, 말하기, 말하기 중단(예: 사용자가 끼어들 때) 중 하나를 결정합니다. 덕분에 별도의 음성 시작·종료 감지 모듈 없이도 적절한 순간에 응답할 수 있습니다. 메모리는 대략 최근 2분간의 대화를 담습니다.
아직 이런 모델을 위한 전용 테스트가 없어 연구자들은 기존 벤치마크를 사용했습니다. 보고서에 따르면 Gander는 다양한 작업 시나리오에서 음성 비서를 평가하는 Full-Duplex-Bench v3에서 가장 우수한 타이밍을 기록했습니다.
100개 시나리오 모두에서 정확한 순간에 말을 시작했으며, 사용자를 방해하는 비율은 8%였습니다. 이는 GPT-Realtime의 13.5%, 가장 약한 경쟁 모델의 거의 48%와 비교된 수치입니다. 보고서는 Gander가 GPT-Realtime, Gemini Live, Grok 같은 상용 시스템들과 경쟁하며 이런 결과를 상대적으로 작은 모델로 달성했다고 밝혔습니다.
다만 작업 정확도 단독으로는 Gander가 다소 뒤처집니다. 연구자들은 이러한 결과가 테스트가 음성 응답을 포함한 시스템 전체를 채점하기 때문이라고 부분적으로 분석했습니다. 음성 출력과 음성 인식에서의 오류도 점수에 반영됩니다.