바이트댄스, 실시간 시청·청취·대화 가능한 통합 멀티모달 AI 공개
바이트댄스의 Seed 팀은 시각, 청각, 텍스트를 하나로 통합한 네이티브 오디오-비주얼 풀듀플렉스 대형 언어 모델(LLM)인 'SeedRealtime'을 공개했습니다. 이 모델은 한 번씩 주고받는 기존 방식을 넘어, 연속적인 멀티모달 스트림을 통해 실시간으로 상호작용할 수 있어 완벽한 옴니모달(Omni-modal) 인터랙션 구현에 한 걸음 다가섰다는 점에서 중요합니다.
바이트댄스의 Seed 팀은 시각, 청각, 텍스트를 하나로 통합한 네이티브 오디오-비주얼 풀듀플렉스 대형 언어 모델(LLM)인 'SeedRealtime'을 공개했습니다. 이 모델은 한 번씩 주고받는 기존 방식을 넘어, 연속적인 멀티모달 스트림을 통해 실시간으로 상호작용할 수 있어 완벽한 옴니모달(Omni-modal) 인터랙션 구현에 한 걸음 다가섰다는 점에서 중요합니다.
여러 사람이 동시에 말하는 환경에서 우리가 주의를 전환할 때, 뇌가 이전 화자와 새 화자의 음성을 일시적으로 동시에 처리한다는 사실이 뇌파(EEG) 기록을 통해 밝혀졌습니다. 연구진은 주의 전환 시 알파파(alpha wave) 감소를 통해 인지적 노력이 증가함을 확인했고, 대형 언어 모델(LLM)을 활용해 청각적 주의 전환 후 어휘 맥락이 초기화되는 시의적 메커니즘을 규명했습니다. 이는 복잡한 청취 환경 속에서 뇌가 어떻게 유연하게 음성 정보를 처리하는지 이해하는 데 중요한 기초 자료가 됩니다.
최신 연구에 따르면, 코드를 작성하는 AI 에이전트는 코드를 실제로 수정하기 전에도 머릿속(모델 내부)으로 최대 25단계 앞의 코드 변화와 테스트 성공 여부를 미리 예측하고 계획하는 것으로 나타났습니다. 이는 AI가 단순한 반복 실행이 아닌, 인간과 유사한 '미래 지향적 사고'를 내부적으로 수행하고 있음을 증명하는 중요한 발견입니다.
기존에는 텍스트로 CAD 모델을 생성하는 작업과 이를 수정(편집)하는 작업이 분리되어 있어 실용성이 떨어졌습니다. 이 논문은 대형 언어 모델(LLM)을 활용해 모델의 생성과 편집을 하나로 통합한 'PR-CAD' 프레임워크를 제안합니다. 강화학습 기반의 에이전트를 통해 사용자의 의도를 파악하고 정밀하게 설계를 수정하여, 기존 대비 월등한 수준의 제어력과 정확도를 달성하며 CAD 모델링의 효율을 크게 높였습니다.