구글 리서치, R4T 공개—쿼리 팬아웃 12~20배 빠른 확산 검색기
구글 리서치가 일관성 있고 다양한 검색 결과를 반환하는 'Retrieve-for-Train (R4T)' 프레임워크를 발표했습니다. 강화학습으로 팬아웃 언어모델을 한 번 학습시켜 이를 5,390만 파라미터 확산(Diffusion) 검색기의 학습 데이터 합성에 활용하며, 자기회귀 방식 대비 12~20배 빠릅니다. 코드와 모델 가중치는 아직 공개되지 않았습니다.
구글 리서치가 일관성 있고 다양한 검색 결과를 반환하는 'Retrieve-for-Train (R4T)' 프레임워크를 발표했습니다. 강화학습으로 팬아웃 언어모델을 한 번 학습시켜 이를 5,390만 파라미터 확산(Diffusion) 검색기의 학습 데이터 합성에 활용하며, 자기회귀 방식 대비 12~20배 빠릅니다. 코드와 모델 가중치는 아직 공개되지 않았습니다.
HHMI 재넬리아 연구소와 구글 리서치가 수컷 초파리의 중추신경계 전체(약 16만 6천 개 뉴런)를 매핑한 커넥톰 'MaleCNS v1.0'을 공개했습니다. 온라인 커뮤니티에서는 이 디지털 뇌에 마인크래프트·둠 등 게임, 비트코인 거래 등 다양한 과제를 시키는 실험이 화제가 되고 있으며, 과학계에서는 성별 간 신경 회로 비교 등 신경과학 연구의 중요한 자원으로 주목받고 있습니다.
구글 리서치와 UNSW 시드니가 연속혈당측정(CGM) 데이터를 생리학적 느린 스트림과 일시적 이벤트 스트림으로 분리해 학습하는 자기지도 파운데이션 모델 '글루코FM(GlucoFM)'을 발표했습니다. 단 0.72M 파라미터로 135M 규모 GluFormer와 385M 규모 MOMENT를 성능에서 능가했으며, 아직 규제 승인 없는 연구 프로토타입 단계입니다.
구글 리서치가 텍스트 기반 POI 임베딩에 집계된 사람들의 이동 데이터를 결합하는 ME-POIs 프레임워크를 발표했습니다. 기존 언어 모델은 장소가 '무엇인지'는 설명하지만 '어떻게 사용되는지'는 놓치는데, ME-POIs는 각 방문을 맥락화된 벡터로 인코딩하고 대조 학습으로 POI별 학습 가능한 프로토타입과 정렬한 뒤, 데이터가 풍부한 앵커에서 롱테일로 방문 분포를 세 개 공간 규모에 걸쳐 전이합니다. LA와 휴스턴 이동 데이터 기반 5개 지도 보강 작업에서 35개 모델-과제 조합 중 34개가 향상되었으며, 방문 의도 예측에서 최대 81.9% 상대적 F1 향상, 혼잡도 예측에서 24.7% MAE 감소를 기록했습니다.
구글 리서치는 500만 명 이상의 방대한 웨어러블 기기 데이터를 사전 학습한 파운데이션 모델 'SensorFM'을 공개했습니다. 이 단일 모델은 수면, 심혈관 및 대사 건강 등 총 35개의 건강/행동 예측 작업 중 34개에서 기존 특화 모델들을 능가하는 성능을 입증했습니다. 이는 파편화된 기존 웨어러블 건강 기능을 통합하고, 막대한 라벨링 비용 없이도 개인화된 AI 건강 비서 구현의 핵심 기반이 될 수 있어 매우 중요합니다.
구글 리서치가 자연어를 실행 가능한 SQL 쿼리로 변환하는 새로운 시스템인 '제미나이-SQL2(Gemini-SQL2)'를 공개했습니다. 이 모델은 자연어를 SQL로 변환하는 정확도를 측정하는 BIRD 벤치마크에서 80.04%의 실행 정확도를 기록하며 오픈AI, 앤스로픽 등 경쟁사들을 큰 차이로 제치고 압도적인 1위를 차지했습니다. 자연어 기반의 복잡한 데이터베이스 쿼리 생성 기술이 상용화 단계에 근접하고 있음을 보여주는 중요한 성과입니다.
구글과 로체스터 공과대학의 공동 연구에 따르면, AI 벤치마크에서 주로 사용하는 항목당 3~5명의 인간 평가자 수는 신뢰할 수 있는 결과를 도출하기에 부족합니다. 신뢰성 있는 평가를 위해서는 항목당 최소 10명 이상의 평가자가 필요하며, 전체 예산을 테스트 항목 수와 평가자 수에 맞게 전략적으로 분배하는 것이 필수적입니다.