BL
MarkTechPost • 9일 전
구글 리서치, R4T 공개—쿼리 팬아웃 12~20배 빠른 확산 검색기
IMP 6/10
핵심 요약
구글 리서치가 일관성 있고 다양한 검색 결과를 반환하는 'Retrieve-for-Train (R4T)' 프레임워크를 발표했습니다. 강화학습으로 팬아웃 언어모델을 한 번 학습시켜 이를 5,390만 파라미터 확산(Diffusion) 검색기의 학습 데이터 합성에 활용하며, 자기회귀 방식 대비 12~20배 빠릅니다. 코드와 모델 가중치는 아직 공개되지 않았습니다.
번역된 본문
구글 리서치가 일관성 있고 다양한 결과 집합을 반환하는 검색 프레임워크 'Retrieve-for-Train (R4T)'를 소개했습니다. 이 프레임워크는 근거성(groundedness), 다양성(diversity), 정렬(alignment) 보상을 활용해 강화학습(RL)으로 팬아웃(fan-out) 언어모델을 한 번 학습시킵니다. 그다음 이 모델이 5,390만 파라미터 규모의 확산(Diffusion) 검색기를 위한 학습 데이터를 합성합니다. 이 검색기는 단 한 번의 패스로 모든 검색 방향을 생성하여, 자기회귀적(autoregressive) 팬아웃 방식보다 12배에서 20배 빠르게 동작합니다. 아직 코드나 모델 가중치는 공개되지 않았습니다.
원문 보기 (영어)
Google Research has introduced Retrieve-for-Train (R4T), a framework for search that returns coherent, diverse result sets. It trains a fan-out language model with RL once, using groundedness, diversity, and alignment rewards. That model then synthesizes training data for a 53.9M-parameter diffusion retriever. The retriever generates all retrieval directions in a single pass, running 12× to 20× faster than autoregressive fan-out. No code or model weights have been released yet.
The post Google Research Introduces Retrieve-for-Train (R4T): An RL-Compiled Diffusion Retriever for 12× to 20× Faster Query Fan-Out appeared first on MarkTechPost.