메뉴
BL
MarkTechPost 34일 전

바이두, 장문서 처리에 최적화된 30억 매개변수 OCR 모델 공개

IMP
8/10
핵심 요약

바이두가 단 한 번의 순전파로 수십 페이지 문서를 파싱할 수 있는 30억 매개변수 MoE 구조의 오픈소스 OCR 모델을 공개했습니다. 핵심 기술인 참조 슬라이딩 윈도우 어텐션(R-SWA)이 KV 캐시를 일정하게 유지하여, 출력이 길어져도 메모리와 지연 시간이 증가하지 않는 획기적인 장점이 있습니다. 성능 면에서도 기존 DeepSeek OCR 대비 6.22포인트가 높은 93.23점을 기록하며 장문서 처리 분야의 큰 기술적 진전을 보여줍니다.

번역된 본문

바이두는 단 한 번의 순전파(Forward Pass)로 수십 페이지에 달하는 문서를 파싱할 수 있는 30억(3B) 매개변수 규모의 전문가 혼합(MoE) 모델인 '무제한 OCR(Unlimited OCR)'을 오픈소스로 공개했습니다. 이 모델의 핵심인 참조 슬라이딩 윈도우 어텐션(Reference Sliding Window Attention, R-SWA) 기술은 KV 캐시(KV Cache) 크기를 일정하게 유지해 주므로, 출력이 길어지더라도 메모리 사용량과 지연 시간(Latency)이 그대로 유지됩니다. 이 모델은 MIT 라이선스로 배포되었으며, OmniDocBench v1.5 벤치마크에서 93.23점을 기록해 DeepSeek OCR 베이스라인을 6.22포인트 차이로 뛰어넘었습니다.

이 글 '바이두, 장문서 파싱을 위해 KV 캐시를 일정하게 유지하는 30억 매개변수 모델 무제한 OCR 공개'는 MarkTechPost에 처음 게재되었습니다.

원문 보기
원문 보기 (영어)
Baidu open-sourced Unlimited OCR, a 3B-parameter MoE model that parses dozens of document pages in a single forward pass. Its Reference Sliding Window Attention (R-SWA) holds the KV cache constant, so memory and latency stay flat as output grows. It scores 93.23 on OmniDocBench v1.5, beating the DeepSeek OCR baseline by 6.22 points, under an MIT license. The post Baidu Releases Unlimited OCR, a 3B Model That Keeps the KV Cache Flat for Long-Document Parsing appeared first on MarkTechPost.