메뉴
BL
MarkTechPost • 7일 전

Jina AI, 저사양 GPU용 3.4B MoE 문서 파서 'jina-ocr-v1' 공개

IMP
6/10
핵심 요약

Jina AI가 PDF, 스캔본, 표, 차트, 인보이스를 Markdown으로 변환하는 시각 문서 파서 jina-ocr-v1을 공개했습니다. 총 3.4B 파라미터의 MoE 구조로 토큰당 약 570M만 활성화되고, 내장 FastMTP 스페큘러티브 디코딩으로 손실 없이 추론 속도를 높여 저사양 GPU에서도 효율적으로 동작합니다. 가중치는 CC BY-NC 4.0 라이선스로 Hugging Face에 공개되었습니다.

번역된 본문

Jina AI가 PDF, 스캔본, 표, 차트, 인보이스를 Markdown으로 변환하는 시각 문서 파서 jina-ocr-v1을 공개했다. 이 모델은 총 3.4B 파라미터 규모이며 토큰당 약 570M만 활성화되는 MoE(Mixture of Experts) 구조로, DeepSeek-OCR을 기반으로 한다. 내장된 FastMTP 스페큘러티브 디코딩 헤드가 한 단계당 3개의 토큰을 초안으로 생성하면서도 출력은 무손실로 유지한다. OmniDocBench v1.6에서 91.14점, olmOCR-Bench에서 83.4점을 기록했으며, A100 1대에서 초당 2.57페이지를 파싱한다. 가중치는 CC BY-NC 4.0 라이선스로 Hugging Face에서 제공되며, Jina Reader를 통해 호스팅 접근도 가능하다.

원문 보기
원문 보기 (영어)
Jina AI has released jina-ocr-v1, a visual document parser that converts PDFs, scans, tables, charts and invoices into Markdown. The model has 3.4B total parameters, with about 570M active per token, and builds on DeepSeek-OCR. A built-in FastMTP speculative decoding head drafts 3 tokens per step while keeping output lossless. It scores 91.14 on OmniDocBench v1.6 and 83.4 on olmOCR-Bench, and parses 2.57 pages per second on 1 A100. Weights are on Hugging Face under CC BY-NC 4.0, with hosted access through Jina Reader. The post Jina AI Releases jina-ocr-v1: A 3.4B MoE Document Parser With Built-In Speculative Decoding for Low-Budget GPUs appeared first on MarkTechPost.