메뉴

#OCR

MP
MarkTechPost 4일 전
IMP 8

Datalab Marker v2 벤치마크 비교 분석

Datalab이 'Marker' 버전 2를 3단계 파이프라인으로 재설계하여 공개했습니다. 단일 B200 GPU에서 초당 2.9페이지를 처리하는 압도적인 속도와 76.0의 높은 정확도를 기록하며 Docling과 MinerU 등 기존 경쟁 모델들을 정확도와 속도 양면에서 모두 능가했습니다. PDF 등 문서 파싱 및 데이터 추출 작업을 수행하는 실무자들에게 Marker v2가 현재 가장 강력한 선택지가 될 수 있음을 시사합니다.

문서 파싱 OCR 벤치마크
MP
MarkTechPost 5일 전
IMP 6

바이두 무제한 OCR로 구축하는 엔드투엔드 문서 파싱 파이프라인

이 튜토리얼은 바이두의 무제한 OCR(Unlimited-OCR) 모델을 활용하여 고해상도 이미지와 다중 페이지 PDF를 처리하는 완벽한 엔드투엔드 파이프라인 구축 방법을 다룹니다. GPU 환경 설정부터 고해상도 추론 모드와 빠른 Base 모드의 성능 비교를 통해 복잡한 레이아웃, 표, 여러 페이지에 걸친 콘텐츠를 효율적으로 처리하는 실무적인 접근법을 제공합니다.

OCR 문서-파싱 바이두
TD
The Decoder 23일 전
IMP 8

바이두, '무제한 OCR' 공개... 텍스트 길이와 무관하게 메모리 일정 유지

바이두 연구진이 인간의 망각 원리를 차용한 새로운 어텐션 메커니즘(R-SWA)을 적용하여, 한 번의 추론으로도 수십 페이지의 문서를 처리할 수 있는 '무제한 OCR(Unlimited OCR)' 모델을 개발했습니다. 기존 모델들의 가장 큰 병목이었던 KV 캐시 메모리 문제를 해결하여, 처리 속도와 메모리 사용량을 일정하게 유지하면서도 문서 인식 정확도 벤치마크에서 최고 수준의 성능을 기록했습니다.

OCR 바이두 인공지능 모델
MP
MarkTechPost 34일 전
IMP 8

바이두, 장문서 처리에 최적화된 30억 매개변수 OCR 모델 공개

바이두가 단 한 번의 순전파로 수십 페이지 문서를 파싱할 수 있는 30억 매개변수 MoE 구조의 오픈소스 OCR 모델을 공개했습니다. 핵심 기술인 참조 슬라이딩 윈도우 어텐션(R-SWA)이 KV 캐시를 일정하게 유지하여, 출력이 길어져도 메모리와 지연 시간이 증가하지 않는 획기적인 장점이 있습니다. 성능 면에서도 기존 DeepSeek OCR 대비 6.22포인트가 높은 93.23점을 기록하며 장문서 처리 분야의 큰 기술적 진전을 보여줍니다.

OCR 바이두 오픈소스
TD
The Decoder 35일 전
IMP 8

미스트랄, 경쟁사 제친 신규 OCR 모델 'OCR 4' 공개

미스트랄 AI가 문서 내 텍스트, 표, 수식 등의 요소와 레이아웃을 정확하게 분석하는 새로운 OCR 모델 'OCR 4'를 출시했습니다. 600개 이상의 문서로 진행된 블라인드 테스트에서 72%의 압도적인 승률로 경쟁 모델들을 제쳤으며, 170개 국어를 지원해 글로벌 문서 처리 작업에 매우 유용합니다.

미스트랄 OCR 문서분석
MP
MarkTechPost 35일 전
IMP 8

미스트랄 OCR 4, RAG 및 에이전트 검색을 위한 구조화된 출력 지원

미스트랄 AI가 단순 텍스트 추출을 넘어 바운딩 박스, 타입 분류, 단어별 신뢰도 점수를 제공하는 구조화된 문서 출력이 가능한 'OCR 4'를 공개했습니다. 이 모델은 170개 언어를 지원하며 단일 자체 호스팅 컨테이너로 구동되어, RAG 및 에이전트 파이프라인에 즉시 인용 가능한 출처 정보를 원활하게 공급할 수 있다는 점에서 실무자들에게 매우 유용합니다.

OCR Mistral AI RAG
HN
Hacker News 78일 전
IMP 8

인터페이즈: 대규모 정밀 작업 특화 신규 AI 모델

인터페이즈(Interfaze)는 트랜스포머 모델의 유연성과 DNN/CNN 모델의 높은 정확도를 결합하여 OCR, 비전, 음성 인식, 구조화된 출력 등의 작업에서 최적화된 성능을 제공하는 새로운 아키텍처입니다. 이 모델은 Gemini-3-Flash, Claude-Sonnet-4.6, GPT-5.4-Mini 등과 비교하여 9개 벤치마크에서 대부분 우수한 성능을 보여주었으며, 특히 처리 비용과 응답 시간을 획기적으로 낮추면서도 높은 정확도를 유지하는 것이 특징입니다.

새로운 아키텍처 OCR 비전 모델
LL
r/LocalLLaMA 97일 전
IMP 7

Rust 기반 로컬 만화 번역기, LLM 내장

오픈소스 로컬 만화 번역기 'Koharu'가 공개되었습니다. llama.cpp를 통합해 시각적 LLM OCR과 객체 탐지, 인페인팅을 결합한 고성능 파이프라인을 제공합니다. 번역 결과를 폰트와 색상 등 미세 조정할 수 있는 내장 에디터도 포함되어 있어 실무 번역 작업에 즉시 활용할 수 있다는 점이 중요합니다.

오픈소스 만화 번역 시각 LLM