메뉴

#OCR

MP
MarkTechPost • 7일 전
IMP 6

Jina AI, 저사양 GPU용 3.4B MoE 문서 파서 'jina-ocr-v1' 공개

Jina AI가 PDF, 스캔본, 표, 차트, 인보이스를 Markdown으로 변환하는 시각 문서 파서 jina-ocr-v1을 공개했습니다. 총 3.4B 파라미터의 MoE 구조로 토큰당 약 570M만 활성화되고, 내장 FastMTP 스페큘러티브 디코딩으로 손실 없이 추론 속도를 높여 저사양 GPU에서도 효율적으로 동작합니다. 가중치는 CC BY-NC 4.0 라이선스로 Hugging Face에 공개되었습니다.

OCR 문서 파싱 MoE
MP
MarkTechPost • 16일 전
IMP 6

랜딩AI, DPT-3 Pro·Verity 탑재한 문서 추출 2세대 출시

LandingAI가 문서 처리 스택을 DPT-3 모델 family 기반으로 재구축한 'Agentic Document Extraction 2세대(Generation 2)'를 출시했습니다. 기존 청크(chunk) 방식을 폐지하고 문서-페이지-블록 트리 구조로 전환했으며, DPT-3 Pro는 라인 단위, DPT-3 Verity는 단어 단위 정확도(Grounding)와 신뢰도 점수를 제공합니다. 과금 방식도 페이지 단위에서 출력 문자 수 기반으로 바뀌었고, 1세대 코드는 2세대 endpoint와 호환되지 않아 마이그레이션이 필요합니다.

문서추출 랜딩AI DPT-3
MP
MarkTechPost • 18일 전
IMP 6

Reducto, 단일 패스 문서 파싱 모델 'r-1' 출시…오류 20% 감소

Reducto가 2026년 9월 1일 단일 패스(single pass) 문서 파싱 모델 r-1을 공개했습니다. 이 모델은 OCR, 레이아웃 감지, 표, 서식, 그라운딩(grounding)을 한 번의 전체 페이지 처리로 통합하여 기존 다단계 에이전트 파이프라인을 대체합니다. 오류 약 20% 감소와 페이지당 1센트의 고정 요금(기존 3~6센트 대비)이라는 두 가지 핵심 지표가 마이그레이션 결정의 기준이 됩니다.

문서 파싱 OCR 레이아웃 감지
HN
Hacker News • 32일 전
IMP 4

킨들 하이라이트 내보내기 제한을 복구해주는 Claude Code 스킬

개발자 l3a0이 Amazon이 문서화하지 않은 내보내기 제한으로 잘리거나 숨겨진 자신의 킨들 하이라이트를 전부 복구하는 Claude Code 스킬을 공개했습니다. Mac 킨들 앱의 SQLite 주석 데이터베이스와 Cloud Reader 렌더링 페이지 캡처, Apple Vision OCR을 조합해 차단된 하이라이트까지 원문 그대로 위치 기반 인용과 함께 Markdown 파일로 추출합니다. 4권의 실제 도서에서 815개의 차단된 하이라이트(454개 잘림 + 361개 완전 숨김)를 모두 복구하는 성과를 검증받았습니다.

Claude Code 킨들 자동화
HN
Hacker News • 33일 전
IMP 6

OCR It – 복사 불가능한 문서에서 텍스트를 추출하는 크롬 확장 프로그램

텍스트 선택이 막힌 스캔 책, PDF, 슬라이드 등에서 영역을 한 번 지정하면 핫키 한 번으로 OCR을 실행해 전체 문서를 텍스트로 만들어주는 크롬 확장 프로그램입니다. 자동 페이지 넘김까지 지원하며, Tesseract 기반 OCR이 로컬에서만 돌아가 네트워크 요청 없이 프라이버시가 보장됩니다. 결과물을 Claude나 ChatGPT 같은 LLM에 바로 넘겨 요약·검색·질의에 활용할 수 있습니다.

OCR 크롬 확장 프로그램 텍스트 추출
MP
MarkTechPost • 34일 전
IMP 5

deepDoctection으로 종단 문서 인텔리전스 파이프라인 구축하기

deepDoctection을 활용해 문서 레이아웃 분석, DocTR OCR, 표 추출을 아우르는 종단 문서 인텔리전스 파이프라인을 구축하는 튜토리얼입니다. 엔티티 인식을 위한 커스텀 서비스 구현 방법과 RAG 워크플로우용 구조화된 JSONL 데이터 생성 방법도 함께 다룹니다.

문서인텔리전스 OCR 딥러닝
MP
MarkTechPost • 36일 전
IMP 4

UPDF 소개: 에이전트 시대를 위한 가벼운 어도비 대안

PDF 편집 도구 UPDF가 버전 2.5에서 직접 편집, 14개 포맷 변환, 38개 언어 OCR, 그리고 10개의 AI 에이전트 기능을 탑재했다. AI가 요약은 잘하지만 원본 PDF 파일을 깔끔하게 수정하지 못하는 문제를 해결하는 데 초점을 맞춘 것이 특징이다.

PDF 편집 AI 에이전트 OCR
MP
MarkTechPost • 39일 전
IMP 6

docTR 기반 문서 인텔리전스 파이프라인 구축

오픈소스 OCR 라이브러리 docTR를 활용해 OCR, 레이아웃 분석, 키 정보 추출(KIE), 벤치마킹, 검색 가능한 PDF 생성을 하나로 묶은 종단 간 문서 인텔리전스 파이프라인 구축 방법을 다룹니다. 실무 환경에 바로 적용 가능한 문서 자동화에 관심 있는 개발자에게 유용한 내용입니다.

OCR 문서 인텔리전스 docTR
TD
The Decoder • 46일 전
IMP 7

오래된 OCR 텍스트, 언어모델 학습 저해한다

Hugging Face와 EleutherAI는 훈련 데이터의 질을 높이기 위해 14개의 오픈소스 OCR 모델을 역사적 문서 2,000페이지 이상에서 테스트했습니다. 그 결과, 30억 개 미만의 파라미터를 가진 소형 모델들이 97% 이상의 높은 정확도를 달성하며 대형 모델들을 능가했습니다. 하지만 이 수준의 텍스트는 AI 학습용으로는 적합하지만, 학술적 연구 목적으로 사용하기에는 여전히 오류가 많은 것으로 나타났습니다.

OCR 언어모델 오픈소스
MP
MarkTechPost • 63일 전
IMP 8

Datalab Marker v2 벤치마크 비교 분석

Datalab이 'Marker' 버전 2를 3단계 파이프라인으로 재설계하여 공개했습니다. 단일 B200 GPU에서 초당 2.9페이지를 처리하는 압도적인 속도와 76.0의 높은 정확도를 기록하며 Docling과 MinerU 등 기존 경쟁 모델들을 정확도와 속도 양면에서 모두 능가했습니다. PDF 등 문서 파싱 및 데이터 추출 작업을 수행하는 실무자들에게 Marker v2가 현재 가장 강력한 선택지가 될 수 있음을 시사합니다.

문서 파싱 OCR 벤치마크
MP
MarkTechPost • 64일 전
IMP 6

바이두 무제한 OCR로 구축하는 엔드투엔드 문서 파싱 파이프라인

이 튜토리얼은 바이두의 무제한 OCR(Unlimited-OCR) 모델을 활용하여 고해상도 이미지와 다중 페이지 PDF를 처리하는 완벽한 엔드투엔드 파이프라인 구축 방법을 다룹니다. GPU 환경 설정부터 고해상도 추론 모드와 빠른 Base 모드의 성능 비교를 통해 복잡한 레이아웃, 표, 여러 페이지에 걸친 콘텐츠를 효율적으로 처리하는 실무적인 접근법을 제공합니다.

OCR 문서-파싱 바이두
TD
The Decoder • 82일 전
IMP 8

바이두, '무제한 OCR' 공개... 텍스트 길이와 무관하게 메모리 일정 유지

바이두 연구진이 인간의 망각 원리를 차용한 새로운 어텐션 메커니즘(R-SWA)을 적용하여, 한 번의 추론으로도 수십 페이지의 문서를 처리할 수 있는 '무제한 OCR(Unlimited OCR)' 모델을 개발했습니다. 기존 모델들의 가장 큰 병목이었던 KV 캐시 메모리 문제를 해결하여, 처리 속도와 메모리 사용량을 일정하게 유지하면서도 문서 인식 정확도 벤치마크에서 최고 수준의 성능을 기록했습니다.

OCR 바이두 인공지능 모델
MP
MarkTechPost • 93일 전
IMP 8

바이두, 장문서 처리에 최적화된 30억 매개변수 OCR 모델 공개

바이두가 단 한 번의 순전파로 수십 페이지 문서를 파싱할 수 있는 30억 매개변수 MoE 구조의 오픈소스 OCR 모델을 공개했습니다. 핵심 기술인 참조 슬라이딩 윈도우 어텐션(R-SWA)이 KV 캐시를 일정하게 유지하여, 출력이 길어져도 메모리와 지연 시간이 증가하지 않는 획기적인 장점이 있습니다. 성능 면에서도 기존 DeepSeek OCR 대비 6.22포인트가 높은 93.23점을 기록하며 장문서 처리 분야의 큰 기술적 진전을 보여줍니다.

OCR 바이두 오픈소스
TD
The Decoder • 94일 전
IMP 8

미스트랄, 경쟁사 제친 신규 OCR 모델 'OCR 4' 공개

미스트랄 AI가 문서 내 텍스트, 표, 수식 등의 요소와 레이아웃을 정확하게 분석하는 새로운 OCR 모델 'OCR 4'를 출시했습니다. 600개 이상의 문서로 진행된 블라인드 테스트에서 72%의 압도적인 승률로 경쟁 모델들을 제쳤으며, 170개 국어를 지원해 글로벌 문서 처리 작업에 매우 유용합니다.

미스트랄 OCR 문서분석
MP
MarkTechPost • 94일 전
IMP 8

미스트랄 OCR 4, RAG 및 에이전트 검색을 위한 구조화된 출력 지원

미스트랄 AI가 단순 텍스트 추출을 넘어 바운딩 박스, 타입 분류, 단어별 신뢰도 점수를 제공하는 구조화된 문서 출력이 가능한 'OCR 4'를 공개했습니다. 이 모델은 170개 언어를 지원하며 단일 자체 호스팅 컨테이너로 구동되어, RAG 및 에이전트 파이프라인에 즉시 인용 가능한 출처 정보를 원활하게 공급할 수 있다는 점에서 실무자들에게 매우 유용합니다.

OCR Mistral AI RAG
HN
Hacker News • 137일 전
IMP 8

인터페이즈: 대규모 정밀 작업 특화 신규 AI 모델

인터페이즈(Interfaze)는 트랜스포머 모델의 유연성과 DNN/CNN 모델의 높은 정확도를 결합하여 OCR, 비전, 음성 인식, 구조화된 출력 등의 작업에서 최적화된 성능을 제공하는 새로운 아키텍처입니다. 이 모델은 Gemini-3-Flash, Claude-Sonnet-4.6, GPT-5.4-Mini 등과 비교하여 9개 벤치마크에서 대부분 우수한 성능을 보여주었으며, 특히 처리 비용과 응답 시간을 획기적으로 낮추면서도 높은 정확도를 유지하는 것이 특징입니다.

새로운 아키텍처 OCR 비전 모델
LL
r/LocalLLaMA • 156일 전
IMP 7

Rust 기반 로컬 만화 번역기, LLM 내장

오픈소스 로컬 만화 번역기 'Koharu'가 공개되었습니다. llama.cpp를 통합해 시각적 LLM OCR과 객체 탐지, 인페인팅을 결합한 고성능 파이프라인을 제공합니다. 번역 결과를 폰트와 색상 등 미세 조정할 수 있는 내장 에디터도 포함되어 있어 실무 번역 작업에 즉시 활용할 수 있다는 점이 중요합니다.

오픈소스 만화 번역 시각 LLM