메뉴

#JSON

MP
MarkTechPost 24일 전
IMP 8

2026 오픈소스 기반 PDF-JSON 구조화 추출 모델 가이드

대부분의 기업 데이터는 PDF나 스캔 문서 형태로 존재하여, 대규모 언어 모델(LLM)과 에이전트가 이를 활용하려면 구조화된 JSON 형태로 변환해야 합니다. 이 글은 자체 하드웨어에서 데이터를 처리할 수 있는 표준 방식으로 오픈소스 문서 추출 기술이 주목받고 있음을 강조합니다. 나아가 'PDF to JSON' 작업이 스키마 기반 정보 추출과 문서 구조화라는 두 가지 다른 문제를 포함하고 있음을 설명합니다.

오픈소스 문서 추출 JSON
MP
MarkTechPost 27일 전
IMP 7

Lift를 활용한 PDF→구조화 JSON 변환 가이드

이 튜토리얼은 AI 모델 'Lift'를 활용하여 연구 논문 PDF를 구조화된 JSON 데이터로 변환하는 전체 워크플로우를 다룹니다. 단순 데모에 그치지 않고, 의도적인 방해 요소(Distractor)가 포함된 환경에서 스키마 기반 데이터 추출 및 필드 단위 정밀 평가를 수행하여 재현 가능한 벤치마크를 구축하는 과장을 보여줍니다. 실무자들에게 신뢰할 수 있는 데이터 추출 파이프라인을 설계하는 방법을 제시한다는 점에서 중요합니다.

데이터 추출 JSON Lift
HN
Hacker News 90일 전
IMP 8

LLM 정형화된 출력 평가용 새로운 벤치마크 공개

비정형 데이터를 정형화된 데이터(JSON)로 변환하는 LLM의 정확성을 평가하는 새로운 벤치마크인 SOB(Structured Output Benchmark)가 소개되었습니다. 기존 벤치마크들은 단순히 문법적 오류가 없는지(스키마 준수)만 확인하여 실제 업무 환경에서 발생할 수 있는 값의 환각이나 누락 문제를 잡아내지 못했습니다. 이를 해결하기 위해 SOB는 텍스트, 이미지, 오디오라는 3가지 입력 소스를 바탕으로 값의 정확도와 구조적 완성도 등 7가지 세부 지표를 사용해 실무에 적용 가능한 모델의 진짜 추출 능력을 평가합니다.

벤치마크 LLM 평가 정형 데이터