TD
The Decoder • 46일 전
IMP 7
오래된 OCR 텍스트, 언어모델 학습 저해한다
Hugging Face와 EleutherAI는 훈련 데이터의 질을 높이기 위해 14개의 오픈소스 OCR 모델을 역사적 문서 2,000페이지 이상에서 테스트했습니다. 그 결과, 30억 개 미만의 파라미터를 가진 소형 모델들이 97% 이상의 높은 정확도를 달성하며 대형 모델들을 능가했습니다. 하지만 이 수준의 텍스트는 AI 학습용으로는 적합하지만, 학술적 연구 목적으로 사용하기에는 여전히 오류가 많은 것으로 나타났습니다.
OCR 언어모델 오픈소스