Pulpie: 웹 데이터 정화를 위한 효율적 오픈소스 AI 모델
Feyn Labs가 HTML 페이지에서 핵심 내용만 빠르고 저렴하게 추출하는 파레토 최적의 AI 모델군인 'Pulpie'를 오픈소스로 공개했습니다. 기존 최고 수준(SOTA) 모델인 Dripper와 비슷한 성능을 내면서도 크기는 1/3, 추론 비용은 1/20 수준으로, 10억 페이지 처리 비용을 약 2,890만 원에서 58억 원으로 대폭 절감할 수 있습니다. 깨끗한 데이터는 언어 모델의 사전 학습 및 추론 성능 향상에 핵심적인 역할을 하므로, 이 모델은 대규모 웹 데이터 처리에 있어 매우 중요한 돌파구가 될 것입니다.
연구 · 현장 노트 Pulpie: 웹을 정화하기 위한 파레토 최적 모델 저자: Bhavnick Minhas, Shreyash Nigam 소속: Feyn Labs 발행일: 2026년 6월 25일 읽는 데 걸리는 시간: 13분
우리는 HTML 페이지에서 핵심 내용을 추출하는 파레토 최적(Pareto-Optimal)의 모델군인 Pulpie를 소개합니다. Pulpie는 기존 최고 수준(SOTA)의 추출 품질을 단 20분의 1의 비용으로 달성합니다.
우리의 가장 작은 모델인 pulpie-orange-small은 WebMainBench 벤치마크에서 0.862의 ROUGE-5 F1 점수를 기록했습니다. 이는 0.864를 기록한 최고의 추출기인 Dripper와 맞먹는 수치입니다. 게다가 파라미터 크기가 2억 1천만 개(210M)로 Dripper의 6억 개(600M)의 3분의 1에 불과함에도 불구하고 이러한 훌륭한 성능을 달성했습니다.
이러한 성능 향상은 아키텍처에서 비롯됩니다. Pulpie는 인코더 기반으로, 단 한 번의 순방향 패스(forward pass)만으로 모든 HTML 블록이 본문 콘텐츠인지 불필요한 요소(boilerplate)인지 라벨링합니다. 이 덕분에 처리 속도도 매우 빠릅니다. NVIDIA L4 GPU 환경에서 pulpie-orange-small은 초당 13.7페이지를 처리하여 Dripper(초당 0.68페이지)를 크게 압도합니다. L4 인스턴스의 시간당 비용이 0.39달러일 때, 10억 개의 웹 페이지를 정제하는 데 드는 비용이 Pulpie는 7,900달러인 반면, Dripper는 159,000달러에 달합니다. Pulpie는 이전에는 불가능했던 대규모의 고품질 웹 데이터 추출을 가능하게 하며, 이는 AI 모델의 사전 학습 및 문맥 관리(context management)에 큰 도움이 될 것으로 기대됩니다. 우리의 모델은 오픈소스로 제공되며 Hugging Face에서 다운로드할 수 있습니다. 시작하기(Get started) 가이드를 참고하십시오.
추출이 병목 현상이다 언어 모델은 웹을 두 번 소비합니다. 처음은 세상을 학습하는 사전 학습 과정에서, 그다음은 관련 문맥을 가져오는 추론(inference) 과정에서입니다. 두 경우 모두 입력되는 데이터의 대부분은 노이즈입니다. 우리가 데이터를 조사하는 과정에서, 일반적인 HTML 페이지의 약 70%는 내비게이션, 광고, 사이드바, 푸터와 같은 불필요한 요소로 채워져 있다는 것을 발견했습니다. 실제 핵심 내용은 페이지의 극히 일부에 불과합니다. 하지만 모델 품질을 양쪽 모두에서 결정하는 것은 바로 그 일부분입니다.
Ma 등(2025)의 AICC 연구는 더 깨끗한 데이터 추출이 사전 학습에 미치는 영향을 측정했습니다. 연구팀은 동일한 Common Crawl 스냅샷으로 두 개의 말뭉치(corpus)를 구축했습니다. 하나는 휴리스틱(경험적 규칙) 방식으로 콘텐츠를 추출했고, 다른 하나는 모델 기반 파서를 사용해 추출했습니다. 데이터 파이프라인의 다른 모든 조건은 동일하게 유지했습니다. 그런 다음 각 말뭉치로 동일한 모델을 학습시켰습니다. 모델 기반으로 추출된 말뭉치로 학습된 모델은 13개 벤치마크에서 평균 정확도가 1.08% 포인트 더 높게 나타났습니다. 추출 로직만 변경되었기 때문에, 이 성능 향상은 전적으로 더 깨끗한 데이터 덕분이라고 볼 수 있습니다.
놀랍게도 이 모델은 가장 정교하게 필터링된 사전 학습 말뭉치인 FineWeb과 RefinedWeb으로 학습된 모델들을 능가했습니다. 이 두 데이터셋은 정교한 필터링과 중복 제거 과정을 거쳐 명성을 얻은 곳들입니다. 추출기를 개선하는 것만으로 이들을 이겼다는 사실은 '깨끗한 데이터'가 얼마나 중요한 가치를 지니는지 보여줍니다. 단순히 성능의 하한선을 낮출 뿐만 아니라, 저질스러운 추출은 모델에 실질적인 악영향을 미칩니다. 단순 규칙 기반 휴리스틱은 구조화된 콘텐츠를 훼손합니다. 아래 표는 코드 블록과 수식을 보존하는 데 있어 휴리스틱 기반인 Trafilatura와 모델 기반 추출기가 어떻게 다른지를 보여줍니다. 유사도 점수가 낮다는 것은 데이터가 손상되었음을 의미합니다. 훼손된 데이터가 학습에 사용되면, 결과물인 모델 역시 이 손상을 그대로 물려받게 됩니다.
콘텐츠 | Trafilatura (휴리스틱) | 모델 기반 추출기 코드 블록 | 0.13 | 0.91 수식 | 0.61 | 0.94
데이터 품질은 추론 시에도 중요합니다. Shi 등(ICML 2023)의 연구에 따르면, 단 하나의 무관한 텍스트 단락만으로도 모델의 답변을 완전히 그릇되게 만들기 충분하다는 것이 밝혀졌습니다. 모델은 문맥에 노이즈가 없을 때 더 정확하고 효율적으로 작동합니다.
예산 내에서 웹 정화하기 웹을 정화하는 것은 학습과 추론 양쪽 모두에서 보상을 받습니다. 그렇다면 남은 문제는 '어떻게 대규모로 이를 잘 수행할 수 있는가?'입니다. 우선 현재 추출기들의 구조를 이해하기 위해, 우리는 해당 방식이 '페이지를 글자 그대로 읽는가, 아니면 구조를 검사하는가?'라는 질문을 기준으로 두 가지 계열로 나눌 수 있습니다.
구조 기반 추출기(structure-based extractors)는 HTML 블록을 겉으로 드러나는 신호로 판단합니다. 콘텐츠와 불필요한 요소를 구분하기 위해 태그, DOM, 텍스트 밀도 등에 규칙을 적용합니다. Trafilatura, Readability, magic-html이 이 방식으로 작동합니다. Boilerpipe는 한 걸음 더 나아가 이와 동일한 신호들에 분류기를 학습시킵니다. 이러한 추출기들은 실행하기 쉽지만 구조가 비슷한 요소들을 혼동합니다. 예를 들어, 내비게이션 테이블과 실제 데이터 표가 셀을 세는 알고리즘 입장에서는 똑같아 보일 수 있습니다. 반면, 읽기 기반 추출기(reading extractors)는 페이지를 트랜스포머(Transformer) 모델에 입력하여 각 블록이 무엇인지 텍스트를 기반으로 판단합니다.