메뉴

#비전 모델

HN
Hacker News 7일 전
IMP 7

최신 AI 비전 모델 4종, '모나리자' 그려보기 결과

GPT-5.6, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash 모델에 색연필 도구를 제공해 그림을 그리게 하는 테스트를 진행했습니다. AI가 스스로 붓질, 혼합, 지우기 등을 반복하며 목표 이미지를 모방하는 과정은 복잡한 에이전트 작업 수행 능력과 실제 비용을 시각적으로 보여줍니다. 단순 벤치마크 점수를 넘어, 최신 폐쇄형 모델들이 실제 도구를 활용해 장기적인 작업을 수행할 때 어떤 성능 차이를 보이는지 확인할 수 있는 중요한 실험입니다.

비전 모델 AI 에이전트 벤치마크
MP
MarkTechPost 35일 전
IMP 7

데이터랩, PDF를 JSON으로 변환하는 9B 오픈 비전 모델 공개

데이터랩(Datalab)은 문서와 이미지를 스키마에 맞춘 JSON 형태로 변환하는 90억 매개변수(9B) 규모의 오픈 웨이트(open-weights) 비전 모델 'lift'를 공개했습니다. 이 모델은 유효한 구조를 보장하는 스키마 제약 디코딩과, 정보가 없는 필드는 환각(Hallucination) 없이 null 값을 반환하도록 훈련되어 높은 정확도를 자랑합니다. 실무자들에게 복잡한 비정형 문서를 다루는 작업에서 매우 유용하고 신뢰할 수 있는 데이터 추출 도구가 될 것입니다.

비전 모델 문서 정보 추출 오픈소스
HN
Hacker News 78일 전
IMP 8

인터페이즈: 대규모 정밀 작업 특화 신규 AI 모델

인터페이즈(Interfaze)는 트랜스포머 모델의 유연성과 DNN/CNN 모델의 높은 정확도를 결합하여 OCR, 비전, 음성 인식, 구조화된 출력 등의 작업에서 최적화된 성능을 제공하는 새로운 아키텍처입니다. 이 모델은 Gemini-3-Flash, Claude-Sonnet-4.6, GPT-5.4-Mini 등과 비교하여 9개 벤치마크에서 대부분 우수한 성능을 보여주었으며, 특히 처리 비용과 응답 시간을 획기적으로 낮추면서도 높은 정확도를 유지하는 것이 특징입니다.

새로운 아키텍처 OCR 비전 모델