메뉴

#비전모델

HN
Hacker News • 5시간 전
IMP 5

LLM용 Jev 스타일 단일 함수 래퍼, 비전 모델까지 지원

Jev와 OpenJev, SemIf 같은 셀프호스팅 프로젝트에서 착안해, LLM의 토큰 확률(logprobs)을 읽는 기법으로 질문에 답하는 단일 함수 래퍼를 소개합니다. max_completion_tokens를 1로 제한해 짧고 빠르게 답을 얻으며, 이미지 첨부(attachments) 필드를 직접 확장해 웹캠 프레임을 비전 모델(Gemma 4 12B, gpt-6-luna)로 분석하는 실험도 포함됩니다.

LLM 토큰확률 비전모델
TD
The Decoder • 35일 전
IMP 7

딥시크, 에이전트 벤치마크서 오푸스 4.8에 맞먹는 실험적 비전 모델 공개

중국 AI 기업 딥시크(Deepseek)가 텍스트 능력에 이미지 이해 기능을 더한 실험적 멀티모달 모델 'V4-Flash-Vision-Exp'를 공개했습니다. 자체 벤치마크에서 에이전트 작업 수행 시 오푸스 4.8과 거의 대등한 성적을 기록했으며, 이미지 설명, 스크린샷 텍스트 추출, 다이어그램 분석 등 시각적 에이전트 워크플로우를 겨냥하고 있습니다. 요금은 기존 V4-Flash 수준이며 한 번의 요청에 최대 600장의 이미지를 포함할 수 있습니다.

딥시크 멀티모달 비전모델