메뉴

#이미지 처리

HN
Hacker News • 39일 전
IMP 4

철도망을 플랫베드 스캐너로 사용하기

한 엔지니어가 산업용 라인스캔 카메라를 기차와 페리에 장착해 이동하면서 수만 픽셀에 달하는 초광각 이미지를 촬영하는 프로젝트를 소개합니다. 카메라가 이동하며 한 줄씩 캡처한 영상을 이어 붙이는 방식으로, 1990년대 디지털 스캐닝백의 원리를 역발상으로 적용한 것이 핵심입니다.

라인스캔 카메라 이미지 처리 DIY 하드웨어
HN
Hacker News • 51일 전
IMP 6

가우시안으로 그림 그리기

단순한 기계적 이미지 변환을 넘어, 이미지의 엣지(Edge) 정보를 활용해 붓터치 방향과 길이를 결정하는 디지털 페인팅 알고리즘을 소개합니다. 2D 가우시안 스플래팅(splatting)과 엣지 검출 기술을 결합하여, 기존의 느리고 결과물이 그림처럼 보이지 않던 경사 하강법(Gradient Descent) 방식의 한계를 극복했습니다.

디지털 페인팅 가우시안 스플래팅 이미지 처리
TD
The Decoder • 69일 전
IMP 8

구글 딥마인드, 비디오 생성 모델이 컴퓨터 비전의 '세계 모델'이 될 수 있다고 주장

구글 딥마인드는 비디오 생성 모델을 컴퓨터 비전의 핵심 과제를 수행하는 '세계 모델'로 재탄생시키는 GenCeption을 발표했습니다. 이 모델은 단일 아키텍처와 극소량의 합성 데이터만으로 깊이 추정 및 분할 등에서 기존 전문 모델들을 압도하는 성능을 보여주며, 비디오 생성 AI가 3D 공간과 물리적 법칙을 이미 깊이 이해하고 있음을 증명했습니다.

컴퓨터 비전 비디오 생성 모델 구글 딥마인드
TD
The Decoder • 104일 전
IMP 8

단일 텍스트 명령으로 모든 이미지 속 객체 수를 세는 AI 'Count Anything'

중국 칭화대 등 연구진이 메타(Meta)의 비전 모델(SAM3)을 기반으로 텍스트 프롬프트 하나만으로 위성 사진, 의료 스캔, 일상 사진 등 모든 이미지 내 객체의 수를 정확히 세고 표시하는 새로운 AI 모델 'Count Anything'을 발표했습니다. 이 시스템은 큰 객체는 박스로, 작고 밀집된 객체는 점으로 표시한 뒤 병합해 중복 계산을 방지하는 하이브리드 방식을 사용하여 기존 경쟁 모델들을 크게 압도하는 성능을 보여줍니다. 텍스트 기반 객체 카운팅을 위해 구축된 역대 최대 규모의 데이터셋을 학습한 이 모델은 의료, 농업, 도시 계획 등 다양한 실무 분야에서 활용도가 높을 것으로 기대됩니다.

객체 탐지 비전 AI 멀티모달