메뉴

#딥러닝

HN
Hacker News 1일 전
IMP 7

오픈소스 배경 제거 SOTA 모델 'FeyNoBg'와 학습 라이브러리 공개

Feyn Labs 연구진이 8개 벤치마크에서 최고 수준의 성능을 기록한 자동 배경 제거 모델 'FeyNoBg'와 이를 학습시킬 수 있는 오픈소스 라이브러리 'NoBg'를 공개했습니다. 이 모델은 피사체 인식 능력과 경계선 처리(이미지 매팅) 능력의 불균형을 해결하기 위해, BiRefNet 아키텍처를 확장하고 정제된 합성 데이터로 학습시켜 복잡한 이미지에서도 훌륭한 결과물을 냅니다. 개발자들은 허깅페이스(Hugging Face)와 깃허브(GitHub)를 통해 모델과 라이브러리를 무료로 다운로드하고 직접 커스텀 모델을 구축할 수 있습니다.

오픈소스 이미지처리 배경제거
MP
MarkTechPost 3일 전
IMP 7

오픈 드리머: 드리머 4 월드 모델 훈련 과정 공개

소규모 AI 연구팀(Reactor)이 JAX와 Flax NNX로 작성된 드리머 4(Dreamer 4) 월드 모델 파이프라인의 오픈소스 구현체인 '오픈 드리머(Open Dreamer)'를 공개했습니다. 이번 릴리스에는 인과적 비디오 토크나이저(causal video tokenizer), 행동 조건부 잠재 역학 모델(action-conditioned latent dynamics model) 등 훈련 파이프라인과 전체 학습 레시피(training recipe)가 포함되어 있어, 관련 분야 실무자와 연구자들이 모델 구현과 훈련 과정을 투명하게 분석하고 활용할 수 있다는 점에서 중요합니다.

오픈소스 JAX Flax
MR
MIT Tech Review 15일 전
IMP 8

Anthropic의 최신 AI 발견이 밝히는 것과 한계

Anthropic은 대형 언어 모델(LLM)의 수많은 계산 과정을 들여다보고 결과의 원인을 파악하는 '기계적 해석 가능성(Mechanistic interpretability)' 연구를 심화시키고 있습니다. 최근 연구를 통해 회사는 모델이 문제를 풀 때 사용하지만 겉으로 드러나지 않는 내부 개념 공간인 'J-스페이스(J-space)'를 발견했습니다. 하지만 AI 모델을 심리학적 용어로 해석하는 것은 그 복잡한 수학적 구조를 지나치게 신비화할 수 있다는 비판적 시각도 존재합니다.

인공지능 기계적 해석 가능성 Anthropic
HN
Hacker News 16일 전
IMP 7

인과관계 이론을 활용해 LLM 작동 원리를 파헤치다

AI 연구자들이 대형 언어 모델(LLM)의 내부 작동 원리를 정확히 이해하기 위해 인과관계 이론(Causality Theory)을 적용하는 연구를 진행하고 있습니다. 이는 단순히 결과값만 보는 것을 넘어, 모델 내부에서 어떤 요인이 특정 출력을 유발하는지 원인과 결과를 추적하여 투명성을 확보하는 핵심적인 접근법입니다. 이러한 기계적 해석 가능성(Mechanistic Interpretability) 연구는 블랙박스인 AI 모델의 신뢰성을 높이고 환각 현상 등을 통제하는 데 매우 중요합니다.

기계적 해석 가능성 인과관계 이론 대형 언어 모델
MP
MarkTechPost 21일 전
IMP 7

엔비디아 코스모스 미니 월드 모델 튜토리얼

본 튜토리얼은 구글 코랩 환경에서 엔비디아(NVIDIA)의 Cosmos 프레임워크를 활용하여 소형 '월드 모델(World Model)'을 구축하는 방법을 다룹니다. 텍스트, 비전, 액션을 결합하는 혼합 트랜스포머(Mixture-of-Transformers) 구조를 통해, 제한된 하드웨어 환경에서도 모델이 미래 상태를 예측하는 방법을 실무적으로 구현하고 학습할 수 있다는 점에서 중요합니다.

엔비디아 월드 모델 혼합 트랜스포머
HN
Hacker News 28일 전
IMP 8

수술 없이 뇌파로 문장 읽어내는 메타 'Brain2Qwerty' 오픈소스 공개

메타는 뇌파(MEG)를 텍스트로 변환하는 비침습적 뇌-컴퓨터 인터페이스 시스템인 Brain2Qwerty v2를 발표했습니다. 딥러닝과 대형 언어 모델(LLM)을 활용해 기존 비침습적 방식의 한계를 크게 뛰어넘어 최대 78%의 단어 정확도를 달성하며, 수술이 필요한 침습적 기술에 근접한 성능을 보였습니다. 연구 가속화를 위해 전체 학습 코드와 데이터셋을 오픈소스로 공개하며, 뇌 손상으로 인한 의사소통 장애를 가진 사람들에게 새로운 소통의 가능성을 제시합니다.

뇌-컴퓨터 인터페이스 오픈소스 메타 AI
TD
The Decoder 35일 전
IMP 6

AI 탐지기 팽그램 CEO "AI가 쓴 글은 논리가 정형화되어 들통난다"

AI 텍스트 탐지 스타트업 팽그램(Pangram)의 CEO는 LLM(Large Language Model)이 인간보다 문법이나 논리에 능할지는 몰라도, 주장하는 논리의 폭이 매우 좁고 정형화되어 있어 이를 통해 AI가 쓴 글을 구별해낸다고 밝혔습니다. 팽그램의 딥러닝 분류기는 블랙박스 형태로 작동하지만, AI가 문서를 구조화할 때 남기는 특정 패턴을 포착해 작동 방식의 완전한 이해와 무관하게 높은 정확도로 탐지해냅니다.

AI 탐지 팽그램 LLM
HN
Hacker News 36일 전
IMP 9

울트라리틱스 YOLO26: 통합 실시간 엔드투엔드 비전 모델

실시간 객체 탐지 분야의 표준으로 자리 잡은 YOLO 시리즈의 최신 모델인 '울트라리틱스 YOLO26'이 공개되었습니다. 이번 모델은 NMS(비최대 억제)에 대한 의존성을 완전히 제거하고 무거운 헤드 구조를 경량화하여, 엔드투엔드(End-to-End) 추론 환경에서도 더 빠르고 정확하게 동작하도록 설계되었습니다. 특히 대형 언어 모델(LLM) 학습에 쓰이는 하이브리드 최적화 기법을 도입하고 작은 객체 탐지 성능을 개선하여, 실무 비전 개발자들에게 획기적인 정확도와 속도의 이점을 제공합니다.

컴퓨터비전 객체탐지 YOLO
HN
Hacker News 36일 전
IMP 8

파이토치 학습 루프(PyTorch Training Loop) 완벽 가이드

파이토치(PyTorch) 학습 루프를 구성하는 것은 간단해 보이지만, 코드의 순서가 조금만 어긋나도 메모리 초과(OOM)나 수렴 실패 등을 겪게 됩니다. 이 글은 올바른 학습 루프의 구조를 소개하고, 흔히 저지르는 치명적인 순서 실수들을 디버깅 방법과 함께 상세히 설명합니다.

파이토치 딥러닝 모델학습
MP
MarkTechPost 47일 전
IMP 7

MONAI와 3D UNet 활용 의료 CT 비장 분할

본 튜토리얼에서는 MONAI 프레임워크를 활용하여 Medical Segmentation Decathlon(Task09) 데이터셋의 CT 영상에서 비장을 추출하는 엔드투엔드 3D 의료 영상 분할 파이프라인을 구축하는 방법을 다룹니다. 실무에서 필수적인 방향 정렬, 복셀 간격 정규화, 강도 윈도잉 등 다양한 의료 영상 변환 기법을 적용한 후 3D UNet 모델을 학습시키는 과정까지 상세히 제공합니다.

의료 영상 분석 MONAI 3D UNet
HN
Hacker News 72일 전
IMP 8

신경 세포 자동화 기반 형태 발생 모델

구글과 타프츠 대학교 연구진이 단일 세포로부터 복잡한 생물학적 형태를 자가 조립하고 손상된 부위를 재생하는 '신경 세포 자동화(Neural Cellular Automata)' 모델을 발표했습니다. 이 모델은 미분 가능한 시스템을 통해 단순한 규칙만으로 복잡한 구조를 형성하고 유지하는 생명체의 형태 발생(Morphogenesis) 과정을 성공적으로 시뮬레이션합니다. 이는 단순한 세포 집단이 어떻게 전체 형태를 인지하고 제어하는지를 규명하는 인공지능 및 발생 생물학 연구에 중요한 진전을 의미합니다.

인공생명 신경세포자동화 형태발생
HN
Hacker News 83일 전
IMP 8

디퓨전 모델의 적분 학습과 플로우 맵

디퓨전 모델의 샘플링 속도를 획기적으로 높이기 위해 중간의 반복적인 단계를 건너뛰고 적분값을 직접 예측하는 '플로우 맵(Flow Map)' 기술을 소개하는 글입니다. 플로우 맵은 단순히 샘플링 속도만 개선하는 것을 넘어 보상 기반 학습의 효율성과 샘플링 제어 능력을 향상시키는 등 다양한 장점을 제공합니다. 최근 AI 연구 분야에서 매우 주목받고 있으며, 기존 디퓨전 모델의 한계를 극복할 대안으로 떠오르고 있습니다.

디퓨전 모델 플로우 맵 딥러닝
MP
MarkTechPost 88일 전
IMP 6

신경망으로 MEG 뇌파 신호 번역하기

이 튜토리얼에서는 MEG(뇌자도) 데이터를 활용해 뇌의 신경 활동으로부터 직접 언어적 특징을 디코딩하는 최신 NeuroAI 파이프라인 구축 방법을 다룹니다. NeuralSet과 딥러닝(합성곱 신경망, CNN)을 사용하여 원시 뇌파 신호를 의미 있는 언어 정보(예: 단어 길이)로 변환하는 엔드투엔드 시스템을 구축하는 과정을 보여줍니다. 이는 뇌-컴퓨터 인터페이스(BCI) 및 인지 신경과학 연구에 있어 실무적이고 모듈화된 워크플로우를 제공한다는 점에서 중요합니다.

인공지능 딥러닝 뇌-컴퓨터 인터페이스
MP
MarkTechPost 100일 전
IMP 8

랜덤포레스트·캣부스트 능가하는 테이블 데이터 AI 'TabPFN'

전통적인 트리 기반 머신러닝 모델(랜덤포레스트, 캣부스트 등)이 장악하던 테이블 데이터(정형 데이터) 분석 분야에서, 사전 학습된 파운데이션 모델인 'TabPFN'이 뛰어난 정확도를 입증했습니다. 이 모델은 대규모 언어 모델(LLM)처럼 문맥 내 학습(In-context learning)을 활용해 별도의 파인튜닝 없이도 빠르고 정확한 예측을 제공합니다. 또한, 예측 결과를 더 작은 모델로 증류(Distillation)하여 실제 서비스 환경에 빠르게 배포할 수 있는 실용성까지 갖추고 있어 데이터 실무자들에게 매우 중요한 대안으로 떠오르고 있습니다.

머신러닝 정형 데이터 TabPFN
ML
r/MachineLearning 108일 전
IMP 3

유행 따라 가는 새로운 세대의 실증적 딥러닝 연구자들

X(옛 트위터)에서 화제가 된 게시물을 인용하며, 최신 트렌드를 좇는 실증적(Empirical) 딥러닝 연구자들의 등장에 대한 논의가 이루어지고 있습니다. 작성자는 '포스트 에이전트 AI(Post agentic AI)'라는 용어의 모호함에 공감하며 레딧 커뮤니티 내에서 이에 대한 심도 있는 토론을 촉구했습니다. 이는 최근 AI 연구 트렌드가 빠르게 소비되는 현상과 신조어 남발에 대한 업계의 경종으로 볼 수 있습니다.

딥러닝 AI 연구 트렌드 AI 에이전트
HN
Hacker News 110일 전
IMP 7

학습 데이터의 순서 의존성과 리 브래킷(Lie Bracket)

이 글은 신경망 학습 과정에서 학습 데이터(Training Example)를 벡터 장(Vector Field)으로 간주하고, 두 데이터의 학습 순서를 바꿨을 때 파라미터에 미치는 영향을 수학적으로 계산하는 방법을 설명합니다. 미분 기하학의 '리 브래킷(Lie Bracket)' 개념을 적용해 데이터의 순서 의존성을 정량화하며, 이를 실제 합성곱 신경망(ConvNet) 학습에 적용한 실험 결과를 보여줍니다.

딥러닝 수학 경사하강법
MP
MarkTechPost 111일 전
IMP 7

시그모이드 vs ReLU: 기하학적 맥락 상실에 따른 추론 비용

딥러닝 모델에서 시그모이드(Sigmoid) 활성화 함수는 입력값을 0과 1 사이로 압축하여 기하학적 맥락을 상실하게 만들어 모델의 깊이가 주는 이점을 제한합니다. 반면, ReLU는 양수 입력값의 크기를 보존하여 심층 신경망이 과도한 너비나 연산량 없이도 풍부한 표현력을 유지할 수 있게 합니다. 이 글은 두 활성화 함수의 신호 전파 방식과 표현 기하학 차이를 실험을 통해 분석하며, 이것이 모델의 추론 효율성과 확장성에 미치는 영향을 설명합니다.

머신러닝 활성화함수 딥러닝