메뉴

#확산 모델

TD
The Decoder • 4일 전
IMP 6

배양 뉴런에서 얻은 소프트웨어 레이어, AI 영상 생성 5배 빠르고 80% 저렴

샌프란시스코 스타트업 The Biological Computing Co.(TBC)가 AWS와 손잡고 실제 신경세포 측정에서 도출한 '뉴럴 다이내믹스 어댑터'를 적용한 최초의 '뉴런 유래' 텍스트-to-비디오 모델을 출시한다고 발표했습니다. 뇌세포가 직접 연산하는 게 아니라, 4,096개 전극 칩 위에서 배양한 피질 뉴런의 신호 확산·소멸 패턴을 측정해 아주 작은 소프트웨어 모듈(기존 모델 대비 크기 0.1% 미만 증가)로 만들어 기존 확산 모델에 삽입하는 방식입니다. 이를 통해 기반 모델 대비 5배 빠르고 80% 저렴한 추론, 더 나은 품질을 목표로 하며, 현재는 조기 액세스 신청만 가능한 계획 단계입니다.

생체 컴퓨팅 텍스트-to-비디오 AWS
MP
MarkTechPost • 9일 전
IMP 6

구글 리서치, R4T 공개—쿼리 팬아웃 12~20배 빠른 확산 검색기

구글 리서치가 일관성 있고 다양한 검색 결과를 반환하는 'Retrieve-for-Train (R4T)' 프레임워크를 발표했습니다. 강화학습으로 팬아웃 언어모델을 한 번 학습시켜 이를 5,390만 파라미터 확산(Diffusion) 검색기의 학습 데이터 합성에 활용하며, 자기회귀 방식 대비 12~20배 빠릅니다. 코드와 모델 가중치는 아직 공개되지 않았습니다.

구글 리서치 검색 확산 모델
MP
MarkTechPost • 9일 전
IMP 6

눈축스 AI, 학습 불필요한 저비트 어텐션 커널 'VC-Attention' 공개

눈축스(Nunchux) AI가 영상 확산 트랜스포머(DiT)를 가속화하는 학습 없이 사용 가능한 저비트 어텐션 커널 'VC-Attention'을 공개했습니다. 이 기술은 밸류(value) 양자화 오류와 느린 소프트맥스 단계라는 두 가지 문제를 동시에 해결합니다. 별도 재학습 없이 기존 모델에 적용할 수 있다는 점에서 영상 생성 추론 속도 최적화에 실용적인 의미가 큽니다.

영상 생성 확산 모델 어텐션
HN
Hacker News • 9일 전
IMP 7

텍스트-이미지 모델 학습 3.6배 빠르게 하기

Linum 개발팀이 VAE를 제거하고 압축을 DiT 자체에 통합한 JiT 기반의 새로운 인코더-디코더 구조(JiT-DDT)를 발표했습니다. 이를 통해 GPU 시간을 3.6배 절감하면서도 픽셀 수 4배의 이미지를 생성할 수 있었고, 코드와 모델 가중치는 Apache 2.0 라이선스로 공개되었습니다.

텍스트-이미지 생성 확산 모델 학습 효율화
MP
MarkTechPost • 19일 전
IMP 6

H Company, 단일 타워 멀티모달 인코더 NeoMME 공개

H Company가 비전 타워와 인과 디코더를 제거한 2억 6천만/8억 파라미터 단일 타워 멀티모달 인코더 NeoMME를 공개했습니다. 하나의 트랜스포머로 다국어 텍스트 토큰과 원시 32×32 이미지 패치를 처리하며, 마스크 기반 이산 확산 사전학습과 밀도(dense)·후기 상호작용(late-interaction) 이중 검색 헤드를 사용합니다. ViDoRe v3에서 260M 모델이 nDCG@10 0.523을 달성했고, 255배 인덱스 압축과 L40S GPU 하나에서 초당 51.3페이지의 인덱싱 처리량을 보여주지만 텍스트 검색 성능의 한계는 저자들도 인정하고 있습니다.

멀티모달 인코더 문서 검색
HN
Hacker News • 26일 전
IMP 8

확산 언어 모델(Diffusion LM) 만드는 법

GPT류의 자기회귀(autoregressive) 모델 대신 이미지 생성에 쓰이는 확산(diffusion) 기법을 텍스트에 적용한 '확산 언어 모델'의 원리와 최신 연구 성과를 소개하는 글입니다. 2024년 품질 경쟁력을 확보한 뒤 2026년에는 Mercury 2, Gemma Diffusion, Nemotron Diffusion 등 상용 모델이 등장했으며, 이 글은 단순 마스킹 확산부터 반복 정제, 사후 학습, 가변 길이 생성까지 핵심 구성 요소를 다룹니다.

확산 모델 언어 모델 LLM
HN
Hacker News • 26일 전
IMP 6

연속 확산 언어 모델(CDLM)의 부활

몇 년간 정체됐던 연속(continuous) 확산 언어 모델 연구가 최근 다시 활발해지고 있습니다. 이 글은 자기회귀(autoregressive) 방식이 지배하는 언어 모델 패러다임에 대한 대안으로서, 2021년 이산(discrete) 확산 모델과 2022년 Diffusion-LM 등 연속 확산 접근법의 역사와 기술적 배경을 정리합니다. 텍스트 생성의 병렬화·제어 가능성 측면에서 중요한 연구 흐름입니다.

확산 모델 언어 모델 LLM
HN
Hacker News • 94일 전
IMP 8

Krea 2 공개: 창의적 탐색을 강화한 12B 오픈웨이트 이미지 모델

Krea 2는 단순히 완성도 높은 기본 스타일을 넘어, 사용자가 다양한 미적 스타일과 분위기를 폭넓게 탐색할 수 있도록 설계된 120억 개 매개변수(12B) 규모의 최신 오픈웨이트 이미지 생성 모델입니다. 확산 트랜스포머(Diffusion Transformer, DiT) 아키텍처와 다단계 학습 파이프라인을 통해 표현력과 제어력을 극대화했으며, 관대한 라이선스로 가중치를 공개해 실무자들이 자유롭게 활용할 수 있다는 점에서 중요합니다.

krea2 오픈소스 이미지 생성
GP
r/ChatGPT • 158일 전
IMP 3

AI 영상 속 스파게티와 싸우는 윌 스미스

최근 온라인 커뮤니티에 기괴하게 변질된 윌 스미스의 스파게티 먹방 AI 영상이 화제가 되었습니다. 이는 현재 AI 비디오 생성 모델이 가진 물리적 법칙 이해의 한계와 환각(Hallucination) 현상을 여실히 보여줍니다. 향후 AI 동영상 기술이 이러한 부자연스러운 움직임을 어떻게 극복할지 실무자들의 주요 관전 포인트가 되고 있습니다.

AI 영상 생성 딥페이크 확산 모델