메뉴

#멀티모달

TD
The Decoder • 1시간 전
IMP 6

GPT-6 아스트라, IKEA 가구 조립 실수를 정확히 찾아낸다

Epoch AI의 가구 조립 벤치마크(FAB)에서 OpenAI의 GPT-6 Astra가 80%의 오류 탐지 정확도를 기록하며 2025년 11월 최고 모델(28%) 대비 큰 폭으로 발전했습니다. 실시간 조립 도우미로는 아직 느리지만, 자동차 수리나 가전 제품 수리 등 시각 기반 실무 지원 기술로 확장될 가능성이 있습니다.

OpenAI GPT-6 벤치마크
TD
The Decoder • 1일 전
IMP 7

블랙 포레스트 랩스, 오픈소스 로봇 AI 모델 'FLUX 3 Action' 공개

이미지 생성 AI로 유명한 블랙 포레스트 랩스(BFL)가 로봇 전용 오픈 AI 모델 FLUX 3 Action을 공개했습니다. 로봇 작업 공간의 다중 카메라 영상을 입력받아 다음 행동과 환경 변화를 예측하는 월드-액션 모델로, 70억 파라미터라는 경량 크기로 RoboLab-120 리더보드에서 최고 성공률을 기록하며 기존 최고 오픈 모델 대비 최대 3.95배 빠릅니다. 가중치는 허깅페이스(Hugging Face)에서 다운로드할 수 있습니다.

로봇 오픈소스 멀티모달
TD
The Decoder • 5일 전
IMP 6

텐센트 '간더', 작업 수행 중에도 대화 지속하는 AI 모델

텐센트 혼연(Hunyuan) 음성 팀이 발표한 'Gander'는 실시간 대화를 담당하는 '소뇌(cerebellum)'와 복잡한 에이전트 작업을 처리하는 교체 가능한 '뇌(brain)'를 분리해 대화 반응성과 작업 정확도를 동시에 추구하는 AI 모델입니다. 음성·이미지·텍스트를 동시에 처리하며 사용자가 언제든 끼어들 수 있고, 타이밍 벤치마크에서 상용 모델(GPT-Realtime, Gemini Live 등)보다 사용자를 덜 방해했지만 작업 정확도는 다소 뒤처지는 것으로 나타났습니다. 팀은 모델 가중치와 학습 데이터 공개를 계획 중이며 코드용 GitHub 저장소도 이미 마련되어 있습니다.

텐센트 음성 비서 AI 에이전트
TD
The Decoder • 6일 전
IMP 7

커원3.8-옴니-플래시, 제미나이 플래시 가격 파격 undercut

알리바바의 Qwen이 AI 에이전트용 멀티모달 모델 'Qwen3.8-Omni-Flash'를 공개했습니다. 이 모델은 오디오와 비디오를 함께 처리하고 도구를 스스로 활용하며, 오디오-비디오 벤치마크에서 Gemini 3.8 Flash에 근접하는 성능을 보이면서도 API 가격은 입력 100만 토큰당 0.15달러로 제미나이 대비 5분의 1 수준입니다. 100만 토큰 컨텍스트 윈도우와 오픈소스 플러그인 생태계를 함께 제공해 멀티모달 에이전트 개발자에게 중요한 선택지가 될 전망입니다.

멀티모달 Qwen 가격경쟁
MP
MarkTechPost • 7일 전
IMP 8

PrismML, 5.9GB 삼진법 모델 'Ternary Bonsai 2 27B' 공개

PrismML이 Qwen3.8 27B를 삼진 가중치(Ternary)로 압축한 'Ternary Bonsai 2 27B'를 아파치 2.0 라이선스로 공개했습니다. FP16 대비 약 9분의 1 수준인 5.93GB 크기임에도 20개 벤치마크 평균의 98.2% 성능을 유지하며, 텍스트와 이미지 입력 및 26만 토큰 컨텍스트를 지원합니다. 소비자급 GPU에서도 대형 멀티모달 모델 실행이 가능해졌다는 점에서 주목할 만합니다.

모델 압축 삼진 가중치 오픈소스
HN
Hacker News • 8일 전
IMP 7

본사이 2 27B, 9배 작은 용량으로 거의 무손실 압축

PrismML이 삼진법(trinary) 가중치 기반의 'Ternary Bonsai 2 27B'를 공개했습니다. Qwen3.8 27B를 기반으로 하며, 전체 원본 모델 대비 9배 이상 작은 5.9GB 크기로 벤치마크 성능의 98.2%를 유지합니다. 로컬 기기에서 코딩 에이전트, 컴퓨터 사용, 멀티모달 작업 등 실질적인 지식 노동이 가능해졌다는 점에서 주목할 만합니다.

모델 압축 로컬 LLM 오픈소스
TD
The Decoder • 18일 전
IMP 7

알리바바 Qwen-Drive 1.0, 주행·설명 하나의 AI로…단, 설명과 조작이 안 맞을 수도

알리바바가 자율주행용 멀티모달 모델 Qwen-Drive 1.0을 공개했다. Qwen3.5-4B를 기반으로 3D 공간 지각 모듈과 경로 계획 전문가(Planning Expert) 모듈을 추가해, 하나의 모델로 주행 시스템과 콕핏 어시스턴트를 모두 수행한다. 시뮬레이션에서 차선 이탈률을 24%에서 12%로 줄였으나, 모델의 설명이 실제 주행 결정과 항상 일치하지는 않는 한계가 있다.

자율주행 멀티모달 알리바바
MP
MarkTechPost • 19일 전
IMP 6

H Company, 단일 타워 멀티모달 인코더 NeoMME 공개

H Company가 비전 타워와 인과 디코더를 제거한 2억 6천만/8억 파라미터 단일 타워 멀티모달 인코더 NeoMME를 공개했습니다. 하나의 트랜스포머로 다국어 텍스트 토큰과 원시 32×32 이미지 패치를 처리하며, 마스크 기반 이산 확산 사전학습과 밀도(dense)·후기 상호작용(late-interaction) 이중 검색 헤드를 사용합니다. ViDoRe v3에서 260M 모델이 nDCG@10 0.523을 달성했고, 255배 인덱스 압축과 L40S GPU 하나에서 초당 51.3페이지의 인덱싱 처리량을 보여주지만 텍스트 검색 성능의 한계는 저자들도 인정하고 있습니다.

멀티모달 인코더 문서 검색
TD
The Decoder • 20일 전
IMP 6

구글, 제미나이 앱에 라이리아 3.5 음악 생성 모델 탑재

구글이 새 음악 생성 모델 '라이리아 3.5(Lyria 3.5)'를 제미나이(Gemini) 앱과 API를 통해 공개했습니다. 전작보다 더 표현력 있는 보컬과 풍부한 편곡을 제공하며, 사용자는 장르·스타일 선택, 보컬/연주곡 여부, 트랙 길이를 정해 음악을 만들 수 있습니다. 구글은 Suno와 달리 라이리아가 라이선스된 콘텐츠로만 학습됐다고 밝혔지만 구체적 학습 데이터는 공개하지 않았습니다.

구글 제미나이 라이리아
HN
Hacker News • 24일 전
IMP 8

월드랩스, 텍스트·이미지·비디오·3D 통합 월드 모델 '아틀라스' 공개

World Labs가 텍스트, 이미지, 비디오, 3D를 하나의 공간적 컨텍스트로 처리하는 차세대 범용 월드 모델 '아틀라스(Atlas)'를 발표했습니다. 아틀라스는 멀티모달 자기회귀 확산 트랜스포머로, 픽셀 단위 카메라 제어가 가능한 이미지·영상 생성(최대 1분, 1440p), 실제 장면의 3D 재구성, 시공간 시뮬레이션, 텍스트 기반 이미지·360도 파노라마 생성 등 폭넓은 작업을 수행합니다. 이는 창작 도구를 넘어 로봇 학습용 Real-to-Sim 워크플로우 등 공간 지능(Spatial Intelligence) 분야의 핵심 인프라로 주목받습니다.

월드 모델 멀티모달 3D 생성
HN
Hacker News • 30일 전
IMP 7

LAION, 1천만 시간 규모 오픈 비디오 데이터셋 공개

LAION이 CommonCrawl에서 수집한 13억 개의 비디오 URL을 기반으로 총 1천만 시간 분량의 8천만 개 비디오를 포함한 대규모 오픈 데이터셋 'LAION-BVD'를 연구 커뮤니티에 공개했습니다. 이 데이터셋은 비디오·오디오·이미지-텍스트 멀티모달 사전학습용으로 설계되었으며, 장면 감지로 추출한 클립에 합성 캡션을 생성했습니다. 이 데이터로 학습된 모델들은 표준 비디오-텍스트·오디오-텍스트 벤치마크에서 경쟁력 있는 성능을 보였고, 특히 InternVid 기반 모델 대비 최대 2.1% 향상된 성과를 달성했습니다.

데이터셋 멀티모달 비디오 AI
MP
MarkTechPost • 30일 전
IMP 7

Z.ai, 1M 토큰 컨텍스트 멀티모달 GLM-5.3-Flash 공개

Z.ai가 GLM-5 시리즈 최초의 네이티브 멀티모달 모델인 GLM-5.3-Flash를 공개했습니다. 총 320B/활성 18B 파라미터의 MoE 구조에 100만 토큰 컨텍스트 윈도우를 지원하며, MIT 라이선스로 허깅페이스에 공개되었습니다. 하이브리드 KDA 선형 어텐션과 NoPE 희소 MLA 어텐션을 통해 기존 대비 어텐션 연산량을 약 3배, KV 캐시를 4.4배 줄여 비용 효율성이 높은 것이 특징입니다.

멀티모달 오픈소스 MoE
MP
MarkTechPost • 30일 전
IMP 8

알리바바 Qwen3.8-Flash-Next 공개, Qwen4 아키텍처 예고

알리바바 Qwen 팀이 오픈 웨이트 멀티모달 MoE 모델 'Qwen3.8-Flash-Next'(총 180B 파라미터, 토큰당 6B 활성)를 공개하며 Qwen4 아키텍처를 미리 선보였다. Gated DeltaNet과 희소 어텐션 하이브리드, N-gram 임베딩, Muon 옵티마이저 등 4가지 구조적 변화가 적용됐으며, Qwen3.7-Plus 대비 학습 비용 1/9을 주장한다. 단, FP8 체크포인트만 172.78 GiB로 자체 호스팅 요구 사양이 상당하다.

Qwen 알리바바 MoE
TD
The Decoder • 32일 전
IMP 7

알리바바 Wan3.0, 텍스트·이미지·문서로 최대 30초 AI 영상 생성

알리바바가 공개한 영상 생성 모델 Wan3.0 베타는 최대 30초 영상을 만들 수 있으며, 텍스트뿐 아니라 이미지, PDF, 웹페이지, 파워포인트까지 입력으로 활용할 수 있습니다. 얼굴이나 UI 왜곡 등 기존 AI 영상의 문제를 개선해 참조 자료의 디테일을 일관되게 유지하는 것이 강점이며, 영화 제작부터 마케팅, 자율주행·로봇 학습용 시뮬레이션까지 폭넓은 활용이 기대됩니다.

알리바바 Wan3.0 AI 영상 생성
TD
The Decoder • 35일 전
IMP 7

딥시크, 에이전트 벤치마크서 오푸스 4.8에 맞먹는 실험적 비전 모델 공개

중국 AI 기업 딥시크(Deepseek)가 텍스트 능력에 이미지 이해 기능을 더한 실험적 멀티모달 모델 'V4-Flash-Vision-Exp'를 공개했습니다. 자체 벤치마크에서 에이전트 작업 수행 시 오푸스 4.8과 거의 대등한 성적을 기록했으며, 이미지 설명, 스크린샷 텍스트 추출, 다이어그램 분석 등 시각적 에이전트 워크플로우를 겨냥하고 있습니다. 요금은 기존 V4-Flash 수준이며 한 번의 요청에 최대 600장의 이미지를 포함할 수 있습니다.

딥시크 멀티모달 비전모델
MP
MarkTechPost • 39일 전
IMP 7

MiniMax, 가사와 캡션만으로 5분짜리 완곡 생성하는 오픈 웨이트 음악 모델 공개

MiniMax가 텍스트-음악(text-to-music) 모델 'MiniMax-Music3'을 오픈 웨이트(open-weights)로 공개했습니다. 섹션 태그가 포함된 가사와 구조화된 캡션을 입력하면 한 번의 추론으로 최대 5분 길이의 완성된 노래를 32kHz, 16비트 스테레오 WAV로 생성합니다. 실무자는 아키텍처, 세 가지 서빙 경로, 라이선스 조건을 서비스 적용 전에 반드시 확인해야 합니다.

음악생성 오픈소스 MiniMax
MP
MarkTechPost • 47일 전
IMP 8

바이트댄스, 실시간 시청·청취·대화 가능한 통합 멀티모달 AI 공개

바이트댄스의 Seed 팀은 시각, 청각, 텍스트를 하나로 통합한 네이티브 오디오-비주얼 풀듀플렉스 대형 언어 모델(LLM)인 'SeedRealtime'을 공개했습니다. 이 모델은 한 번씩 주고받는 기존 방식을 넘어, 연속적인 멀티모달 스트림을 통해 실시간으로 상호작용할 수 있어 완벽한 옴니모달(Omni-modal) 인터랙션 구현에 한 걸음 다가섰다는 점에서 중요합니다.

멀티모달 실시간-상호작용 대형-언어-모델
MP
MarkTechPost • 52일 전
IMP 8

픽셀 기반 RAG: 시각적 문서 인덱싱 실무 가이드

PixelRAG는 웹페이지와 PDF를 텍스트가 아닌 이미지 자체로 처리하는 혁신적인 엔드투엔드 시스템입니다. 렌더링부터 타일링, 멀티모달 임베딩, 하이브리드 검색까지 전체 파이프라인을 다루며, 개발자가 복잡한 문서에서도 뛰어난 검색 성능을 발휘하는 시스템을 구축할 수 있게 돕습니다. 전통적인 텍스트 파싱의 한계를 넘어 시각적 정보를 온전히 활용하는 것이 핵심입니다.

RAG 문서 인덱싱 멀티모달
HN
Hacker News • 52일 전
IMP 8

미스트랄, 오픈소스 멀티모달 검열 모델 '실드스트랄' 공개

미스트랄(Mistral)은 텍스트와 이미지를 동시에 처리할 수 있는 30억(3B) 매개변수 규모의 오픈소스 멀티모달 안전 검열 모델인 '실드스트랄(Shieldstral)'을 공개했습니다. 이 모델은 콘텐츠 검열을 '질의응답(QA)' 작업으로 정의하여, 일반 텍스트로 정책을 입력하면 별도의 재학습 없이도 유연하게 안전도를 평가합니다. 단일 16GB GPU에서 구동되는 가벼운 모델임에도 자신보다 7배 큰 기존 가드레일 모델들과 동등하거나 더 뛰어난 성능을 보여준다는 점에서 AI 안전 및 검열 시스템 구축에 있어 매우 중요한 의미를 갖습니다.

모델 평가 AI 안전 멀티모달
HN
Hacker News • 60일 전
IMP 8

텔닉스 API, 2.8조 매개변수 김이 K3 모델 지원 개시

Moonshot AI의 2.8조 매개변수 규모 최신 오픈소스 AI 모델 'Kimi K3'가 Telnyx Inference API를 통해 지원되기 시작했습니다. 이 모델은 1백만 토큰의 긴 문맥 창과 기본 비전 기능을 지원하여, 코딩 및 에이전트 벤치마크에서 최상위 폐쇄형 상용 모델들과 필적하는 성능을 보여줍니다. AI 생태계의 초점이 단순한 모델 성능 경쟁에서 이를 구동하는 인프라 및 라우팅 환경으로 이동하고 있음을 보여주는 중요한 사례입니다.

오픈소스 Kimi K3 Moonshot AI
HN
Hacker News • 64일 전
IMP 9

FLUX 3 x mimic: 차세대 비디오-행동 모델의 등장

Black Forest Labs의 새로운 멀티모달 파운데이션 모델인 FLUX 3가 로봇 제어 및 영상 생성을 하나로 통합하는 '비디오-행동 모델'로 진화했습니다. 이 모델은 영상 생성 과정에서 습득한 물리적 세계의 이해를 바탕으로 로봇의 행동(Action)을 예측하며, mimic 로보틱스와의 협업을 통해 아우디(Audi) 실무 환경에 배포되었습니다. 단일 모델로 영상과 로봇 제어를 모두 처리함으로써 피지컬 AI(Physical AI)가 자연스럽게 확장되는 중요한 기술적 이정표입니다.

멀티모달 로보틱스 파운데이션 모델
TD
The Decoder • 64일 전
IMP 8

블랙 포레스트 랩스, 네이티브 오디오 영상 생성 최초 공개

독일 AI 기업 블랙 포레스트 랩스(Black Forest Labs)가 이미지, 비디오, 오디오를 동시에 학습하는 멀티모달 기반 모델 'Flux 3'를 공개했습니다. 이 모델은 최장 20초의 네이티브 오디오가 포함된 영상을 생성하며, 경쟁 모델들을 압도하는 성능을 보여줍니다. 또한 아우디(Audi) 등에 적용되는 로봇 공학용 비디오 액션 모델까지 선보이며 실제 산업 활용도를 높였다는 점에서 중요합니다.

멀티모달 비디오생성 오디오생성
MP
MarkTechPost • 68일 전
IMP 8

알리바바, 2.4조 매개변수 Qwen3.8-Max 프리뷰 공개

알리바바의 Qwen 팀이 2.4조 개의 매개변수를 가진 멀티모달 MoE 모델인 Qwen3.8-Max-Preview를 공개했습니다. 해당 모델은 토큰(Token) 플랫폼 등에서 정가의 10% 가격으로 테스트가 가능하지만, 벤치마크 점수나 라이선스 등 핵심 스펙은 아직 공개되지 않아 기술적 검증이 필요한 상태입니다.

알리바바 Qwen AI모델
TD
The Decoder • 71일 전
IMP 8

키미(Kimi) 오픈 모델 K3, GPT-5.6에 맞먹는 성능…중국 AI 초저가 시대는 끝났다

중국의 AI 기업 키미(Kimi)가 최고 수준의 폐쇄형 모델과 맞먹는 성능을 지닌 2.8조 매개변수(Parameters) 규모의 멀티모달 오픈 모델 'K3'를 공개했습니다. 이 모델은 코딩 및 에이전트 작업에서 GPT-5.6 및 클로드 포블 5(Claude Fable 5)와 필적하는 성능을 보여주지만, 할루시네이션 비율이 증가했고 가격 역시 크게 상승하여 중국 AI의 '초저가' 시대가 저물었음을 시사합니다.

오픈소스 AI모델 키미
TD
The Decoder • 72일 전
IMP 8

전 오픈AI CTO 미라 무라티, 975B '잉클링' 모델 공개

전 오픈AI CTO 미라 무라티가 설립한 Thinking Machines Lab이 텍스트, 이미지, 오디오를 처리하는 975B 규모의 멀티모달 오픈 웨이트 모델 '잉클링(Inkling)'을 공개했습니다. 이 모델은 미국 내 오픈소스 모델 중 최고 성능을 자랑하지만, 63%에 달하는 높은 환각 현상과 비교적 높은 비용으로 인해 정확성이 필수적인 실무 적용에는 한계가 있습니다.

오픈소스 모델 멀티모달 미라 무라티
WR
Wired AI • 72일 전
IMP 8

AI보다 똑똑한 아기, 그 비밀을 찾아서

최첨단 AI 모델조차 아기가 세상을 인식하고 학습하는 방식에는 미치지 못한다는 연구 결과가 나왔습니다. 스탠퍼드 대학교, 메타(Meta), 도쿄 대학교 등의 연구진은 아기의 시점에서 촬영된 영상으로 AI를 테스트하는 'EgoBabyVLM' 챌린지를 통해 이를 입증했습니다. 엄청난 데이터에 의존하는 현재 AI의 한계를 극복하고 물리적 환경을 자연스럽게 학습하는 로봇 등을 개발하기 위해 아기 뇌의 학습 방식을 연구하는 것이 매우 중요합니다.

인공지능 인지과학 시각언어모델
HN
Hacker News • 72일 전
IMP 8

오픈 웨이트 모델 '잉클링(Inkling)' 공개

새로운 오픈 웨이트(Open-Weights) 기반 파운데이션 모델인 '잉클링(Inkling)'이 공개되었습니다. 이 모델은 총 975B(활성 41B) 매개변수와 최대 1M 토큰의 컨텍스트를 지원하며, 특히 텍스트, 이미지, 오디오를 아우르는 멀티모달推理 및 에이전트 코딩에 강점을 보입니다. 개발자들은 Tinker 플랫폼을 통해 이 모델을 손쉽게 파인튜닝(Fine-tuning)하여 다양한 실제 작업 환경에 맞춤형으로 활용할 수 있다는 점에서 의미가 큽니다.

오픈소스 파인튜닝 멀티모달
MP
MarkTechPost • 85일 전
IMP 7

랩-애니씽 튜토리얼: 텍스트·표·수식·이미지 멀티모달 검색 파이프라인 구축

본 튜토리얼은 구글 코랩 환경에서 '랩-애니씽(RAG-Anything)' 워크플로우를 활용해 텍스트, 표, 수식, 이미지를 아우르는 멀티모달 RAG(검색 증강 생성) 시스템을 구축하는 과정을 다룹니다. 오픈AI API를 연동하고 합성 PDF 리포트를 생성하여 데이터를 파이프라인에 주입한 뒤, 로컬·글로벌·하이브리드 등 다양한 검색 모드를 테스트합니다. 단순 텍스트를 넘어 복합적인 문서 데이터를 처리해야 하는 실무자들에게 매우 유용한 기술 가이드입니다.

RAG 멀티모달 파이프라인
TD
The Decoder • 94일 전
IMP 8

바이트댄스 시드댄스 2.5, AI 영상 생성 30초 벽을 깼다

바이트댄스가 '화산엔진(Volcano Engine)' 콘퍼런스에서 단일 클립으로 최대 30초의 영상을 생성하는 핵심 모델 '시드댄스(Seedance) 2.5'를 공개했습니다. 이 모델은 장면 전환과 템포 변화를 자연스럽게 구현하고 최대 50개의 참조 이미지와 오디오를 동시에 처리할 수 있어, 복잡한 영화 씬 제작에 매우 유용합니다. 이와 함께 기존 2.0 모델의 4K 지원, 저비용 언어 모델 '더우바오(Doubao) 2.1 Pro', 이미지 모델, 오디오 모델 등 총 5종의 새로운 AI 모델이 함께 발표되었습니다.

바이트댄스 시드댄스 AI비디오생성
TD
The Decoder • 104일 전
IMP 8

단일 텍스트 명령으로 모든 이미지 속 객체 수를 세는 AI 'Count Anything'

중국 칭화대 등 연구진이 메타(Meta)의 비전 모델(SAM3)을 기반으로 텍스트 프롬프트 하나만으로 위성 사진, 의료 스캔, 일상 사진 등 모든 이미지 내 객체의 수를 정확히 세고 표시하는 새로운 AI 모델 'Count Anything'을 발표했습니다. 이 시스템은 큰 객체는 박스로, 작고 밀집된 객체는 점으로 표시한 뒤 병합해 중복 계산을 방지하는 하이브리드 방식을 사용하여 기존 경쟁 모델들을 크게 압도하는 성능을 보여줍니다. 텍스트 기반 객체 카운팅을 위해 구축된 역대 최대 규모의 데이터셋을 학습한 이 모델은 의료, 농업, 도시 계획 등 다양한 실무 분야에서 활용도가 높을 것으로 기대됩니다.

객체 탐지 비전 AI 멀티모달