메뉴

#멀티모달

HN
Hacker News 1일 전
IMP 8

텔닉스 API, 2.8조 매개변수 김이 K3 모델 지원 개시

Moonshot AI의 2.8조 매개변수 규모 최신 오픈소스 AI 모델 'Kimi K3'가 Telnyx Inference API를 통해 지원되기 시작했습니다. 이 모델은 1백만 토큰의 긴 문맥 창과 기본 비전 기능을 지원하여, 코딩 및 에이전트 벤치마크에서 최상위 폐쇄형 상용 모델들과 필적하는 성능을 보여줍니다. AI 생태계의 초점이 단순한 모델 성능 경쟁에서 이를 구동하는 인프라 및 라우팅 환경으로 이동하고 있음을 보여주는 중요한 사례입니다.

오픈소스 Kimi K3 Moonshot AI
HN
Hacker News 5일 전
IMP 9

FLUX 3 x mimic: 차세대 비디오-행동 모델의 등장

Black Forest Labs의 새로운 멀티모달 파운데이션 모델인 FLUX 3가 로봇 제어 및 영상 생성을 하나로 통합하는 '비디오-행동 모델'로 진화했습니다. 이 모델은 영상 생성 과정에서 습득한 물리적 세계의 이해를 바탕으로 로봇의 행동(Action)을 예측하며, mimic 로보틱스와의 협업을 통해 아우디(Audi) 실무 환경에 배포되었습니다. 단일 모델로 영상과 로봇 제어를 모두 처리함으로써 피지컬 AI(Physical AI)가 자연스럽게 확장되는 중요한 기술적 이정표입니다.

멀티모달 로보틱스 파운데이션 모델
TD
The Decoder 5일 전
IMP 8

블랙 포레스트 랩스, 네이티브 오디오 영상 생성 최초 공개

독일 AI 기업 블랙 포레스트 랩스(Black Forest Labs)가 이미지, 비디오, 오디오를 동시에 학습하는 멀티모달 기반 모델 'Flux 3'를 공개했습니다. 이 모델은 최장 20초의 네이티브 오디오가 포함된 영상을 생성하며, 경쟁 모델들을 압도하는 성능을 보여줍니다. 또한 아우디(Audi) 등에 적용되는 로봇 공학용 비디오 액션 모델까지 선보이며 실제 산업 활용도를 높였다는 점에서 중요합니다.

멀티모달 비디오생성 오디오생성
MP
MarkTechPost 9일 전
IMP 8

알리바바, 2.4조 매개변수 Qwen3.8-Max 프리뷰 공개

알리바바의 Qwen 팀이 2.4조 개의 매개변수를 가진 멀티모달 MoE 모델인 Qwen3.8-Max-Preview를 공개했습니다. 해당 모델은 토큰(Token) 플랫폼 등에서 정가의 10% 가격으로 테스트가 가능하지만, 벤치마크 점수나 라이선스 등 핵심 스펙은 아직 공개되지 않아 기술적 검증이 필요한 상태입니다.

알리바바 Qwen AI모델
TD
The Decoder 12일 전
IMP 8

키미(Kimi) 오픈 모델 K3, GPT-5.6에 맞먹는 성능…중국 AI 초저가 시대는 끝났다

중국의 AI 기업 키미(Kimi)가 최고 수준의 폐쇄형 모델과 맞먹는 성능을 지닌 2.8조 매개변수(Parameters) 규모의 멀티모달 오픈 모델 'K3'를 공개했습니다. 이 모델은 코딩 및 에이전트 작업에서 GPT-5.6 및 클로드 포블 5(Claude Fable 5)와 필적하는 성능을 보여주지만, 할루시네이션 비율이 증가했고 가격 역시 크게 상승하여 중국 AI의 '초저가' 시대가 저물었음을 시사합니다.

오픈소스 AI모델 키미
TD
The Decoder 13일 전
IMP 8

전 오픈AI CTO 미라 무라티, 975B '잉클링' 모델 공개

전 오픈AI CTO 미라 무라티가 설립한 Thinking Machines Lab이 텍스트, 이미지, 오디오를 처리하는 975B 규모의 멀티모달 오픈 웨이트 모델 '잉클링(Inkling)'을 공개했습니다. 이 모델은 미국 내 오픈소스 모델 중 최고 성능을 자랑하지만, 63%에 달하는 높은 환각 현상과 비교적 높은 비용으로 인해 정확성이 필수적인 실무 적용에는 한계가 있습니다.

오픈소스 모델 멀티모달 미라 무라티
WR
Wired AI 13일 전
IMP 8

AI보다 똑똑한 아기, 그 비밀을 찾아서

최첨단 AI 모델조차 아기가 세상을 인식하고 학습하는 방식에는 미치지 못한다는 연구 결과가 나왔습니다. 스탠퍼드 대학교, 메타(Meta), 도쿄 대학교 등의 연구진은 아기의 시점에서 촬영된 영상으로 AI를 테스트하는 'EgoBabyVLM' 챌린지를 통해 이를 입증했습니다. 엄청난 데이터에 의존하는 현재 AI의 한계를 극복하고 물리적 환경을 자연스럽게 학습하는 로봇 등을 개발하기 위해 아기 뇌의 학습 방식을 연구하는 것이 매우 중요합니다.

인공지능 인지과학 시각언어모델
HN
Hacker News 13일 전
IMP 8

오픈 웨이트 모델 '잉클링(Inkling)' 공개

새로운 오픈 웨이트(Open-Weights) 기반 파운데이션 모델인 '잉클링(Inkling)'이 공개되었습니다. 이 모델은 총 975B(활성 41B) 매개변수와 최대 1M 토큰의 컨텍스트를 지원하며, 특히 텍스트, 이미지, 오디오를 아우르는 멀티모달推理 및 에이전트 코딩에 강점을 보입니다. 개발자들은 Tinker 플랫폼을 통해 이 모델을 손쉽게 파인튜닝(Fine-tuning)하여 다양한 실제 작업 환경에 맞춤형으로 활용할 수 있다는 점에서 의미가 큽니다.

오픈소스 파인튜닝 멀티모달
MP
MarkTechPost 26일 전
IMP 7

랩-애니씽 튜토리얼: 텍스트·표·수식·이미지 멀티모달 검색 파이프라인 구축

본 튜토리얼은 구글 코랩 환경에서 '랩-애니씽(RAG-Anything)' 워크플로우를 활용해 텍스트, 표, 수식, 이미지를 아우르는 멀티모달 RAG(검색 증강 생성) 시스템을 구축하는 과정을 다룹니다. 오픈AI API를 연동하고 합성 PDF 리포트를 생성하여 데이터를 파이프라인에 주입한 뒤, 로컬·글로벌·하이브리드 등 다양한 검색 모드를 테스트합니다. 단순 텍스트를 넘어 복합적인 문서 데이터를 처리해야 하는 실무자들에게 매우 유용한 기술 가이드입니다.

RAG 멀티모달 파이프라인
TD
The Decoder 35일 전
IMP 8

바이트댄스 시드댄스 2.5, AI 영상 생성 30초 벽을 깼다

바이트댄스가 '화산엔진(Volcano Engine)' 콘퍼런스에서 단일 클립으로 최대 30초의 영상을 생성하는 핵심 모델 '시드댄스(Seedance) 2.5'를 공개했습니다. 이 모델은 장면 전환과 템포 변화를 자연스럽게 구현하고 최대 50개의 참조 이미지와 오디오를 동시에 처리할 수 있어, 복잡한 영화 씬 제작에 매우 유용합니다. 이와 함께 기존 2.0 모델의 4K 지원, 저비용 언어 모델 '더우바오(Doubao) 2.1 Pro', 이미지 모델, 오디오 모델 등 총 5종의 새로운 AI 모델이 함께 발표되었습니다.

바이트댄스 시드댄스 AI비디오생성
TD
The Decoder 45일 전
IMP 8

단일 텍스트 명령으로 모든 이미지 속 객체 수를 세는 AI 'Count Anything'

중국 칭화대 등 연구진이 메타(Meta)의 비전 모델(SAM3)을 기반으로 텍스트 프롬프트 하나만으로 위성 사진, 의료 스캔, 일상 사진 등 모든 이미지 내 객체의 수를 정확히 세고 표시하는 새로운 AI 모델 'Count Anything'을 발표했습니다. 이 시스템은 큰 객체는 박스로, 작고 밀집된 객체는 점으로 표시한 뒤 병합해 중복 계산을 방지하는 하이브리드 방식을 사용하여 기존 경쟁 모델들을 크게 압도하는 성능을 보여줍니다. 텍스트 기반 객체 카운팅을 위해 구축된 역대 최대 규모의 데이터셋을 학습한 이 모델은 의료, 농업, 도시 계획 등 다양한 실무 분야에서 활용도가 높을 것으로 기대됩니다.

객체 탐지 비전 AI 멀티모달
TD
The Decoder 53일 전
IMP 8

0.4초마다 침묵과 발언을 결정하는 오픈소스 음성 AI

중국, 홍콩, 싱가포르 연구진이 대화, 번역, 전사, 일상 소리 인식을 하나로 통합한 새로운 오픈소스 음성 AI 모델을 발표했습니다. 이 모델은 오디오 스트림을 0.4초 단위로 나누어 실시간으로 청취와 발화를 병렬 처리하며, 반응 대기 시간을 최소화합니다. 결과적으로 최신 상용 모델들을 능가하는 주변 소리 탐지 및 처리 능력을 보여줍니다.

음성 AI 실시간 스트리밍 오픈소스 모델
HN
Hacker News 55일 전
IMP 9

인코더 없는 통합 멀티모달, 젬마 4 12B 공개

구글 딥마인드가 16GB VRAM 환경의 노트북에서도 원활히 구동되는 오픈소스 미드 사이즈 모델 'Gemma 4 12B'를 출시했습니다. 이 모델은 별도의 비전 및 오디오 인코더 없이 시각·청각 데이터를 직접 처리하는 통합 아키텍처를 채택하여 지연 시간을 최소화했습니다. 120억 파라미터의 가벼운 크기에도 불구하고 260억 파라미터 MoE 모델에 근접한 추론 성능을 제공하며, 에이전트 워크플로우 구축에 최적화된 것이 특징입니다.

오픈소스 멀티모달 로컬 AI
MP
MarkTechPost 57일 전
IMP 7

알리바바 Qwen3.7-Plus 공개

알리바바의 Qwen 팀이 자체 AI 플랫폼인 바이리안(Bailian)에 새로운 멀티모달 에이전트 모델인 Qwen3.7-Plus를 출시했습니다. 이 모델은 이미지와 비디오를 이해하는 시각 능력뿐만 아니라, 자가 프로그래밍 및 도구 호출(Tool Invocation) 기능을 탑재하여 독립적인 작업 수행 능력을 갖췄습니다. 이를 통해 복잡한 작업을 자율적으로 처리할 수 있는 고도화된 AI 에이전트 시장의 경쟁력이 한층 더 강화되었습니다.

알리바바 Qwen 멀티모달
MP
MarkTechPost 57일 전
IMP 7

미니맥스, 100만 토큰 컨텍스트 지원하는 '미니맥스 M3' 공개

미니맥스(MiniMax)가 최신 AI 모델인 '미니맥스 M3'를 발표했습니다. 이 모델은 미니맥스 스파스 어텐션(MiniMax Sparse Attention, MSA) 아키텍처를 채택하여 최대 100만 토큰의 긴 문맥을 처리할 수 있습니다. 특히 이미지와 비디오 등의 원시 멀티모달리티(Native Multimodality)를 기본 지원하며, 에이전틱 코딩(Agentic Coding)과 컴퓨터 사용(Computer Use) 기능까지 통합된 것이 핵심 강점입니다.

미니맥스 에이전틱 코딩 멀티모달
TD
The Decoder 57일 전
IMP 9

미니맥스 M3 공개, 100만 토큰 컨텍스트

중국의 AI 기업 미니맥스(MiniMax)가 최고 수준의 코딩 성능, 100만 토큰의 컨텍스트 윈도우, 네이티브 멀티모달을 결합한 새로운 오픈 웨이트 모델 M3를 발표했습니다. 새로운 '희소 어텐션(Sparse Attention)' 아키텍처를 도입하여 연산량을 20분의 1로 줄이고 입력 처리 속도를 9배 이상 높였으며, 벤치마크 및 자율 테스트에서 최상위 폐쇄형 모델들과 맞먹는 성능을 입증했습니다.

미니맥스 오픈 웨이트 대규모 컨텍스트
HN
Hacker News 59일 전
IMP 8

오픈라우터, 1억 1,300만 달러 시리즈 B 유치

AI 모델 라우팅 플랫폼인 오픈라우터(OpenRouter)가 알파벳의 CapitalG와 엔비디아의 NVentures 등으로부터 1억 1,300만 달러(약 1,500억 원) 규모의 시리즈 B 투자를 유치했습니다. 이번 투자에는 주요 빅테크 기업들의 벤처 투자사들이 대거 참여하며, 단일 모델에서 멀티모델 기반의 프로덕션 환경으로 전환되는 AI 시장에서 모델 라우팅 및 게이트웨이 계층의 중요성이 크게 부각되는 계기가 되었습니다. 오픈라우터는 최근 6개월간 주간 토큰 처리량이 5조 개에서 25조 개로 급증했으며, 이번 자금을 바탕으로 인프라 확장과 기업용 기능 고도화를 진행할 계획입니다.

AI 인프라 오픈라우터 시리즈 B
MP
MarkTechPost 69일 전
IMP 9

바이트댄스, 이미지와 영상의 이해·생성·편집 통합 멀티모달 AI 'Lance' 공개

바이트댄스가 이미지와 영상의 이해, 생성, 편집 기능을 하나의 모델에서 모두 처리할 수 있는 통합 모델 'Lance'를 발표했습니다. 이 모델은 이해(Understanding)와 생성(Generation) 작업을 각각 분리된 전문가 네트워크로 처리하는 듀얼 스트림 혼합 전문가(MoE) 아키텍처를 채택하여 작업 간 간섭 없이 높은 성능을 발휘합니다. 단일 모델로 텍스트, 이미지, 영상이라는 세 가지 모달리티를 자연스럽게 아우르며 시각 AI 분야의 중요한 이정표를 제시합니다.

멀티모달 비디오 생성 이미지 생성
HN
Hacker News 69일 전
IMP 8

바이트댄스, 이미지·영상 생성·이해 통합 멀티모달 모델 Lance 공개

바이트댄스가 이미지와 비디오의 이해, 생성, 편집을 단일 프레임워크에서 모두 지원하는 30억(3B) 파라미터 규모의 통합 멀티모달 모델 'Lance'를 공개했습니다. 128대의 A100 GPU 환경에서 트랜스포머 백본을 완전히 처음부터 학습시켰음에도 불구하고, 기존 벤치마크에서 매우 경쟁력 있는 높은 성능을 입증했다는 점이 가장 큰 의의입니다. 이는 하나의 모델로 시각 데이터의 인식과 생성을 동시에 해결하는 최근 멀티모달 AI 기술 트렌드를 잘 보여줍니다.

멀티모달 바이트댄스 이미지 생성
MP
MarkTechPost 70일 전
IMP 8

엔비디아, Qwen3-8B 대비 6배 빠른 트리모드 언어모델 공개

엔비디아가 기존 오픈소스 모델인 Qwen3-8B보다 한 번의 연산(Forward pass)당 6배 많은 토큰을 처리하는 새로운 트리모드 언어 모델 'Nemotron-Labs-Diffusion'을 발표했습니다. 이 모델은 텍스트, 코드, 이미지 생성 등 다양한 생성(AI) 작업을 단일 모델에서 처리할 수 있도록 설계되었습니다. 이는 AI 모델의 연산 효율성을 획기적으로 끌어올리며, 실시간 처리와 대규모 배포가 필요한 실무 환경에서 매우 중요한 기술적 진전으로 평가됩니다.

엔비디아 언어모델 오픈소스
TC
TechCrunch AI 70일 전
IMP 8

구글 '제미나이 오mni': 이미지·음성·텍스트를 영상으로

구글이 '제미나이 오mni(Gemini Omni)' 모델을 발표하며 텍스트, 이미지, 오디오를 결합해 물리 법칙과 문맥을 이해하는 고품질 비디오를 생성하는 기능을 선보였습니다. 첫 모델인 '오mni 플래시'는 최대 10초의 영상을 만들 수 있으며, 개인화된 디지털 아바타와 딥페이크 방지용 워터마크 기능도 포함되어 있어 소비자 친화적인 멀티모달 AI 시장을 선도하려는 구글의 의도를 보여줍니다.

구글 제미나이 멀티모달
TD
The Decoder 70일 전
IMP 9

구글 I/O: 신규 모델, 24시작동 클라우드 AI 에이전트

구글이 I/O 개발자 컨퍼런스에서 새로운 AI 모델인 제미나이 3.5 플래시와 통합 멀티모달 모델 Omni, 그리고 클라우드에서 24시간 돌아가는 개인형 에이전트 스파크(Spark)를 공개했습니다. 특히 3.5 플래시는 기존 모델을 성능으로 압도하면서도 비용을 절반 수준으로 낮춰 기업의 AI 도입 가성비를 획기적으로 개선할 수 있어 주목됩니다. 또한 개발자를 위한 멀티 에이전트 관리 플랫폼 업데이트와 함께 제미나이 앱의 대대적인 UI 개편도 진행되었습니다.

제미나이3.5 AI에이전트 멀티모달
HN
Hacker News 78일 전
IMP 8

실시간 협업을 위한 인터랙션 모델 연구

이 글은 턴 기반 인터페이스의 한계를 넘어, 오디오·비디오·텍스트를 실시간으로 처리하며 사람과 자연스럽게 협업하는 인터랙션 모델(Interaction Model)의 연구 미리보기를 발표합니다. 다중 스트림·마이크로 턴 설계를 통해 지능성과 반응성을 모두 최고 수준으로 끌어올렸습니다. 인간이 AI와 실시간으로 소통하며 피드백을 주고받는 ‘협업의 병목’을 해소하는 데 중요한 의미가 있습니다.

인터랙션 모델 실시간 AI Human-in-the-loop
HN
Hacker News 80일 전
IMP 8

제미나이 API 파일 검색, 멀티모달 완벽 지원

구글 딥마인드가 제미나이(Gemini) API의 파일 검색(File Search) 도구에 멀티모달 데이터 처리, 커스텀 메타데이터, 페이지 수준의 출처 인용 기능 등 세 가지 주요 업데이트를 도입했습니다. 이를 통해 개발자들은 텍스트와 이미지를 동시에 이해하는 정확하고 투명한 RAG(검색 증강 생성) 시스템을 구축할 수 있게 되었습니다. 이번 업데이트는 대규모 비정형 데이터를 다루는 실무자들에게 검색 정확도와 결과의 신뢰성을 획기적으로 높여준다는 점에서 중요합니다.

제미나이 API 멀티모달 RAG
HN
Hacker News 84일 전
IMP 7

GLM-5V-터보: 멀티모달 에이전트를 위한 네이티브 파운데이션 모델

GLM-V 팀이 이미지, 비디오, GUI 등 다양한 형식을 인지하고 해석하며 행동할 수 있는 'GLM-5V-Turbo' 모델을 발표했습니다. 이 모델은 언어 모델의 보조 인터페이스가 아닌, 추론 및 실행의 핵심 구성 요소로 멀티모달 인식을 통합한 것이 특징입니다. 이를 통해 우수한 멀티모달 코딩 및 시각적 도구 활용 능력을 갖춘 에이전트 구축을 위한 실질적인 통찰력을 제공합니다.

멀티모달 파운데이션 모델 인공지능 에이전트
TD
The Decoder 91일 전
IMP 9

엔비디아 네모트론 3 나노 옴니 공개

엔비디아가 텍스트, 이미지, 비디오, 오디오를 동시에 처리하는 오픈소스 멀티모달 모델 '네모트론 3 나노 옴니(Nemotron 3 Nano Omni)'를 공개했습니다. 이 모델은 경쟁사 모델(Qwen, GPT 등)에서 생성한 합성 데이터와 자체 오디오 데이터셋을 포함한 7,170억 개의 토큰으로 학습되었으며, 에이전트 애플리케이션에 최적화되어 상업적 사용이 가능합니다. 가장 주목할 점은 모델 가중치뿐만 아니라 학습 데이터, 파이프라인, 강화 학습 레시피까지 투명하게 공개하여 오픈소스 생태계에 큰 의미를 갖는다는 것입니다.

엔비디아 멀티모달 오픈소스
LL
r/LocalLLaMA 103일 전
IMP 8

알리바바 '큐웬3.6-35B-A3B' 오픈소스 공개

알리바바가 총 350억(35B) 파라미터 규모에 실제 활성 파라미터는 30억(3B)에 불과한 희소 MoE(Sparse MoE) 기반의 초경량 모델 '큐원3.6-35B-A3B'를 오픈소스로 공개했습니다. 자신보다 활성 파라미터가 10배나 큰 모델들과 맞먹는 수준의 에이전트 코딩(Agentic Coding) 능력과 강력한 멀티모달 추론 성능을 제공하는 것이 가장 큰 특징입니다. 실무자 입장에서 적은 컴퓨팅 자원으로도 고성능을 발휘할 수 있는 획기적인 오픈소스 AI 대안으로 평가받고 있습니다.

오픈소스 큐원(Qwen) MoE
HN
Hacker News 103일 전
IMP 8

클라우드플레어, 에이전트 최적화 통합 AI 추론 플랫폼 발표

클라우드플레어가 단 하나의 API로 여러 AI 제공업체의 모델을 사용할 수 있는 통합 추론(Inference) 레이어를 발표했습니다. 이 플랫폼은 코딩 에이전트 등 복잡한 AI 워크플로우에서 발생하는 지연 시간 증가와 비용 관리 문제를 해결하는 데 초점을 맞추고 있습니다. 개발자는 이제 클라우드플레어 인프라 내에서 오픈소스 모델부터 상용 모델까지 자유롭게 전환하며 멀티모달 애플리케이션을 구축할 수 있습니다.

클라우드플레어 API 추론
MP
MarkTechPost 107일 전
IMP 8

미니맥스, AI 에이전트 멀티모달 CLI ‘MMX-CLI’ 오픈소스 공개

미니맥스(MiniMax)는 개발자와 AI 에이전트가 터미널 환경에서 이미지, 비디오, 음성 등 미디어를 직접 생성할 수 있도록 돕는 Node.js 기반 CLI 도구인 MMX-CLI를 출시했습니다. 이 도구는 복잡한 통합 작업(MCP 등) 없이 7가지 모달리티(텍스트, 이미지, 비디오, 음성, 음악, 비전, 검색) 기능을 쉘 명령어로 호출할 수 있게 해줍니다. 결과적으로 Cursor나 Claude Code와 같은 코딩 에이전트가 외부 API 연동 없이도 네이티브 형태로 풍부한 미디어 생성 능력을 갖추게 되는 혁신적인 변화를 제공합니다.

에이전트 멀티모달 오픈소스
TD
The Decoder 109일 전
IMP 8

AI 모델, 도움 요청 대신 무작정 추측하는 경향

최신 벤치마크 테스트에 따르면 멀티모달 언어 모델은 시각적 정보가 누락되었을 때 사용자에게 도움을 요청하는 대신 환각(Hallucination)을 일으키거나 응답을 거부하는 것으로 나타났습니다. 연구진은 이를 해결하기 위해 모델이 정말로 필요할 때만 도움을 요청하도록 강화학습 기법(GRPO)을 적용했으며, 기존의 대형 모델들을 모두 능가하는 성과를 입증했습니다.

멀티모달 벤치마크 강화학습