메뉴

#대규모언어모델

MP
MarkTechPost • 5일 전
IMP 7

스텝펀, 600B MoE 'Step 5 프리뷰' 공개

중국 AI 기업 스텝펀(StepFun)이 총 600B 파라미터, 토큰당 활성 27B의 희소 MoE(Mixture-of-Experts) 모델 'Step 5 프리뷰'를 공개했습니다. 100만 토큰 컨텍스트 창과 텍스트·이미지·영상 입력을 지원하며, 소프트웨어 엔지니어링과 금융 등 장기 에이전트 작업에 초점을 맞춘 점이 특징입니다. API는 입력 100만 토큰당 1달러, 출력 100만 토큰당 2.70달러에 제공되며, 2026년 10월 15일 오픈 웨이트 공개가 예정되어 있습니다.

대규모언어모델 MoE 에이전트
HN
Hacker News • 8일 전
IMP 8

무한 매개변수 LLM: 실시간 데이터로 가중치 생성·적응

이 논문은 실제 배포 환경에서 사용자가 제공하는 정보나 교정 내용을 프롬프트가 아닌 모델 가중치에 직접 학습시키는 '무한 매개변수 LLM(Infinite-Parameter LLM)' 아키텍처를 제안합니다. 작은 하이퍼네트워크(hypernetwork)가 런타임 데이터를 저순위(low-rank) 가중치 변조로 변환하고, 생성기의 잠재 코드에 대한 베이지안 신념을 온라인으로 갱신해 세션 동안 가중치를 지속적으로 재도출합니다. 이를 통해 저장 공간은 고정된 채 사실상 무한한 가중치를 활용할 수 있으며, 컨텍스트 창을 절약하고 세션 간 지속되며, 컨텍스트 내 학습보다 더 나은 일반화가 가능함을 평가 프로토콜로 검증합니다.

대규모언어모델 하이퍼네트워크 온라인학습
MP
MarkTechPost • 13일 전
IMP 4

파리 뇌 연결체를 결합한 LLM, 대조 실험에서 효과 없음 판명

Fly Language Model(FLM)은 초파리 수컷 뇌 연결체(MaleCNS)의 166,700개 뉴런과 2,560만 개 연결을 토큰 임베딩으로 구동해 동결된 LFM2.5-1.2B-Instruct 모델에 소규모 학습 보정을 추가했습니다. 학습 파라미터는 278,528개에 불과하지만, 논문 자체의 대조 실험에서 그래프 없이 파라미터만 맞춘 모델이 모든 시드에서 오히려 더 나은 성능을 보였습니다.

신경과학 연결체 대규모언어모델
MP
MarkTechPost • 19일 전
IMP 7

IFM, K2 호라이즌 공개—0.9B~375B 아파치 2.0 모델 6종

MBZUAI가 2025년 5월에 설립한 프론티어 연구소 IFM(Foundemodels 연구소)이 'K2 Horizon'이라는 이름의 모델 6종(375B-A23B, 36B-A4B, 32B, 7B, 3.7B, 0.9B)을 아파치 2.0 라이선스로 공개했습니다. 단일 체크포인트와 벤치마크 표만 내놓는 일반적인 오픈 모델 공개와 달리, 사전 학습 코퍼스 등도 함께 제공해 오픈소스 생태계 관점에서 주목할 만합니다.

오픈소스 대규모언어모델 IFM
MP
MarkTechPost • 48일 전
IMP 8

포키 AI, 1천만 토큰 컨텍스트 '포키-아이작 28B' 공개

포키 AI는 최대 1천만 토큰을 처리할 수 있는 280억 매개변수의 텍스트 전용 기반 모델인 포키-아이작 28B(Pokee-Isaac 28B)를 공개했습니다. 이 모델의 가장 큰 특징은 고객의 내부망이나 디바이스 등 고객 경계(Customer boundary) 내부에 안전하게 배포할 수 있도록 설계되었다는 점입니다. AI 실무자들은 기업의 보안을 유지하면서도 초장문 문서 처리 및 고성능 에이전트(Agentic) 작업을 수행할 수 있는 강력한 상용 옵션을 확보하게 되었습니다.

대규모언어모델 긴문맥처리 온프레미스배포
TD
The Decoder • 54일 전
IMP 8

알리바바 2.4조 매개변수 Qwen3.8-Max 공개

알리바바가 장기적인 복잡 과제를 자율적으로 수행하는 2.4조 개 매개변수의 오픈 웨이트 언어 모델 Qwen3.8-Max를 공개했습니다. 이 모델은 16일간의 자율 소프트웨어 개발, 연구 논문 재현 및 성능 개선, 자동화된 칩 설계 등을 통해 서방 국가 최고 수준 모델들과 필적하는 성능을 입증했습니다. 모델 웨이트는 다음 주 공개될 예정입니다.

알리바바 대규모언어모델 오픈소스
MP
MarkTechPost • 58일 전
IMP 8

텐센트, 추론 속도 2.4배 향상 AngelSpec 오픈소스 공개

텐센트가 다양한 언어 모델 아키텍처에서 추론 디코딩 속도를 극대화하는 통합 프레임워크 'AngelSpec'를 오픈소스로 공개했습니다. 이 프레임워크는 블록 확산 드래프터인 DFly와 검증 예산을 실시간으로 조절하는 D-cut 기술을 도입하여, HY3-295B 모델 환경에서 최대 2.4배의 처리 속도 향상을 달성했습니다. AI 모델의 실제 서비스 적용 시 가장 큰 병목인 추론 속도와 비용 문제를 해결할 수 있는 핵심 기술로 평가받습니다.

텐센트 추론가속화 오픈소스
TD
The Decoder • 80일 전
IMP 8

중국 AI 스타트업 미니맥스, 2.7조 매개변수 모델 오픈소스 예정

중국의 AI 스타트업 미니맥스(MiniMax)는 올해 하반기에 2.7조 개의 매개변수(parameters)를 갖춘 대규모 언어 모델(M3 Pro)을 오픈소스로 공개할 계획입니다. 이는 복잡한 추론 능력이 필요한 작업의 성능을 높이기 위한 것으로, 현재 중국 시장에서 가장 큰 규모의 AI 모델이 될 전망입니다.

미니맥스 오픈소스 대규모언어모델
MP
MarkTechPost • 82일 전
IMP 7

메이퇀, 1.6T 매개변수 MoE 'LongCat-2.0' 공개

중국의 주요 플랫폼 메이퇀(Meituan)이 토큰당 약 480억 개의 매개변수를 사용하는 1.6조 매개변수 규모의 오픈소스 혼합 전문가(MoE) 모델인 LongCat-2.0을 발표했습니다. 이 모델은 희소 어텐션 기법을 통해 최대 100만 토큰의 긴 문맥을 처리할 수 있으며, 전 과정이 자체 AI 반도체 인프라에서 구동된다는 점에서 기술적 주목을 받고 있습니다.

대규모언어모델 혼합전문가 오픈소스
TD
The Decoder • 99일 전
IMP 6

AI 모델이 나를 알고 있을까? '인 더 웨이츠' 공개

전직 OpenAI 직원들이 개발한 웹사이트 '인 더 웨이츠'는 대규모 언어 모델(LLM)의 가중치(weights)에 특정 인물의 정보가 얼마나 학습되어 있는지를 수치화하여 보여줍니다. 이는 모델이 외부 검색 도움 없이도 해당 인물을 얼마나 잘 아는지를 파악할 수 있게 해주며, 작은 모델일수록 등장하기 어렵다는 특징이 있습니다. AI 모델의 지식 보유 범위와 데이터 기억력을 직관적으로 확인할 수 있다는 점에서 의미가 있습니다.

대규모언어모델 가중치 메타라마
TD
The Decoder • 100일 전
IMP 8

즈푸 AI(GLM-5.2), 코딩 마라톤서 폐쇄형 모델에 근접

중국의 AI 연구소인 즈푸 AI(Zhipu AI)가 100만 토큰의 긴 문맥을 안정적으로 처리하는 오픈소스 모델 'GLM-5.2'를 MIT 라이선스로 공개했습니다. 이 모델은 수십 시간이 걸리는 장기 코딩 및 에이전트 작업에서 앤스로픽(Anthropic)의 오푸스(Opus) 모델에 단 몇 포인트 차이로 근접하며 기존 오픈소스 모델들을 압도하는 성능을 입증했습니다. 특히 'IndexShare'라는 새로운 아키텍처를 도입해 긴 문맥 처리 시 발생하는 막대한 연산 비용과 자원 소모를 크게 줄인 것이 핵심 기술적 변화로 평가받습니다.

오픈소스 코딩에이전트 즈푸AI