메뉴

#롱컨텍스트

MP
MarkTechPost • 5일 전
IMP 7

스텝펀, 600B MoE 'Step 5 프리뷰' 공개

중국 AI 기업 스텝펀(StepFun)이 총 600B 파라미터, 토큰당 활성 27B의 희소 MoE(Mixture-of-Experts) 모델 'Step 5 프리뷰'를 공개했습니다. 100만 토큰 컨텍스트 창과 텍스트·이미지·영상 입력을 지원하며, 소프트웨어 엔지니어링과 금융 등 장기 에이전트 작업에 초점을 맞춘 점이 특징입니다. API는 입력 100만 토큰당 1달러, 출력 100만 토큰당 2.70달러에 제공되며, 2026년 10월 15일 오픈 웨이트 공개가 예정되어 있습니다.

대규모언어모델 MoE 에이전트
MP
MarkTechPost • 16일 전
IMP 8

딥시크, 100만 토큰 컨텍스트 'DeepSeek-V4.1-Flash' 공개

딥시크(DeepSeek) AI가 100만 토큰 컨텍스트 윈도우를 지원하는 멀티모달 MoE(전문가 혼합) 모델 'DeepSeek-V4.1-Flash'를 공개했습니다. 552B 백본 파라미터와 196B Engram 파라미터로 구성된 이 모델은 장기 실행 에이전트(Long-horizon agent) 환경에서 반복적인 프리필(prefill)과 대규모 KV 캐시가 유발하는 HBM·SSD 메모리 병목을 해결하는 데 초점을 맞췄다는 점에서 주목됩니다. FP4 KV 캐시와 크로스 레이어 어텐션 재사용 등 서비스 효율화 기술이 핵심입니다.

딥시크 MoE 롱컨텍스트
HN
Hacker News • 17일 전
IMP 8

사전학습 컴퓨팅 효율 10배 이상 향상 달성

Magic Team이 알고리즘 효율 개선을 축적하여 주요 오픈 웨이트 기반 모델 대비 10배 이상 컴퓨팅 효율이 높은 사전학습 레시피를 발표했습니다. DeepSeek V4 Pro Base와 약 50배 적은 FLOPs(~$0.5M)로 동등한 성능을 달성했으며, $4M 규모로 확장 시 공개된 모든 오픈 기반 모델의 퍼플렉시티를 능가했습니다. 대규모 칩 없이도 알고리즘 혁신만으로 프론티어급 사전학습이 가능함을 보여준다는 점에서 주목받습니다.

사전학습 스케일링 법칙 컴퓨팅 효율
MP
MarkTechPost • 22일 전
IMP 8

오픈AI, '크리티컬' 사이버 기준 통과한 GPT-6 아스트라 공개

오픈AI가 2026년 9월 3일 컴퓨터 사용(computer-use) 특화 모델 GPT-6 아스트라를 공개했습니다. 이 모델은 OSWorld V2-오프라인 벤치마크에서 72.6%를 기록했고, 105만 토큰의 초장문 컨텍스트를 지원하며 백만 토큰당 입력 10달러/출력 50달러의 가격으로 제공됩니다. 또한 오픈AI 모델 최초로 '크리티컬(Critical)' 사이버 보안 임계값을 넘어서 누가 어떤 목적으로 사용할 수 있는지에 대한 규제가 적용됩니다.

GPT-6 아스트라 컴퓨터 사용 에이전트 롱컨텍스트