PrismML, 초소형 LLM으로 AI 사용 방식 바꾸려 한다
칼텍(Caltech) 연구진이 창업한 PrismML은 'Bonsai 2 27B'를 공개하며 알리바바 Qwen3.8 27B를 5.9GB로 압축, 원본 대비 98%의 벤치마크 성능을 유지하는 추론 모델을 PC와 스마트폰에서 구동 가능하게 만들었다. 3진(ternary) 가중치 기법으로 모델 크기를 9~10배 줄인 이 기술은 온디바이스 AI의 무료·프라이빗 실행을 가능하게 할 수 있어 업계 판도를 바꿀 잠재력이 있다.
AI 연구소 PrismML이 아직 여러분의 관심 대상이 아니라면, 주목할 만하다. 거액의 투자를 유치해서가 아니라(아직은 2,225만 달러의 시드 라운드에 불과하다), 참여한 기술진의 역량과 업계를 바꿀 잠재력을 지닌 기술 때문이다. PrismML은 유능하고 고성능인 추론 대규모 언어모델(LLM)이 반드시 '대규모'일 필요는 없다고 베팅하고 있다. PC와 스마트폰에 들어갈 수 있을 만큼 작은 추론 모델을 만들고 있는 것이다. (애플과 협상 중이라는 소문도 있으나, CEO 바박 하시비(Babak Hassibi)는 테크크런치에 대해 이를 언급하기를 거부했다.)
목요일 PrismML은 모델 패밀리의 최신작인 'Bonsai 2 27B'를 공개했다. 이 모델은 알리바바의 널리 쓰이는 오픈소스 모델인 Qwen3.8 27B를 5.9GB로 압축한 것으로, PC는 물론 고성능 스마트폰에도 저장 가능한 크기다. 원본 대비 메모리 사용량이 9~10배 줄어든 것이다.
PrismML은 칼텍(Caltech) 연구진들이 창업했으며, 압축 기술 전문가이자 칼텍 교수인 하시비가 이끌고 있다. 이 스타트업의 자문으로는 아이온 스토이카(Ion Stoica)가 있다. 스토이카는 Databricks(외 다수 기업)의 공동 창업자이자 버클리의 유명한 Sky Computing Lab 소장으로, 이 연구소는 Letta부터 SGLang까지 수많은 기술과 스타트업을 배출했다. PrismML은 코슬라 벤처스, 케르베로스 캐피탈, 칼텍의 투자를 받고 있다.
LLM 압축 기술을 개발하는 회사는 PrismML만이 아니다. 스페인 도노스티아 국제물리센터의 저명한 교수가 창업한 Multiverse Computing도 있다. (그리고 Multiverse Computing은 거액의 자금을 조달했다.) 그러나 하시비는 PrismML의 압축 기술이 원본 대비 성능 손실이 사실상 없다는 점에서 독특하다고 말한다. Bonsai 2는 Qwen의 종합 벤치마크 점수의 98%를 달성한다. 이는 3월에 공개된 초대 Bonsai가 달성했던 95%에서 향상된 수치다. 회사에 따르면 초대 모델은 이미 1,100만 회 이상 다운로드되었으며, 더 작은 모델들도 추가로 260만 회 다운로드되었다. 이는 PrismML의 압축 결과가 릴리스를 거듭하며 개선되고 있음을 보여준다. 100% 벤치마크 성능 동등성에 도달할 수 있을지는 아직 미지수다. 하시비는 압축이 항상 어느 정도의 영향을 미칠 것이라고 말한다.
그래도 완벽한 벤치마크 동등성은 다소 이론적인 문제다. LLM은 비압축 상태에서도 그리 정확하지 않고, 벤치마크도 실제 작업을 완벽히 반영하지 못하기 때문에 2%의 성능 저하가 실제 사용에서 의미 있는 차이를 만들 가능성은 낮다. (게다가 모델을 둘러싼 소프트웨어, 즉 모델이 실행되는 '하니스'도 정확도에 큰 영향을 미친다.)
PrismML은 모델을 구성하는 '가중치(weights)'를 축소하는 방식으로 이를 달성한다고 설명한다. 가중치는 본질적으로 모델이 학습 중에 습득·저장하는 정보다. 일반적으로 각 가중치는 16비트를 필요로 하지만, PrismML의 '3진(ternary)' 가중치 접근 방식은 이를 +1, −1, 0 세 가지 값으로 단순화한다. 가중치당 저장해야 할 값이 훨씬 작아지면서 모델 크기가 극적으로 줄어드는 것이다. (압축 기법에 대한 더 깊은 내용은 프로젝트의 GitHub 페이지를 참고하라.)
이 스타트업의 다음 목표는 이 압축 기법을 더 큰 모델에 적용하는 것이다. 하시비는 테크크런치에 "앞으로 몇 달 내에 공개할 다음 모델들은 수천억 파라미터급이 될 것이며, 그 수준에서는 지능을 유지하기가 더 쉬울 것으로 기대한다"고 말했다. 모델 크기가 커질수록 "지능을 잃지 않고 압축할 여지가 더 많아진다. 그래서 일반적인 추세로서, 더 큰 모델일수록 100%에 도달하기가 더 쉽다"고 덧붙였다.
스토이카는 이 기술이 고급 모델을 사용자의 기기에서 실행할 수 있게 만들기 때문에 흥미진진하다고 말한다. "지성(intelligence)이 손끝에 있게 될 것이고, 이미 구매한 기기에서 실행되기 때문에 무료일 것이며, 데이터를 보내지 않기 때문에 프라이빗할 것이다."