제브(Jev): 기존 프런티어 모델보다 40~400배 저렴하고 20~200배 빠른 신규 모델 공개
TypeSafe AI가 2년간의 비공개 개발 끝에 소프트웨어가 직접 사용할 수 있는 빠르고 구조화된 의사결정에 특화된 새로운 모델 클래스 'System One Model'과 첫 공개 모델 'Jev'를 출시했다. Jev는 기존 LLM과 비슷한 수준의 지능을 유지하면서도 두 자릿수 배수(약 100배) 빠르고 효율적이며, 문자열 생성을 포기하는 대신 구조화된 출력에 최적화되어 환각(hallucination)이 원리적으로 불가능하다. 가격 투명성과 검증 가능한 성능 주장을 내세워 업계의 주목을 받고 있다.
TypeSafe, System One 모델 및 Jev 발표 (자세히 읽기: TypeSafe AI 선언문, 팀 소개, 대기자 등록)
회사 소식, 2026년 9월 14일: System One 모델 및 Jev 소개 작성자: Diogo Almeida, TypeSafe 창립자
모델은 수년 전부터 채팅에서는 이미 초인적인 수준이었습니다. 그렇다면 자동화는 어디에 있을까요? 이것이 저를 지난 4년간 이끌어온 핵심 질문이었습니다. 저는 OpenAI에서 언어 모델이 지시를 따르고 사람과 대화하는 데 유용해지도록 만든 방법론을 구축하는 일을 도왔고, 그 연구가 결국 ChatGPT의 기반이 되었습니다. 당시에는 채팅 모델이 AGI로 이어질 수도 있다고 생각했지만, 아무리 화려한 기대에도 불구하고 정말 중요한 무언가가 빠져 있다는 것이 저에게는 분명해졌습니다.
2년간의 은밀한(스텔스) 개발, 수많은 기술적 난제, 그리고 연구적 돌파구 끝에... 오늘 TypeSafe AI가 첫 번째 System One Model을 출시하게 된 것을 정말 흥분된 마음으로 발표합니다. System One Model은 소프트웨어가 직접 사용할 수 있는 빠르고 구조화된 의사결정을 내도록 설계된 새로운 클래스의 프런티어 모델입니다. 우리는 자동화에 전적으로 집중한 완전히 새로운 스택을 구축했습니다. 새로운 모델 아키텍처, 최대 효율을 위한 병렬 샘플러(parallel sampler), 그리고 '보정된 의사결정을 위한 강화학습(Reinforcement Learning for Calibrated Decisions, RLCD)'이라고 부르는 훈련 방법입니다.
첫 공개 모델은 Jev이며, 오늘 얼리 액세스로 이용할 수 있습니다. Jev는 System One 과제에서 기존 LLM과 비슷한 수준의 지능을 달성하면서도 두 자릿수 배수(약 100배) 더 빠르고 효율적입니다. Jev는 문자열 생성을 포기하는 대신 구조화된 출력에 최적화되어 있으며, 환각(hallucination)을 일으킬 수 없습니다. Jev를 '프런티어 지능 함수 호출'이라고 생각하시면 됩니다. 비구조화된 상태(state)가 입력되고, 타입이 지정된 확률적 의사결정이 출력됩니다.
놀라운 주장에는 놀라운 증거가 필요하니, 아래에서 그 증거들을 확인하세요.
기존의 그리고 새로운 프런티어 증거 / 기술적 결과
우리는 회의론자를 사랑하며, 우리 자신도 회의론자입니다. 쉽게 검증할 수 있는 주장들이 있습니다:
- 호출당 속도: 우리는 정말로 그만큼 빠릅니다. 다만 공개된 평가는 대부분 미 서해안(현재 서비스가 위치한 곳)의 노트북에서 실행되었습니다.
- 호출당 비용: 가격은 투명하게 공개합니다. 보조금을 받는 것이 아님을 증명할 수는 없으며, 가격의 지속 가능성은 장기적으로 입증해야 합니다(가격은 오르기보다 내려갈 것으로 예상합니다).
- 타입 오류 없음: 단 하나의 반례만으로도 쉽게 반증할 수 있지만, 수학적으로 불가능합니다.
더 대담한 주장에 대해서는 가능한 한 많은 세부 맥락을 제공하고자 합니다.
나란히 비교 시연 우리의 나란히 비교 데모는 우리 모델과 LLM의 핵심적 차이를 보여줍니다. Jev는 토큰별로 자기회귀적으로 생성하는 대신, 모든 확률을 병렬로 출력합니다. 문자열은 매우 강력하고 범용적이지만 비용이 큽니다. 문자열을 '포기'함으로써 오히려 많은 초능력을 얻었습니다!
세부 사항: TypeSafe 얼리 액세스 사용자를 위해 실제 쿼리를 공개합니다. 이 쿼리는 매우 단순화되었으며, 화면의 출력을 이해하기 쉽도록 설명적이고 사람이 읽을 수 있는 키를 가진 질문들을 선택했습니다. 상태(state)도 샘플링 방법론의 차이를 강조하기 위해 짧고 밀도 높고 상세한 문단으로 구성했습니다. 비교적 짧은 입력은 우리 모델에 유리하게 작용합니다. 눈썰미가 좋은 분이라면 알아차렸겠지만, 녹화된 실행에서 GPT-5.6 Terra와의 유일한 불일치는 '이탈 가능성 수준(Churn likelihood level)'입니다. 실제 정답은 우리에게도 정말 모호해 보입니다. 이 예시에서는 기본 추론 설정의 GPT-5.6 Terra를 사용했는데, 평균적으로 Jev와 지능 면에서 가장 비교 가능한 모델로 판단했기 때문입니다. 재미있는 사실: 비슷한 데모가 바로 우리가 System One Model 방향에 전력투구하기로 결심한 계기였습니다!
워크플로 평가 우리는 AI가 코드 안에서 얼마나 잘 작동하는지 측정하는 새로운 유형의 평가를 만들었습니다. 우리는 정답 분류에 최적화하지 않으며, 테스트 하네스(harness)와 모델이 변경되는 것을 허용합니다(하네스 엔지니어링을 통한 과적합 가능성도 열어둡니다). 대신 올바른 연산 그래프(코드로 표현된 '워크플로')가 존재한다고 가정하고, 가장 크고 똑똑하고 비싼 모델의 예측을 사용합니다...