OpenAI가 Jev의 점심밥을 가로채려 한다
TypeSafe의 'Jev'는 AI 게이트웨이 역사상 가장 빠르게 채택된 모델이지만, OpenAI가 핵심 기술(로그확률 기반 분류)을 빠르게 복제해 기존 모델·에이전트에 통합할 수 있다는 분석이 제기되었다. 저자는 Jev가 결국 일반 LLM의 토큰 확률 분포를 활용한 분류기일 뿐이며, OpenAI는 이미 툴 호출 등에서 이 방식을 암묵적으로 사용해왔다고 지적한다. TypeSafe의 유일한 해자는 학습 데이터와 학습 프로세스라고 결론짓는다.
OpenAI가 Jev의 점심밥을 가로채려는가? TypeSafe의 Jev는 AI 업계를 뒤흔든 대규모 언어 모델(LLM)의 새로운 변형을 선보였다. Vercel에 따르면 "Jev는 AI 게이트웨이 역사상 그 어떤 모델보다 빠르게 채택되었다." ... 하지만 지평선에는 먹구름이 몰려오고 있다. OpenAI는 분명히 주목하고 있으며, 다음 수를 결정하고 있다. TypeSafe에 모든 행운을 빌지만, 그들이 정말로 약속을 실현한다면 OpenAI가 패스트팔로우(fast-follow)를 하기에 완벽한 위치에 있다는 점이 우려된다. 단지 Jev의 플래그십 제품을 복제하는 것뿐 아니라, 그 기능을 예정된 모델과 에이전트에 통합해 Jev가 재현할 수 없는 정말 유용한 새로운 동작을 제공할 수 있다.
핵심 논지는 다음과 같다. OpenAI는 수년간 자사 LLM을 암묵적 분류기로 사용해왔다. 다만 일반 분류 작업을 위해 학습시키지 않았고, 일반 분류를 독립 제품으로 패키징하지 않았을 뿐이다. OpenAI가 해당 학습을 재현할 수 있다면, 곧바로 Jev를 복제할 수 있을 것이다. 게다가 OpenAI는 이 새로운 분류기를 기존 모델과 에이전트 내부에 활용할 수 있는 위치에 있어, 빠른 모델 선택, 더 효율적인 사고, 더 나은 보안 가드레일, 그리고 전반적으로 더 똑똑하고 빠르고 저렴한 모델에 유용할 수 있다.
이 모든 것을 결정하는 핵심 요인은 TypeSafe가 자신들을 지킬 해자(moat)가 있는지 여부다. 내가 보는 가장 큰 해자는 TypeSafe의 학습 데이터와 학습 프로세스다.
옛 것이 다시 새로워지다 주장을 펼치기 전에, 내 가정을 밝히고 OpenAI의 관련 역사와 사례로 뒷받침하겠다. 나의 주요 가정은 Jev가 일반적인 대규모 언어 모델과 상당히 유사한 것을 사용한다는 것이다. 그 증거로, Latent Space는 초기 클론 다수가 실제로 LLM 기반이라고 보도했다.
핵심 아이디어는 이렇다. 상태(state)와 질문 집합이 주어지면, Jev의 LLM은 단일 토큰을 생성하거나, 더 정확히는 가능한 모든 다음 토큰에 대한 확률 분포를 생성한다. 그 한 단계에서 가능한 모든 토큰에 연결된 로그확률(logprobs)을 Jev가 반환해야 하는 형식으로 가공하는 것이다. (이후로는 편의상 "logprobs" 대신 "확률"이라고 부르겠다. 우리 목적상 서로 호환 가능하다.)
참/거짓(noul) 질문의 경우, Jev는 true와 false 단 두 토큰만 보고 나머지는 무시한 채, 두 확률을 정규화해 답이 참일 확률 하나로 만든다. 선택(CHOICE) 질문의 경우, 가능성 목록(예: A=happy, B=sad, C=angry, D=afraid)으로 프롬프트를 구성하고, 네 토큰의 상대적 확률을 살펴 전체 분포를 구축한 뒤 가장 높은 것을 승자로 선택한다. 이 선택 패턴은 내가 2025년에 쓴 '로그확률로 LLM 분류 강화하기(Supercharging LLM Classifications with Logprobs)'에서 다룬 것과 거의 동일하며, 파인튜닝 없이도 이미 가능성을 보여주었다. (한숨... 아이디어보다 실행이 중요하다는 말이 있었지.)
score 프리미티브는 깊이 생각해보지 않았지만, 같은 패턴의 변형일 것으로 추측한다. 이 글의 전제 중 하나는 OpenAI가 이 아이디어를 신속히 활용할 태세일 수 있다는 것이며, 그 방식을 이해하면 이 점이 더 명확해진다.
OpenAI는 최소한 툴 호출(tool calling) 도입 이래로 대규모 언어 모델을 암묵적으로 특수 분류기로 사용해왔다. 2024년 초에 나는 'Tool Invocation – GPT 유연성의 경이로움 시연'이라는 글을 썼는데, 거기서 GPT 모델이 도구를 호출할지 어떻게 결정하는지 정확히 드러내도록 유도했다. 다음은 내부적으로 채팅 세션이 어떻게 보이는지다. 사용자 메시지가 있고, 그다음 툴 호출 없는 어시스턴트 응답, 이어서 툴 호출이 포함된 사용자 메시지가 이어진다. 토큰 경계를 나타내도록 텍스트에 색을 입혔다. ChatML을 본 적이 없다면, 이는 OpenAI가 사용자-에이전트 대화 프롬프트를 구성하기 위해 도입한 내부 마크업 언어다. <|im_start|>와 <|im_end|>는 메시지의 경계를 나타내는 예약 토큰이며, <|im_start|> 바로 다음의 첫 토큰은 화자(user 또는 assistant)를 식별한다. <|im_ 바로 다음...