‘프러버블리’, 환각 없는 고정밀 AI 구축 위해 900만 달러 유치
AI 스타트업 '프러버블리(Probably)'는 엄격한 검증 시스템을 통해 LLM의 환각을 방지하고 99.99%의 정확도를 달성하는 기술을 개발 중입니다. 이 회사는 '데이터 과학 메카 수트'라고 부르는 정교한 엔지니어링 시스템을 도입해, 최첨단 AI 모델보다 성능이 낮은 모델을 사용하면서도 로컬 하드웨어에서 빠르고 저렴하게 작동하는 데이터 분석 도구를 구축했습니다. 이를 통해 증가하는 토큰 비용을 획기적으로 줄이며, 향후 회계, 의료 등 오류가 용납되지 않는 정밀 산업군으로 확장할 계획입니다.
LLM(대형 언어 모델)이 더욱 강력해짐에 따라, 환각(허구 정보 생성) 현상은 피하기가 몹시 까다로운 문제로 드러났다. 가장 똑똑한 모델에서도 오류가 발생하며, 이러한 오류를 잡아낼 방법이 있긴 하지만 업계는 여전히 최적의 접근법을 찾아 고민하고 있다.
안드레센 호로위츠(Andreessen Horowitz)로부터 시드 펀딩 900만 달러를 방금 유치한 스타트업 '프러버블리(Probably)'는 이러한 오류를 잡아내기 위해 한층 더 엄격하고 체계적인 방법을 구축하려 한다. 창립자 피터 엘리아스(Peter Elias)의 말에 따르면, 회사의 목표는 환각이나 단순한 사실적 오류가 사용자에게 전달되는 것을 원천적으로 차단하고, 결정론적 시스템에서는 흔하지만 AI에서는 달성하기 매우 어려운 99.99%의 정확도를 실현하는 것이다.
결국 LLM을 그 수준의 정확도로 끌어올리기 위해서는 AI 엔지니어링의 기본적인 가정들을 상당 부분 재고해야 한다는 사실이 밝혀졌다. 프러버블리의 첫 제품은 복잡한 데이터 세트에서 빠르게 답변을 도출하도록 설계된 데이터 과학 도구다. 각 결과물에는 출처와 도출 과정을 보여주는 감사 추적(audit trail)이 함께 제공되는데, 이는 AI 도구들 사이에서 점점 일반화되는 유용한 기능이다.
하지만 요약본에 오류가 스며드는 것을 막기 위해서는 엘리아스가 '데이터 과학 메카 수트(mech suit)'라고 부르는 정교한 '하네스(harness)' 시스템이 필요했다. LLM이 내놓은 1차 답변은 결정론적 검증 시스템과 대조되며, 데이터 세트와 일치하지 않는 결과는 모두 튕겨져 나간다. 무엇보다 중요한 점은, LLM이 이 검증 시스템에 맞춰 학습되었으며 시스템 전체가 빠르고 정확한 답변을 내도록 최적화되었다는 것이다.
엘리아스는 "이 과정을 통해 우리가 배운 것은, 하네스 엔지니어링이 튼튼할수록 더 약한 모델을 사용해도 된다는 점"이라며 "문맥을 충분히 정제할 수 있다면, 모델이 올바른 답을 내기 위해 그렇게까지 고생할 필요가 없다. 기본적으로 이는 모호성을 줄이는 작업"이라고 설명했다.
이러한 접근 덕분에 프러버블리의 데이터 과학 도구는 훨씬 더 작은 AI 모델로 작동할 수 있다. 엘리아스에 따르면 현재 버전은 "최첨단 모델보다 4단계 낮은" 모델로 구동 중이며, 이는 데이터 센터 대신 로컬 하드웨어(예: 개인용 데스크톱 컴퓨터)에서 실행할 수 있음을 의미한다. 결과적으로 AI 사용 시 발생하는 막대한 토큰 비용을 크게 줄일 수 있다.
토큰 비용이 지속적으로 상승하고 수많은 고객들이 AI 예산을 재검토하고 있는 시점에서, 이는 매우 환영받을 만한 아이디어다. 또한 엘리아스의 구상은 데이터 과학에만 그치지 않는다. 동일한 핵심 엔진을 회계나 의료 서비스와 같은 분야로 확장할 수 있기 때문이다. 그의 표현을 빌리자면, "정확도가 절대적으로 중요한 모든 사용 사례(any precision-sensitive use case)"에 적용할 수 있다.
"대형 AI 연구소들이 이런 시도조차 하지 않았다는 사실이 정말 흥미롭습니다."라고 엘리아스는 말한다. "그들은 이런 식으로 돈을 벌 인센티브가 없습니다. 여러분이 모델의 오류를 교정하기 위해 몇 번이나 다시 질문할수록 그들이 돈을 벌기 때문입니다."
주제: AI, 안드레센 호로위츠, 환각 현상, 프러버블리(Probably)
당사 기사 내의 링크를 통해 구매를 하실 경우, 소정의 수수료를 지급받을 수 있습니다. 이는 당사의 편집 독립성에는 영향을 미치지 않습니다.
러셀 브랜덤(Russell Brandom), AI 에디터 러셀 브랜덤은 2012년부터 플랫폼 정책과 신흥 기술을 중심으로 기술 산업을 취재해 왔습니다. 이전에 The Verge와 Rest of World에서 일했으며, Wired, The Awl, MIT Technology Review에 글을 기고했습니다. 연락처: russell.brandom@techcrunch.com 또는 Signal(412-401-5489). 작성자 약력 보기
6월 18일, 로스앤젤레스 Mach Industries, Founders Fund, Shinkei Systems의 리더들로부터 규모를 확장하고 성공하는 방법에 대한 생생한 내부자 인사이트를 들어보세요. 솔직한 대담한 대화(fireside chat)와 영향력 있는 네트워킹을 통해 귀중한 통찰력과 새로운 인맥을 얻어가실 수 있습니다. 지금 등록하세요.
가장 인기 있는 기사
- AI 해고 물결이 화약고처럼 번지고 있다 - 코니 로이조스(Connie Loizos)
- 아마존 CEO, 정부 제재 이전에 이미 앤스로픽(Anthropic) 모델 문제를 제기했다는 보도 - 앤서니 하(Anthony Ha)
- FBI, 실제 사이버 공격을 시뮬레이션하기 위해 자체 가상 소도시를 건설했다 - 잭 휘태커(Zack Whittaker)
- 메타(Meta)의 출범한 지 몇 달밖에 안 된 AI 부서, 그 안에 갇힌 엔지니어들이 말하는 '영혼을 말아먹는 굴라크' - 코니 로이조스(Connie Loizos)
- 제프 베조스의 프로메테우스(Prometheus), 물리적 세계를 위한 '인공 일반 엔지니어' 구축을 위해 120억 달러 유치 - 마리나 테킨(Marina Temkin)
- 사이버 보안 연구원들, 앤스로픽(Anthropic)의 Fable 가이드라인에 불만 - 로렌조 프란체스키-비키에라이(Lorenzo Franceschi-Bicchierai)