데저트 앤트 랩스, 온디바이스에서 구동되는 초고속 로컬 AI 모델 공개
유럽의 AI 연구소 데저트 앤트 랩스(Desert Ant Labs)가 오디오·비전·텍스트용 소형 전문 모델 18종을 공개했습니다. 모든 모델은 기기에서 직접 실행되어 밀리초 단위로 응답하고 운영 비용이 없으며, 월 10만 대의 활성 기기까지 무료로 제공됩니다. 클라우드 API 비용과 프라이버시 문제를 해결하는 온디바이스 AI 접근법으로, 기존 클라우드 모델 대비 최대 10배 빠르고 에너지 소모도 크게 적습니다.
오늘 우리는 '온디바이스 인텔리전스'에 대한 확고한 철학을 가지고 유럽의 프론티어 AI 연구소인 데저트 앤트 랩스(Desert Ant Labs)를 출범시킵니다. 우리는 효율적인 인공지능의 최선의 길은 기기 자체에서 시작된다고 믿습니다. 우리는 오디오, 비전, 텍스트를 위한 소형 전문 모델들을 만들고 있습니다. 각 모델은 밀리초 단위로 응답하고 실행 비용이 전혀 들지 않아, 토큰 비용이나 추론 속도에 제한받지 않고 모든 제품 인터랙션에 인텔리전스를 심을 수 있습니다. 5년 된 스마트폰에서도 돌아갈 만큼 작고, 모든 프레임이나 키 입력에 사용할 수 있을 만큼 빠르며, 여러분이 이미 돈을 내고 쓰고 있는 API 호출보다 성능이 좋습니다.
첫 18개 모델(안정 버전 12개, 베타 6개)이 오늘부터 사용 가능하며, Swift, Kotlin, JavaScript용 단일 SDK로 접근할 수 있습니다. 하나의 모델이 하나의 작업을 담당하며, 각 모델은 해당 작업을 기기에서 가장 빠르게 수행하도록 설계되었습니다:
- Voz: 아이폰에서 10분짜리 오디오를 2초 만에 전사(트랜스크립션) — Whisper보다 4.7배 빠르며, 모든 단어에 시작·종료 시간 정보 포함
- Clear: 9MB 모델로 5분짜리 노트북 녹음을 1초 만에 스튜디오 품질 오디오로 변환
- Redact: 27개 언어로 이름, 주소, 카드 번호를 실시간으로 마스킹하여 서버에 절대 도달하지 않게 함
- Tongue: 2MB 모델로 단 세 단어만으로 84개 언어 식별
이 밖에도 몇 가지만 소개한 것이며, 나머지 14개 모델의 전체 스펙과 벤치마크는 desertant.com/models와 Hugging Face에서 확인할 수 있습니다. 모든 모델은 월 10만 대의 활성 기기까지 무료입니다. 토큰도, 로그인도 필요 없습니다.
우리는 '온디바이스'가 주권의 기본값인 유럽에서 이를 만들고 있습니다. 데이터는 고객의 손을 떠나지 않고, 기능은 타인의 클라우드에 의존하지 않으며, 업로드된 적 없는 데이터는 강제 제출될 수도 없습니다.
우리가 여기까지 온 과정
5년간 우리는 온디바이스 우선 접근법으로 비디오 앱 'Detail'을 만들어왔습니다. 하지만 짧은 클립을 자동 생성하는 Auto Edit이나 팟캐스트용 오디오 향상 같은 기능을 도입할 때는 클라우드 API에 의존해야 했습니다. Detail이 인기를 얻으면서 인프라 비용도 덩달아 늘어났습니다.
몇 달마다 유용한 온디바이스 모델을 찾아다녔습니다. Hugging Face를 뒤져 필러 워드(filler word)를 찾거나 녹음을 정리해줄 모델을 찾았죠. 매년 6월이면 훌륭한 새 도구들이 나왔지만 업계는 충분히 빠르게 움직이지 않았습니다. 기반은 이미 있었습니다. 칩, Core ML, 연구 결과물들이요. 없었던 것은 그 기반과 앱에 실제 기능을 구현하는 사이의 모든 것, 즉 몇 줄의 코드만 넣으면 바로 출시할 수 있는 모델이었습니다.
그래서 우리가 직접 모델을 학습시켰습니다. 알고 보니 모델 학습은 제품 디자인 문제였고, 제품이야말로 우리가 잘 아는 분야였습니다. 우리는 속도, 품질, 비용 면에서 클라우드 서비스를 능가하고, 작업 성능 면에서 다른 로컬·클라우드 모델을 크기의 일부만으로 앞서는 모델과 로컬 추론을 설계했습니다. Clear로 돌비(Dolby)를 대체해 더 좋고 빠른 오디오 향상을 구현했고, Voz로 온디바이스 전사 속도를 5배 높였습니다. 또한 Claude Sonnet을 Clips로 대체했습니다. 284MB 모델인 Clips는 10분짜리 영상을 5초 만에 12개의 클립으로 만들며, Sonnet보다 10배 빠르고 470배 적은 에너지를 쓰면서도 같은 품질을 냅니다. iOS 27과 함께 출시될 Detail 6은 모든 클라우드 API를 우리 자체 모델로 대체해 완전히 기기에서만 작동합니다.
우리 모두는 지난 몇 년간 LLM을 또 하나의 API처럼 여기며 개발해왔습니다. 그리고 범용 프론티어 브레인에 대한 과열 속에서, 그것이 유일한 선택지가 아니라는 사실을 거의 잊고 있었습니다. 제가 만나는 모든 개발자는 비용이 문제가 아니라면 만들고 싶은 온디바이스 모델 위시리스트를 갖고 있거나, 토큰을 쏟아붓고 있는 기능을 로컬 모델로 기꺼이 바꾸고 싶어합니다. 하루에 10만 번씩 같은 방식으로 실행되는 호출들 — 녹음 정리, 사진 태깅, 문장에서 날짜 추출, 텍스트가 서버에 도달하기 전 이름 가려내기. 이런 것들에는 프론티어 모델이 필요하지 않습니다. NVIDIA 연구진 자신도 에이전트 시스템 3개를 분석해 대형 모델 호출의 40~70%를 소형 전문 모델로 대체할 수 있다고 추정했습니다.
컴퓨팅 파워는 이미 결제되어 있다 (원문은 여기서 잘림)