오픈AI '할라페뇨' 칩, 벤치마크서 최신 추론 칩 능가
오픈AI가 Hot Chips 컨퍼런스에서 브로드컴과 공동 개발한 자체 AI 추론 칩 '할라페뇨(Jalapeño)'의 첫 벤치마크 결과를 공개했다. SemiAnalysis의 InferenceX 벤치마크에서 엔비디아 블랙웰 대비 사용자당 토큰 수와 킬로와트당 처리량을 모두 앞섰으며, 2026년 말 소량 배포 후 2027년 본격 배포될 예정이다.
오픈AI는 화요일 Hot Chips 컨퍼런스에서 '할라페뇨(Jalapeño)'에 대한 보다 상세한 정보와 새 시스템의 첫 벤치마크 결과를 공개했다. SemiAnalysis의 InferenceX 벤치마크 테스트에서 할라페뇨는 현재 판매 중인 최고 수준의 추론 프로세서들보다 사용자당 더 많은 토큰을 처리했고, 킬로와트당 처리량도 더 높았다.
오픈AI의 하드웨어 총괄 리처드 호(Richard Ho)는 보도자료 브리핑에서 "결론적으로, 이 결과는 현존 최고 수준 대비 매우, 매우 큰 성능 향상을 보여준다"며 "할라페뇨는 단위 전력당 더 많은 AI 작업을 처리하면서 동시에 더 빠르게 응답을 반환한다. 많은 고객에게 서비스를 제공하는 데 매우 효율적이면서 동시에 매우 낮은 지연시간도 달성할 수 있다"고 말했다.
주목할 점은 이 비교가 엔비디아 블랙웰 시스템을 기준으로 한 것이지만, 할라페뇨가 전면 배치되는 시점에는 경쟁 제품도 상당히 발전했을 수 있다는 것이다. 호는 할라페뇨가 2026년 말 '아주 적은 물량'으로 배치되기 시작해 2027년에 본격적인 배치가 이뤄질 것으로 추정했다.
작년 10월 처음 발표된 할라페뇨는 오픈AI가 브로드컴과 긴밀히 협력해 개발했으며, 개발 과정에는 오픈AI 자체 모델도 활용됐다. 회사는 할라페뇨를 여러 세대에 걸친 플랫폼으로 만들 계획이며, 이를 통해 AI 제품, 모델, 칩, 메모리가 모두 유기적으로 함께 개발될 수 있다.
이러한 풀스택 방식 덕분에 오픈AI는 추론 처리 중 마찰을 일으키는 특정 단계들을 집중적으로 개선할 수 있었다. 특히 할라페뇨는 처리 과정에서 병목으로 작용하는 프리필(prefill)과 통신 단계의 지연을 최소화하도록 설계됐다.
오픈AI는 결과를 발표한 블로그 포스트에서 "우리는 데이터 이동과 통신 지연을 최소화하도록 할라페뇨를 설계했다"며 "이는 응답 생성 시 사용되는 KV 캐시를 포함한 모델 상태를 명시적으로 로컬에 배치·유지하면서, 시스템이 각 추론 단계마다 컴퓨팅·메모리·네트워킹의 적절한 조합을 활성화할 수 있음을 의미한다"고 설명했다.