세레브라스, 같은 칩으로 성능 2배 달성한 CS-4 공개
Cerebras가 기존 WSE-3 칩을 그대로 사용하면서 전력 공급과 냉각 개선을 통해 클럭 속도를 높여 CS-3 대비 2배 성능을 낸 CS-4 AI 가속기를 공개했습니다. 랙 단위 제품으로 사용자당 초당 최대 4,400 토큰을 처리하며, 엔비디아 GPU 기반 대비 최대 30배 빠르다고 주장합니다. OpenAI가 Codex Spark에 이 하드웨어를 사용하는 등 실제 도입 사례가 있다는 점에서 주목할 만합니다.
Cerebras가 새 AI 가속기 CS-4를 공개했으며, CEO 앤드류 펠드먼(Andrew Feldman)은 이를 업계에서 가장 빠른 시스템이라고 밝혔다. CS-4는 랙(rack) 단위 제품으로, 연산 장치, 전원, 냉각을 모두 갖춘 완전한 서버 캐비닛 형태로 데이터센터에 단일 유닛으로 설치된다. CS-4는 여전히 5nm WSE-3 칩을 사용하지만, 더 많은 전력과 개선된 냉각을 통해 클럭 속도를 높여 기존 CS-3 대비 성능을 두 배로 끌어올렸다. 하나의 랙에는 이전의 두 개 대신 세 개의 웨이퍼가 탑재되며, 사용자당 초당 최대 4,400 토큰을 처리할 수 있다. Cerebras에 따르면 이는 엔비디아 GPU 기반 시스템 대비 최대 30배 빠른 속도다. 메모리 용량은 웨이퍼당 44GB로 동일하게 유지된다. Cerebras는 조립 속도를 높이기 위한 새로운 모듈형 'Backpack' 설계를 도입했으며, AMD와 AWS Trainium 등 파트너를 통한 분리형 추론(disaggregated inference)도 함께 제공한다. SemiAnalysis 애널리스트들은 네트워킹 측면의 개선은 다소 미미하다고 평가했다. 더 자세한 내용은 Hot Chips 컨퍼런스에서 공개될 예정이다. Cerebras 하드웨어는 OpenAI의 Codex Spark 등에서 사용되고 있다.