엔비디아, 최고 속도에 초점 맞춘 네모트론 3.5 라이트닝 공개
엔비디아가 에이전트 파이프라인의 빠른 처리 속도에 최적화된 오픈 웨이트 모델인 '네모트론 3.5 라이트닝(Nemotron 3.5 Lightning)'을 출시했습니다. 이 모델은 총 316억 개의 파라미터 중 매 순간 36억 개만 활성화하는 하이브리드 아키텍처를 통해, 동급 최고 수준의 초당 670 토큰(TPS) 추론 속도를 달성했습니다. 파라미터가 4배 많은 기존 모델들과 동등한 지능 지수를 유지하면서도 에이전트 벤치마크에서 압도적인 성능 향상을 보여주며 효율성의 새로운 기준을 제시했다는 점에서 중요합니다.
엔비디아의 새로운 오픈 웨이트 모델인 네모트론 3.5 라이트닝(Nemotron 3.5 Lightning)은 최고 수준의 지능보다는 속도를 우선시하는 컴팩트한 모델입니다. 이 모델은 파라미터의 1/4만 사용하면서도 지능 벤치마크에서 OpenAI의 gpt-oss-120b와 동등한 성능을 내며, 동급 모델 중 가장 빠른 추론 속도를 자랑합니다.
엔비디아는 새로운 네모트론 3.5 라인업의 첫 번째 모델인 네모트론 3.5 라이트닝을 출시했습니다. 이 모델은 네모트론 3 나노(Nano) 30B A3B의 직접적인 후속작으로 하이브리드 맘바-트랜스포머(Mamba-Transformer) 아키텍처를 유지하여, 총 316억 개의 파라미터 중 특정 시점에 36억 개만 활성화됩니다.
독립 벤치마크 플랫폼인 Artificial Analysis에 따르면, 이 모델은 지능 지수에서 24점을 기록해 전작(15점) 대비 9점이나 올랐습니다. 이는 OpenAI의 gpt-oss-120b(24점)와 동등한 수준이며, 약 4배 더 큰 엔비디아의 기존 모델인 네모트론 3 슈퍼(Super)(26점)에 근접한 성능입니다. 하지만 동일한 크기의 가장 똑똑한 소형 모델인 Qwen3.6 35B A3B(32점)와 메타(Meta)의 새로운 뮤즈 글리머(Muse Glimmer)(35점)는 여전히 확실한 우위를 점하고 있습니다.
엔비디아는 라이트닝을 통해 효율성의 새로운 지점을 공략하고 있습니다. 최종 NVFP4 가중치를 사용한 사전 출시 테스트에서 이 모델은 초당 거의 670 토큰에 도달했는데, 이는 비교된 모든 모델 중 가장 높은 처리량이며 구글의 제미나이(Gemini) 3.5 Flash-Lite(초당 386 토큰)보다 거의 두 배 빠른 속도입니다. 지능 지수 테스트의 하나의 작업을 완료하는 데 약 0.5분이 소요되는 반면, Qwen3.6 35B A3B는 약 3.5분, 젬마(Gemma) 4 31B는 대략 5.8분이 걸립니다.
독점 모델들은 여전히 전반적인 효율성 면에서 우위를 차지하고 있습니다. 제미나이 3.5 Flash-Lite는 작업당 비슷한 시간으로 지능 지수 37점을 기록했고, GPT-5.6 루나(Luna)(최대 모드)는 2분 미만의 시간에 52점에 도달했습니다.
Artificial Analysis에 따르면, 가장 큰 성능 향상은 에이전트 벤치마크(Agentic benchmarks)에서 나타납니다. GDPval-AA v2 테스트에서 라이트닝은 824의 엘로(Elo) 점수를 기록해 네모트론 3 나노 대비 334점이나 상승했습니다. 이는 gpt-oss-120b(800점)와 더 큰 네모트론 3 슈퍼(698점)를 모두 능가하는 수치입니다. Terminal-Bench v2.1에서는 점수가 7%에서 24.3%로 급증하며 26.2%를 기록한 gpt-oss-120b에 거의 필적합니다.
엔비디아는 이 모델을 관대한 OpenMDW-1.1 라이선스로 제공하며, 에이전트 기반 파이프라인을 위한 고처리량의 핵심 모델로 포지셔닝하고 있습니다. Artificial Analysis는 엔비디아가 특정 도메인의 성능을 높이기 위해 코드레빗(CodeRabbit) 및 하비(Harvey)와 같은 파트너들과 협력하여 훈련 후 작업을 진행했다고 전했습니다.
엔비디아는 이 모델을 BF16 및 NVFP4 가중치 형태로 모두 제공합니다. Artificial Analysis에 따르면, NVFP4 변형 모델 역시 더 높은 정밀도 버전과 비교해 최소한의 품질 저하만으로 지능 지수 24점을 기록했습니다. 이 추론 모델은 텍스트만 처리하며 100만 토큰의 컨텍스트 창을 지원합니다. 현재 가중치는 공개되었으며, 딥인프라(DeepInfra), 파이어웍스(Fireworks), 프렌들리AI(FriendliAI), 코어위브(CoreWeave), GMI 클라우드, 네비우스(Nebius), 크루소(Crusoe) 등에서 서버리스 추론을 제공하고 있습니다.
크기보다 효율성을 추구하는 엔비디아의 전략은 결코 새로운 것이 아닙니다. 작년에 큰 화제를 모은 논문에서 엔비디아의 연구원들은 100억 개 미만의 파라미터를 가진 모델이 700억~1750억 개의 파라미터를 가진 모델과 마찬가지로 대부분의 에이전트 작업을 처리할 수 있으며, 비용은 1/10에서 1/30 수준에 불과하다고 주장했습니다. 네모트론 3.5 라이트닝은 316억 개의 파라미터를 가지고 있지만 단계별로 36억 개만 활성화하므로 동일한 경량급에 속합니다.
초당 거의 670 토큰의 속도로 에이전트 벤치마크에서 gpt-oss-120b 및 더 큰 네모트론 3 슈퍼를 뛰어넘는 이 모델은 해당 논문의 주장을 제품 수준에서 증명하는 가장 명확한 사례입니다.