NVIDIA는 Nemotron 3.5 Lightning 출시를 통해 에이전트형 AI 모델 영역을 한층 더 확장하고 있다. 이 새로운 오픈 모델은 이제 24시간 내내 운영되는 자율 AI 에이전트가 처리하는 상시 가동, 대량 작업에 특화되어 설계되었다. 이와 함께, 각 AI 요청을 가장 빠르고 저렴하게 처리할 수 있는 모델로 자동 라우팅하도록 설계된 오픈 소스 라우팅 도구인 NeMo Switchyard도 공개되었다. 이 두 가지 출시는 에이전트형 AI 시스템을 더 똑똑하게 만드는 것을 넘어, 대규모 운영에서도 진정으로 효율적으로 만들려는 NVIDIA의 최신 시도를 보여준다.
Summary
핵심 요약
- NVIDIA는 고용량 에이전트형 AI 워크로드를 위해 설계된 300억 개 파라미터의 오픈 Mixture-of-Experts 모델인 Nemotron 3.5 Lightning을 출시했다.
- 이 모델은 동급 모델 대비 최대 4배 빠른 출력 속도와 30% 더 빠른 작업 완료 속도를 제공한다.
- NVIDIA는 또한 오픈 소스 라우팅 라이브러리인 NeMo Switchyard를 출시했으며, 이를 통해 단일 최첨단 모델만 사용할 때와 비교해 작업 완료 비용을 거의 3분의 1 수준까지 줄일 수 있다.
- Nemotron 3.5 Lightning은 NVIDIA RTX PC, DGX Spark, DGX Station, Jetson에서 로컬로 실행되며, 데이터 센터와 클라우드로 확장할 수 있다.
- 두 출시는 모두 개방형이고 커스터마이즈 가능하며, CrowdStrike, Harvey, CodeRabbit, Lila Sciences 등 생태계 파트너들의 지원을 이미 받고 있다.
에이전트형 AI 워크로드를 위한 Nemotron 3.5 Lightning 출시
Nemotron 3.5 Lightning은 NVIDIA의 Nemotron 3 제품군에 새로 합류한 모델로, 회사는 이를 장시간 실행되는 에이전트형 작업에 대해 동급에서 가장 효율적인 모델이라고 설명한다. Nemotron 3 Nano 이후에 등장한 이 모델은 모든 Nemotron 출시에서 NVIDIA가 일관되게 보여 온 전략을 이어간다. 즉, 단순한 규모 확대보다 오픈 웨이트, 커스터마이즈 가능성, 순수 속도를 우선시하는 것이다.
속도를 위해 설계된 300억 개 파라미터 모델
Nemotron 3.5 Lightning은 300억 개 파라미터를 가진 Mixture-of-Experts 모델로, 매번 전체 모델을 실행하는 대신 주어진 작업에 필요한 네트워크 일부만 활성화한다. 이러한 설계 선택은 성능에 직접적으로 반영된다. NVIDIA에 따르면 이 모델은 최대 4배 빠른 출력 속도를 제공하며, 이는 동급 모델과 비교했을 때 에이전트형 작업 완료 속도 30% 향상으로 이어진다. NVIDIA가 인용한 내부 PinchBench 벤치마크에 따르면, 이러한 속도 향상은 동급 모델 대비 정확도를 희생하지 않고 달성된 것이다.
이 모델은 더 큰 멀티 에이전트 시스템 내에서 특정 역할을 수행하도록 설계되었다. 전체 워크플로를 스스로 계획하려 하기보다는, Nemotron 3.5 Lightning은 범위가 좁고 반복적이며 대량으로 발생하는 작업을 처리하도록 만들어졌다. 이는 에이전트가 가끔씩 들어오는 프롬프트에 응답하는 것이 아니라 지속적으로 실행될 때 빠르게 쌓이는 유형의 작업이다.
도메인 특화 정확도를 위한 커스터마이즈 및 사후 학습
Nemotron 3.5 Lightning은 오픈 모델이기 때문에, 조직은 NVIDIA NeMo를 사용해 자체 도메인 데이터, 내부 도구 및 워크플로를 기반으로 사후 학습을 수행할 수 있다. 이러한 오픈 AI 모델 커스터마이즈 가능성은 이번 출시에서 NVIDIA가 강조하는 핵심이다. 범용 모델 하나로 모든 것을 해결하려 하기보다는, 법률 계약서 파싱이든 보안 경보 탐지든 특정 업무에 맞게 모델을 조정할 수 있는 기반을 기업에 제공하는 것이다.
이미 여러 기업이 이를 실제로 적용하고 있다. CrowdStrike는 사이버 보안 워크로드에 맞게 모델을 커스터마이즈하고 있으며, Harvey는 Trajectory와 함께 법률 서비스 애플리케이션에 활용하고 있다. CodeRabbit은 Baseten과 결합해 자동 코드 리뷰에 사용하고 있다. Lila Sciences는 물리 및 생명 과학 작업 전반에서 추론 능력을 향상하는 데 이 모델을 활용하고 있으며, Fastino Labs는 소프트웨어 개발, 금융, 헬스케어 워크로드에 맞게 모델을 튜닝한 후 선도적인 정확도를 보고했다. NVIDIA는 이 모델이 Nemotron Coalition의 의견을 바탕으로 개발되었으며, 구성원들이 평가 방법론, 추론 소프트웨어, 데이터셋을 제공해 최종 출시 형태를 다듬는 데 기여했다고 설명한다.
NeMo Switchyard, AI 에이전트에 스마트 라우팅 제공
NeMo Switchyard는 에이전트형 시스템이 확장될수록 심각해지는 문제를 해결한다. 단일 기본 모델에 의존하면, 복잡한 추론이 필요 없는 작업에 과도한 비용을 쓰거나, 반대로 경량 모델에 과도한 부담을 줘 품질이 떨어지는 상황이 발생한다. NVIDIA의 해법은 각 요청마다 어떤 모델이 작업을 처리해야 할지 자동으로 결정하는 오픈 소스 라이브러리다.
동적 모델 선택을 통한 비용 절감
NeMo Switchyard는 에이전트 워크플로의 각 단계를, 해당 작업에 가장 적합하고 비용 효율적인 모델로 라우팅한다. 이 과정에서 개발자가 애플리케이션을 다시 작성할 필요는 없다. 개발자는 지연 시간, 품질, 비용 중 무엇을 가장 중시하는지에 따라 라우팅 알고리즘을 조정하거나 교체할 수 있다. NVIDIA의 내부 벤치마크에 따르면, NeMo Switchyard 라우팅 방식은 최첨단 모델에 근접한 정확도를 유지하면서도, 모든 작업을 Opus 4.8 하나로 처리할 때와 비교해 작업 완료 비용을 거의 3분의 1 수준으로 줄인다.
이 격차는 중요하다. 에이전트가 지속적으로 실행되는 시스템에서는, 지능적으로 라우팅하는 것과 단일 모델에 기본 설정으로 몰아넣는 것의 차이가 매일 수천 건의 작업에 누적되며, 겉보기에는 작은 효율성 향상이 시간이 지날수록 의미 있는 운영 비용 절감으로 이어진다.
AI 생태계 전반에 걸친 통합
NVIDIA는 이미 다양한 파트너와 협력해 이러한 라우팅 기능을 개발자들이 매일 사용하는 도구에 직접 통합하고 있다. 초기 생태계 협업 결과는 라우팅이 비용과 성능을 얼마나 크게 바꿀 수 있는지 잘 보여준다.
- Boomi는 트래픽의 59%를 5배 더 빠른 파인튜닝 모델로 보내면서도 100% 도메인 라우팅 정확도를 달성해, 이후 턴 지연 시간을 21% 단축했다.
- Cognition은 Devin Desktop에 단계적 라우터를 통합해, 모든 요청을 단일 최첨단 모델로 라우팅했을 때와 비교해 평균 비용을 28% 절감했다.
- LangChain은 145개의 멀티턴 Deep Agents 작업에서, 호출의 7%만 최첨단 모델로 보내고 6% 정확도 손실을 감수하는 대신 비용을 74% 절감했다.
- Ramp는 SWE-Bench 테스트에서 최첨단 모델과 동등한 성능을 유지하면서 비용을 58%, 실행 시간을 33% 줄였다.
- Classmethod는 opencode 및 Fireworks 워크로드 전반에서 품질을 유지하면서 비용을 27% 절감했다고 보고했다.
Kong, LiteLLM, Nous Research, Cadence, Siemens 또한 AI 게이트웨이부터 정형 칩 검증 및 엔지니어링 에이전트에 이르기까지 자체 플랫폼 내에서 NeMo Switchyard를 통합하거나 벤치마킹하고 있다.
NVIDIA 하드웨어 전반에 걸친 유연한 배포
이번 출시의 가장 큰 장점 중 하나는 Nemotron 3.5 Lightning이 실제로 어디에서 실행될 수 있는가 하는 점이다. 이 모델은 NVIDIA RTX PC, DGX Spark, DGX Station, Jetson 디바이스에서 로컬 및 클라우드 배포를 지원해, 모든 워크로드를 클라우드로 이전하지 않고도 조직이 이미 보유한 하드웨어를 활용할 수 있게 한다. 이후 RTX PRO 워크스테이션, 엣지 디바이스, 데이터 센터, 더 큰 엔터프라이즈 배포를 위한 완전한 클라우드 환경으로 확장할 수 있다.
이러한 유연성은 조직에 프라이버시와 지연 시간에 대한 실질적인 통제력을 제공한다. 모델을 로컬 또는 온프레미스에서 실행하면 빠른 응답과 더 엄격한 데이터 통제가 필요한 고용량, 특수화 작업에 적합하며, 수요에 따라 확장해야 하는 워크로드에는 클라우드 배포 옵션을 계속 활용할 수 있다.
오픈 데이터와 플랫폼 제공 현황
모든 Nemotron 출시와 마찬가지로, NVIDIA는 라이선스가 허용하는 한도 내에서 가능한 많은 학습 데이터와 기법을 공개해 외부 연구자들이 동일한 자료를 기반으로 다른 모델을 추적, 감사, 학습시킬 수 있도록 한다. Lightning과 함께, NVIDIA는 코딩 에이전트 작업을 위한 사후 학습에 사용된 에이전트형 강화 학습 데이터셋인 Nemotron-RL-Agentic-Terminal-Pivot을 공개하고 있다.
Nemotron 3.5 Lightning은 Hugging Face, ModelScope, OpenRouter에서 바로 이용 가능하며, NVIDIA NIM 마이크로서비스 형태로 build.nvidia.com에서도 제공된다. 더 넓은 접근성은 NVIDIA Cloud Partners, 사후 학습 플랫폼, 추가 클라우드 서비스 제공업체를 통해 확대될 예정이다. NeMo Switchyard는 현재 GitHub에서 이용 가능하며, 더 많은 파트너 플랫폼 지원이 곧 추가될 예정이다.
FAQ
Nemotron 3.5 Lightning은 무엇이며, 어떤 점이 다른가요?
Nemotron 3.5 Lightning은 고용량 에이전트형 AI 작업에 최적화된 300억 개 파라미터의 오픈 AI 모델로, 동급 모델 대비 최대 4배 빠른 출력과 30% 더 빠른 작업 완료 속도를 제공한다.
NeMo Switchyard는 AI 효율성을 어떻게 개선하나요?
NeMo Switchyard는 AI 요청을 가장 적합한 모델로 동적으로 라우팅하는 오픈 소스 라우팅 라이브러리로, 단일 모델에 의존할 때와 비교해 작업 완료 비용을 약 3분의 1 수준으로 줄여준다.
Nemotron 3.5 Lightning은 조직별 요구에 맞게 커스터마이즈할 수 있나요?
가능하다. Nemotron 3.5 Lightning은 NVIDIA NeMo를 사용해 조직 고유의 데이터로 사후 학습을 수행함으로써, 특수하고 도메인 특화된 작업에 대한 정확도를 향상시킬 수 있다.
Nemotron 3.5 Lightning은 어떤 플랫폼에서 배포할 수 있나요?
Nemotron 3.5 Lightning은 NVIDIA RTX PC, DGX 시스템, Jetson 및 엣지 디바이스에서 로컬 및 클라우드 배포를 지원하며, Hugging Face, ModelScope, OpenRouter, NVIDIA Cloud Partners 등 다양한 플랫폼에서 이용할 수 있다.
{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”Nemotron 3.5 Lightning은 무엇이며, 어떤 점이 다른가요?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Nemotron 3.5 Lightning은 고용량 에이전트형 AI 작업에 최적화된 300억 개 파라미터의 오픈 AI 모델로, 동급 모델 대비 최대 4배 빠른 출력과 30% 더 빠른 작업 완료 속도를 제공한다.”}},{“@type”:”Question”,”name”:”NeMo Switchyard는 AI 효율성을 어떻게 개선하나요?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”NeMo Switchyard는 AI 요청을 가장 적합한 모델로 동적으로 라우팅하는 오픈 소스 라우팅 라이브러리로, 단일 모델에 의존할 때와 비교해 작업 완료 비용을 약 3분의 1 수준으로 줄여준다.”}},{“@type”:”Question”,”name”:”Nemotron 3.5 Lightning은 조직별 요구에 맞게 커스터마이즈할 수 있나요?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”가능하다. Nemotron 3.5 Lightning은 NVIDIA NeMo를 사용해 조직 고유의 데이터로 사후 학습을 수행함으로써, 특수하고 도메인 특화된 작업에 대한 정확도를 향상시킬 수 있다.”}},{“@type”:”Question”,”name”:”Nemotron 3.5 Lightning은 어떤 플랫폼에서 배포할 수 있나요?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Nemotron 3.5 Lightning은 NVIDIA RTX PC, DGX 시스템, Jetson 및 엣지 디바이스에서 로컬 및 클라우드 배포를 지원하며, Hugging Face, ModelScope, OpenRouter, NVIDIA Cloud Partners 등 다양한 플랫폼에서 이용할 수 있다.”}}]}
이 기사는 인공지능의 도움을 받아 제작되었으며, 편집팀의 검수를 거쳤습니다.

