금일은 AI 서버에서 많이 사용되는 InfiniBand NDR에 대해서 알아보도록 하겠습니다.

 

#InfiniBand(#인피니밴드)란 용어는 It 관련 업계에 종사 하였다면 이미 알고 계시겠지만, NDR , NDR200 , NDR400 등 다양한 용어들이 있는데 이 NDR은 " Next Data Rate"의 약자로서 쉽게 말해 높은 대역폭의 고성능 네트워크 카드를 말 합니다.

 

주로 고성능 GPU 서버에서 많이 사용되며, 산출되는 데이터의 빠른 전송 및 내부 통신을 위해서 필수적인 네트워크 아답터 입니다.

 

이 인피니밴드의 대표적인 제품은 기존의 #Mellonex(#멜라녹스)기술이 기반이 되었습니다.

 

멜라녹스는 1999년에 시작된 기술로서, 서버 간 데이터 전송 및 I/O 병목을 해소하기 위해 개발되어 왔습니다.

 

같은 해인 1999년, NGIO 기술을 기반으로 설립되어 InfiniBand 솔루션 (어댑터, 스위치, 케이블 등)을 개발하며 빠르게 시장의 중심으로 떠올랐습니다

 

그 후, 2019년 3월, 엔비디아는 멜라녹스를 약 69억 달러에 인수하겠다고 발표했고, 2020년 4월에 공식적으로 인수를 완료했습니다

이 인수를 통해 엔비디아는 인피니밴드 기반 고성능 네트워킹 기술 및 제품 라인을 통합했으며, 이후 멜라녹스 브랜드는 점차 사라지고 엔비디아 네트워킹 사업부로 완전히 흡수되었습니다.

 

해당 기술을 모태로 하여 개발된 제품이 아래의 ConnectX 시리즈의 Smart Network Adapter  입니다.

 

 

ConnectX-7 Smart Adapter

 

 

 

인피니밴드의 역사는 꽤 오래 되었고 이 인피니밴드의 속도 계보(요약) 자료는 하기 참고 하시기 바랍니다.

InfiniBand 속도 계보 (요약)

최고등급                  설명                                                                                     대역폭 (예: 4 레인 기반)

SDR Single Data Rate 8 Gbit/s
DDR Double Data Rate 16 Gbit/s
QDR Quad Data Rate 32 Gbit/s
FDR Fourteen Data Rate 56 Gbit/s
EDR Enhanced Data Rate 100 Gbit/s
HDR High Data Rate 200 Gbit/s
NDR Next Data Rate 400 Gbit/s 이상




NDR을 지원하는 ConnectX-7 네트워크 카드

#ConnectX 시리즈는 #NVIDIA(#엔비디아)의 스마트네트워크 어댑터의 모델명 입니다.

위의 표에서와 같이 ConnextX-7 카드는

  • InfiniBand NDR (400 Gb/s) 또는 NDR200 (200 Gb/s) 모드를 지원합니다. 또한 PCIe Gen5 ×16 인터페이스를 갖추고 있으며, 최대 4개의 포트를 사용할 수 있습니다.
  • NDR 모드를 사용하는 경우 400 Gb/s 대역폭은 초고성능 컴퓨팅(HPC), AI, 초저지연 네트워크 환경에서 매우 유리합니다.
  • 높은 처리량뿐 아니라 RDMA 기반 통신, 병렬 처리 및 인-네트워크 컴퓨팅 가속 등에 최적화되어 있습니다

 

 

ConnectX-7 Adapter Specification

하드웨어 제조사에서 제공하는 기본 스펙은 하기와 같습니다.

 

100G , 200G , 400G를 전부 지원 하는 것을 알 수 있습니다.




왜 NDR을 지원하는 고성능 네트워크 카드를 사용 해야 하는가?

 

 

AI 및 HPC 데이터센터에서는 GPU 간 통신의 지연과 대역폭이 전체 시스템 성능을 결정하는 핵심 요소입니다.

따라서, 기존의 1G 또는 10G 네트워크로는 인프라에서 요구하는 트레픽을 감당하기 어려울 것이 현실 입니다.

 

NDR을 사용함으로 인해 얻게 되는 이익은..

1. 극도로 낮은 지연 시간 (Ultra‑Low Latency)

  • InfiniBand NDR는 end‑to‑end 지연이 약 2µs, 스위치 지연은 230ns 수준으로 측정되며, AI/ML 훈련 작업에서 GPU 간 초저지연 통신을 가능하게 합니다. 이는 모델 학습 및 추론 속도를 크게 향상시킵니다. 
  • Reddit 사용자도 GPU 클러스터 설계 시 Ethernet보다 InfiniBand가 훨씬 뛰어난 지연 성능을 제공한다고 강조했습니다.

2. 고대역폭 및 대규모 스케일링

  • ConnectX‑7와 Quantum-2 스위치 등을 활용하면 노드당 400Gb/s 연결을 활용한 거대 GPU 클러스터 구축이 가능합니다. 예컨대 3단 Fat‑Tree 토폴로지 기반으로 최대 65,000 GPU까지 지원 가능성이 제시되었습니다.
  • 높은 포트 밀도와 비차단 구조를 통해 대규모 병렬 AI 워크로드 처리에 적합한 네트워크를 구성할 수 있습니다.

3. 무손실 전송 및 RDMA 기반 효율적인 데이터 이동

  • InfiniBand는 credit‑based 흐름 제어로 진정한 무손실 네트워크 환경을 제공하며, 대규모 데이터 전송 시 신뢰성을 확보합니다.
  • RDMA (Remote Direct Memory Access) 기술을 통해 운영체제를 우회해 CPU 개입 없이 GPU 간 직접 메모리 접근이 가능, 대기 시간과 CPU 오버헤드를 줄여줍니다.

4. 인‑네트워크 컴퓨팅으로 오프로드 및 확장성 향상

  • **SHARP (Scalable Hierarchical Aggregation and Reduction Protocol)**을 비롯한 인-네트워크 컴퓨팅 기능은, Collective 연산과 데이터 집계 및 감소 작업을 네트워크 내에서 수행해 CPU 부담을 줄이고 성능을 높입니다.
  • Adaptive routing과 self‑healing topology는 네트워크 병목, 장애 대응 및 스케일 아웃을 원활하게 도와줍니다.

HPE 데이터센터 환경에서의 장점

  • HPE는 InfiniBand NDR 스위치 관련 문서를 제공하고 있으며, 이러한 제품들은 HPE의 고성능 서버 및 인프라와 호환됩니다.
  • HPE 스토리지 담당자들도 고성능 네트워킹이 AI 데이터센터 내 효율과 처리량 향상에 얼마나 중요한지 강조하고 있습니다. 

 

 

해당 내용을 요약하면 아래와 같습니다.

 

 

포스팅을 마치며..

금일은 AI 및 HPC등 고성능 서버에서 많이 사용되는 인피니밴드 (NDR) 에 대해서 알아 보았습니다.

 

현재 이 고성능 네트워크 카드의 시장은 엔비디아가 시장을 거의 독식하고 있는 상황 입니다.

 

그 이유는 장비의 기본 레퍼런스 레이아웃으로 지정이 되어 있는 경우가 많아서, 밴더는 다르더라도 네트워크 장치는 엔비디아의 제품을 사용해야 하는 경우가 대부분 이기 때문 입니다.

 

시장에서 한 기업의 독점체제가 되게 되면 기업이나 사용자 입장에서는 고가에 장비를 구매해야 하는 구조가 형성되기 때문에 전반적인 시장에 안좋은 영향을 주게 되는 것 같습니다.

 

다양한 기업들이 고성능 네트워크 장비를 공급해서 조금 더 다양한 성능좋은 제품들을 합리적인 가격에 구매가 가능하면 좋을 것 같습니다.

 

다음 포스팅에는 고성능 네트워크 카드에 사용되는 다양한 포트 규격에 대해서도 알아보는 시간을 갖도록 하겠습니다.

 

긴 포스팅을 봐주셔서 감사 합니다.

 

금일도 시원한 하루 되시기 바랍니다. ^^

 

 

감사 합니다.

+ Recent posts