안녕하세요. 

주식회사 아인시스 아이엔씨 입니다.

 

최근 생성형 AI도입, GPU서버 구축, 데이터센터 확장 프로젝트가 증가하면서 100G, 200G, 400G 네트워크 환경에 대한 문의가 크게 늘고 있습니다.

많은 기업들이 고성능 네트워크 카드(NIC)와 최신 스위치를 도입하면 곧바로 성능이 향상될 것으로 기대합니다. 하지만 실제 구축 현장에서는 예상보다 낮은 성능이 나타나는 경우도 적지 않습니다.

 

서버 내부의 PCIe 대역폭, NIC 구성, 광모듈 규격, CPU와 메모리 구조까지 모두 균형을 이뤄야 비로소 네트워크가 제 성능을 발 휘할 수 있습니다.

 

오늘은 100G이상의 네트워크 구축 전 확인해야할 사항에 대하여 알아보겠습니다.

 

1. 외부 도로가 넓어도, 내부 고속도로 PCIe 먼저 선 확인 필요

 

 

초고속 네트워크 카드(NIC)는 서버 내부의 PCIe 슬롯에 장착됩니다.

외부 네트워크망이 시속 300km로 달릴 수 있는 '8차선 고속도로'라면, PCIe는 서버 내부(CPU/메모리)에서 그 고속도로로 진입하기 위한 'IC(인터체인지) 역할을 합니다.

최근 출시되는 4세대·5세대 인텔 제온 기반 서버들은 대부분 PCIe Gen5를 지원합니다. PCIe Gen5 Gen4 대비 2배의 대역폭을 제공하여 고성능 NIC, GPU, 스토리지 사용 시 발생할 수 있는 병목 현상을 크게 완화할 수 있습니다.

PCIe 세대 Lane 당 대역폭 x16 기준 총 대역폭
PCIe Gen3 약 1GB/s 약 16GB/s
PCIe Gen4 약 2GB/s 약 32GB/s
PCIe Gen5 약 4GB/s 약 64GB/s


다만 PCIe 세대만 확인해서는 안됩니다.

 

같은 Gen5 환경이라도 x8 슬롯과 x16 슬롯은 제공 가능한 대역폭이 크게 다르기 때문입니다.

예를  들어 400G NIC를 장착하더라도 PCIe Gen4 x8과 같이 대역폭이 충분하지 않은 슬롯을 사용할 경우 네트워크 성능이 제한될 수 있습니다.

 

 

 

 

2. 광모듈 규격도 함께 고려 필요

 

실제 네트워크 성능은 CPU, Memory, NIC, PCIe 대역폭 등 여러 요소가 함께 영향을 미칩니다.

이와 함께 광모듈 규격도 상응하는 스펙으로 맞추어 선택해야 합니다.

 

실제 현장에서는 네트워크 속도에 따라 다음과 같은 광모듈이 주로 사용됩니다.

네트워크 속도 대표 광모듈
10G SFP+
25G SFP28
100G QSFP28(SR4, LR4, CWDM4 등)
200G QSFP56
400G QSFP-DD, OSFP

 

네트워크 구축 시에는  NIC, 스위치, 케이블, 광모듈 하나의 체계로 검토해야 합니다.

업무 유형별 권장 PCIe 및 네트워크 구성

 

업무 유형 주요 서비스 권장 네트워크 대표 광모듈 권장 PCIe
일반 업무 서버 ERP, 그룹웨어, 웹서버
파일서버
10G ~ 25G SFP+ (10G),
SFP28 (25G)
PCIe Gen3 이상
가상화 및 중소규모
스토리지
VMware, Hyper-V, HCI 25G ~ 100G SFP28 (25G),
QSFP28 (100G)
PCIe Gen4 권장
대용량 DB 및 스토리지 Oracle, MSSQL, SAP HANA, NAS/SAN 25G ~ 100G QSFP28 (100G) PCIe Gen4 이상
AI 추론 LLM 서비스, 챗봇, AI 검색 100G ~ 200G QSFP28 (100G),
QSFP56 (200G)
PCIe Gen4 ~ Gen5
AI 학습 및 HPC GPU 클러스터, 분산 학습 200G ~ 400G 이상 QSFP56, QSFP-DD,
OSFP
PCIe Gen5 기반 구성권장

 

* 일반적인 구축 사례를 기준으로 한 권장 조합이며, 실제 환경에 따라 달라질 수 있습니다.

 

 

 

 

AI 환경에서는 RDMA도 중요합니다.

 

최근 AI 학습 및 추론 환경에서는 단순히 네트워크 속도만 높다고 성능이 향상되는 것은 아닙니다.

GPU 서버 간 대량의 데이터를 빠르게 전송하기 위해 RDMA(Remote Direct Memory Access) 기술이 널리 사용되고 있습니다.

 

 

 

RDMA는 CPU 개입을 최소화 하면서 원격 서버 메모리에 직접 접근할 수 있도록 지원합니다.

대표적으로 다음과 같은 기술이 활용됩니다.

 

RoCE(RDMA over Converged Ethernet)

InfiniBand

 

특히 대규모 LLM 학습 환경에서는 단순한 링크 속도보다 지연시간과 패킷 손실 관리가 더욱 중요한 요소가 될 수 있습니다.

 

같은 서버라도 슬롯 위치에 따라 성능이 달라질 수 있습니다.

현장에서 종종 발행하는 사례 중 하나가 NUMA 구조와 PCIe 슬롯 배치 문제입니다.

듀얼 CPU 서버에서는 특정 PCIe 슬롯이 특정 CPU 소켓과 연결되어 있습니다.

 

만약 고속 NIC GPU 또는 주요 애플리케이션이 사용하는 CPU와 다른 NUMA 노드에 연결되어 있다면 추가적인 메모리 접근이 발생하면서 성능 저하가 발생할 수 있습니다.

따라서 고성능 서버를 구축할 때는 단순히 슬롯이 비어 있는 곳에 장착하는 것이 아니라 CPU 토폴로지와 NUMA 구조까지 함께 검토하는 것이 중요합니다.

 

네트워크 성능의 핵심은 '균형'입니다.

 

많은 기업들이 네트워크 속도만 높이면 성능이 향상될 것으로 생각합니다.

하지만 실제 네트워크 성능은 가장 빠른 장비가 아니라 가장 느린 구간에 의해 결정됩니다.

고성능 NIC를 장착했더라도 PCIe 대역폭이 부족하면 병목이 발생합니다.

 

최신 GPU 서버를 구축했더라도 네트워크와 광모듈 구성이 이를 따라가지 못하면 전체 시스템 효율이 떨어집니다.

 

성공적인 인프라 구축을 위해서는 다음 네가지 요소를 함께 검토해야 합니다.

 

① PCIe 세대

② PCIe Lane 수( x8, x16)

③ 광모듈 규격

④ 실제 업무 환경과 워크로드

 

아인시스아이엔씨는 고객 환경에 맞는 서버, 스토리지, 네트워크 인프라를 설계하고 구축하며 최적의 성능을 확보할 수 있도록 지원하고 있습니다.

100G 이상 네트워크를 도입했음에도 기대한 성능이 나오지 않거나, 서버 교체 없이 NIC와 스위치만 업그레이드를 검토하고 계신다면 전체 인프라 구성을 함께 점검해 보시는 것을 권장 드립니다.

또한 AI 서버, GPU 서버, 고성능 스토리지 환경 구축 등 네트워크 성능 개선과 AI 인프라 도입을 검토하고 계시다면 언제든지 문의해 주시기 바랍니다.

 

오늘도 작은 도움이 되었기를 바라며 이 글을 마무리 합니다.

 

감사 합니다.

 

https://www.einsis.com/ko/contact-us

 

(주)아인시스아이엔씨

토탈IT서비스 전문기업, 서버/네트워크 유통 및 솔루션 공급

www.einsis.com

 

 

 

+ Recent posts