GPU가 놀고 있는 진짜 이유 — 초거대 AI에서 네트워크가 병목이 되는 순간
수천 개 GPU를 연결했다고 해서 학습 속도가 GPU 수에 비례해 증가하지는 않습니다. 각 GPU가 계산한 결과를 계속 동기화해야 하기 때문에 네트워크가 느리면 GPU는 계산 대신 서로를 기다리게 됩니다.
AllReduce가 만드는 대기
분산 학습에서는 각 GPU가 계산한 Gradient를 매 스텝마다 동기화합니다. AllReduce 같은 집합 통신에서는 가장 느린 경로가 전체 속도를 결정하기 때문에 한 구간의 지연이 클러스터 전체의 유휴 시간으로 확대됩니다.
AI 트래픽은 버스트형이다
연산 중에는 네트워크 사용이 낮다가 동기화 시점에 트래픽이 한꺼번에 발생합니다. 여러 작업이 동시에 동기화를 시작하면 Incast와 큐 포화가 생기고, 짧은 시간에 혼잡이 집중되어 기존의 느린 제어 방식으로 대응하기 어렵습니다.
NVLink·InfiniBand·RDMA의 역할
NVLink는 노드 내부 GPU 사이의 고대역폭 연결에 강하고, InfiniBand는 노드 간 초저지연 네트워크를 구성하는 대표 기술입니다. RDMA는 CPU 개입을 줄여 메모리 간 직접 전송을 가능하게 합니다. 그러나 하드웨어가 빨라도 혼잡 제어와 작업 배치가 정적이면 버스트 트래픽 문제는 남습니다.
AI가 네트워크를 최적화한다
최근 연구는 강화학습과 머신러닝을 이용해 전송률, ECN/PFC 임계값, 라우팅 경로, Job 배치를 동적으로 조정합니다. 혼잡이 발생한 뒤 처리하는 것뿐 아니라 서로 간섭이 큰 작업을 미리 떨어뜨려 배치하는 방식도 연구되고 있습니다.
AI 최적화에도 비용이 있다
학습 기반 네트워크 제어는 실시간 추론 오버헤드, 설명 가능성, 일반화, 에너지 사용이라는 새로운 문제를 만듭니다. 그래서 실제 시스템에서는 기존의 검증된 정적 제어를 안전망으로 두고 AI가 보조적으로 최적화하는 형태가 현실적입니다.
제조 AI에서도 중요한 이유
여러 카메라와 GPU가 동시에 고해상도 영상을 처리하거나 여러 장비가 중앙 서버에 데이터를 올리는 환경에서도 네트워크 병목은 쉽게 발생합니다. 카메라 대수만 늘리기 전에 데이터 발생 패턴과 스위치, NIC, 저장 장치까지 포함한 전체 경로를 측정하는 습관이 필요합니다.
참고 자료
한국정보과학회, 정보과학회지 2026년 9월호 「AI 시대의 HPC 인프라와 시스템 기술」 특집을 바탕으로 블로그용으로 재구성했습니다.
한국정보과학회, 정보과학회지 2026년 9월호 「AI 시대의 HPC 인프라와 시스템 기술」 특집을 바탕으로 블로그용으로 재구성했습니다.
'시스템' 카테고리의 다른 글
| LLM은 학습보다 ‘서빙’이 어렵다 — KV Cache와 Prefill·Decode 자원 관리 (0) | 2026.09.16 |
|---|---|
| GPU를 비싸게 샀는데 왜 느릴까 — AI 파이프라인의 스토리지 I/O 병목 (0) | 2026.09.16 |
| 수천만 개의 로그에서 장애 원인만 골라내는 법 — LLM 기반 AIOps와 로그 우선순위화 (0) | 2026.09.16 |
| 생성형 AI의 진짜 핵심은 모델이 아니라 데이터 거버넌스다 (0) | 2026.09.16 |
| 상용 LLM과 로컬 LLM, 무엇을 써야 할까 — 정답은 ‘라우팅’이다 (0) | 2026.09.16 |