HPC네트워크1 GPU가 놀고 있는 진짜 이유 — 초거대 AI에서 네트워크가 병목이 되는 순간 GPU가 놀고 있는 진짜 이유 — 초거대 AI에서 네트워크가 병목이 되는 순간수천 개 GPU를 연결했다고 해서 학습 속도가 GPU 수에 비례해 증가하지는 않습니다. 각 GPU가 계산한 결과를 계속 동기화해야 하기 때문에 네트워크가 느리면 GPU는 계산 대신 서로를 기다리게 됩니다.AllReduce가 만드는 대기분산 학습에서는 각 GPU가 계산한 Gradient를 매 스텝마다 동기화합니다. AllReduce 같은 집합 통신에서는 가장 느린 경로가 전체 속도를 결정하기 때문에 한 구간의 지연이 클러스터 전체의 유휴 시간으로 확대됩니다.AI 트래픽은 버스트형이다연산 중에는 네트워크 사용이 낮다가 동기화 시점에 트래픽이 한꺼번에 발생합니다. 여러 작업이 동시에 동기화를 시작하면 Incast와 큐 포화가 생기고,.. 2026. 9. 16. 이전 1 다음