Prefill1 LLM은 학습보다 ‘서빙’이 어렵다 — KV Cache와 Prefill·Decode 자원 관리 LLM은 학습보다 ‘서빙’이 어렵다 — KV Cache와 Prefill·Decode 자원 관리LLM을 서비스에 올리면 모델 정확도만큼 중요한 것이 응답 속도와 동시 처리량입니다. 같은 GPU에서도 메모리를 어떻게 관리하고 요청을 어떻게 스케줄링하느냐에 따라 서비스 품질이 크게 달라집니다.LLM 추론은 두 단계로 나뉜다사용자 입력을 한꺼번에 처리하는 Prefill 단계는 계산량이 크고 병렬성이 높습니다. 이후 토큰을 하나씩 생성하는 Decode 단계는 반복적으로 KV Cache를 읽으며 진행됩니다. 두 단계의 자원 사용 특성이 다르기 때문에 같은 방식으로 스케줄링하면 비효율이 발생합니다.KV Cache가 메모리를 먹는다LLM은 이전 토큰의 Attention 계산 결과를 KV Cache로 저장해 같은 계산을.. 2026. 9. 16. 이전 1 다음