본문 바로가기

전체 글57

스테레오 Depth Camera로 고령자의 행동을 실시간 인식하는 방법 스테레오 Depth Camera로 고령자의 행동을 실시간 인식하는 방법— RGB 영상을 저장하지 않고도 사람의 위치·자세·행동을 인식하는 깊이 기반 비전 시스템고령화가 진행될수록 독거노인, 요양시설, 병원, 실버타운 등에서 사람의 행동을 지속적으로 관찰하고 위험 상황을 빠르게 파악하는 기술의 중요성이 커집니다. 그러나 일반 RGB 카메라는 사람의 얼굴과 생활 모습이 그대로 촬영되기 때문에 사생활 침해 문제가 항상 따라옵니다. 웨어러블 센서는 이런 문제를 피할 수 있지만 사용자가 항상 착용해야 하고, 센서를 벗어두거나 충전하지 않으면 시스템이 무력화됩니다.이번 글에서 살펴볼 논문은 이러한 문제를 해결하기 위해 스테레오 Depth Camera가 만들어내는 깊이 영상만을 사용해 고령자의 행동을 인식하는 방법을.. 2026. 9. 17.
임베디드기사 실기 20부작 11편 Best-Fit, Paging, Segmentation, Thrashing, Working Set으로 이해하는 Memory Management 임베디드기사 실기 20부작 11편Best-Fit, Paging, Segmentation, Thrashing, Working Set으로 이해하는 Memory Management지난 10편에서는 SRAM과 DRAM의 구조적 차이, Refresh, Cache와 Main Memory의 역할을 살펴보았습니다. 이번 11편에서는 한 단계 더 들어가 운영체제가 제한된 메모리를 어떻게 나누고, 주소를 변환하고, 부족한 메모리를 어떻게 버티며, 반대로 메모리 관리가 실패했을 때 왜 시스템 전체가 느려지는지 살펴보겠습니다.■ 1. 메모리 관리는 왜 필요한가?하나의 프로그램만 실행하는 단순한 시스템에서는 메모리를 거의 직접 배치해도 됩니다. 그러나 Linux 같은 운영체제에서는 여러 프로세스가 동시에 실행되고, 각 프로세스.. 2026. 9. 17.
AI와 HPC가 암호해독을 만났을 때 — 디지털 포렌식의 새로운 연구 현장 AI와 HPC가 암호해독을 만났을 때 — 디지털 포렌식의 새로운 연구 현장암호 기술은 개인정보와 시스템을 보호하는 핵심 수단이지만, 랜섬웨어나 범죄 증거 은닉에 사용될 경우 수사와 복구를 어렵게 만들 수 있습니다. 이때 AI와 HPC를 결합한 고속 암호해독 연구가 중요한 역할을 하게 됩니다.왜 HPC가 필요한가AES 같은 고비도 암호와 Scrypt·Argon2 같은 Memory-hard 구조는 무차별 대입 공격의 비용을 크게 높이도록 설계되어 있습니다. 단일 CPU나 GPU로는 현실적인 시간 안에 탐색이 어렵기 때문에 다중 GPU 병렬 처리와 효율적인 작업 분할이 필요합니다.암호 구조를 먼저 이해해야 한다무조건 많은 패스워드를 대입하는 것보다 파일이나 지갑이 실제로 어떤 키 생성 과정과 검증 구조를 사용.. 2026. 9. 16.
LLM은 학습보다 ‘서빙’이 어렵다 — KV Cache와 Prefill·Decode 자원 관리 LLM은 학습보다 ‘서빙’이 어렵다 — KV Cache와 Prefill·Decode 자원 관리LLM을 서비스에 올리면 모델 정확도만큼 중요한 것이 응답 속도와 동시 처리량입니다. 같은 GPU에서도 메모리를 어떻게 관리하고 요청을 어떻게 스케줄링하느냐에 따라 서비스 품질이 크게 달라집니다.LLM 추론은 두 단계로 나뉜다사용자 입력을 한꺼번에 처리하는 Prefill 단계는 계산량이 크고 병렬성이 높습니다. 이후 토큰을 하나씩 생성하는 Decode 단계는 반복적으로 KV Cache를 읽으며 진행됩니다. 두 단계의 자원 사용 특성이 다르기 때문에 같은 방식으로 스케줄링하면 비효율이 발생합니다.KV Cache가 메모리를 먹는다LLM은 이전 토큰의 Attention 계산 결과를 KV Cache로 저장해 같은 계산을.. 2026. 9. 16.
GPU를 비싸게 샀는데 왜 느릴까 — AI 파이프라인의 스토리지 I/O 병목 GPU를 비싸게 샀는데 왜 느릴까 — AI 파이프라인의 스토리지 I/O 병목AI 학습 시스템에서 GPU가 빠르다고 전체 학습이 빠른 것은 아닙니다. 데이터가 스토리지에서 GPU까지 제때 도착하지 않으면 GPU는 비싼 대기 장치가 됩니다.데이터 경로를 봐야 한다학습 데이터는 스토리지에서 읽혀 CPU에서 전처리되고 네트워크와 호스트 메모리를 거쳐 GPU로 전달됩니다. 이 과정에는 읽기, 디코딩, 메모리 복사, 전송이 연속적으로 발생합니다. 어느 한 단계라도 느리면 GPU 활용률이 떨어집니다.체크포인트도 거대한 I/O다대규모 모델은 장애 복구를 위해 파라미터와 옵티마이저 상태를 주기적으로 저장합니다. 너무 자주 저장하면 학습이 느려지고, 너무 드물게 저장하면 장애 시 손실이 커집니다. 또한 재시작 시 수많은 .. 2026. 9. 16.
GPU가 놀고 있는 진짜 이유 — 초거대 AI에서 네트워크가 병목이 되는 순간 GPU가 놀고 있는 진짜 이유 — 초거대 AI에서 네트워크가 병목이 되는 순간수천 개 GPU를 연결했다고 해서 학습 속도가 GPU 수에 비례해 증가하지는 않습니다. 각 GPU가 계산한 결과를 계속 동기화해야 하기 때문에 네트워크가 느리면 GPU는 계산 대신 서로를 기다리게 됩니다.AllReduce가 만드는 대기분산 학습에서는 각 GPU가 계산한 Gradient를 매 스텝마다 동기화합니다. AllReduce 같은 집합 통신에서는 가장 느린 경로가 전체 속도를 결정하기 때문에 한 구간의 지연이 클러스터 전체의 유휴 시간으로 확대됩니다.AI 트래픽은 버스트형이다연산 중에는 네트워크 사용이 낮다가 동기화 시점에 트래픽이 한꺼번에 발생합니다. 여러 작업이 동시에 동기화를 시작하면 Incast와 큐 포화가 생기고,.. 2026. 9. 16.