본문 바로가기

스마트팩토리2

수천만 개의 로그에서 장애 원인만 골라내는 법 — LLM 기반 AIOps와 로그 우선순위화 수천만 개의 로그에서 장애 원인만 골라내는 법 — LLM 기반 AIOps와 로그 우선순위화AI 데이터센터와 GPU 클러스터에서는 엄청난 양의 로그가 발생합니다. 문제는 로그가 많을수록 장애 분석이 쉬워지는 것이 아니라 오히려 핵심 신호가 정상 메시지에 묻힌다는 점입니다.로그가 너무 많다GPU 드라이버, CUDA, Kubernetes, 스토리지, 네트워크, 데이터베이스 등 수많은 계층이 동시에 로그를 생성합니다. 대부분은 정상 상태를 알리는 정보성 메시지이고 실제 장애를 직접 설명하는 로그는 일부에 불과합니다.LLM에 원시 로그를 넣을 수 없는 이유수십 GB의 로그를 그대로 LLM에 넣으면 컨텍스트 한계를 넘고 추론 시간과 GPU 메모리 사용량이 급증합니다. 특히 폐쇄망이나 제한된 GPU 환경에서는 ‘더 .. 2026. 9. 16.
AI 에이전트가 슈퍼컴퓨터를 직접 움직인다 — 과학 컴퓨팅의 새로운 운영 방식 AI 에이전트가 슈퍼컴퓨터를 직접 움직인다 — 과학 컴퓨팅의 새로운 운영 방식과학 컴퓨팅의 작업 방식은 오랫동안 사람이 배치 스크립트를 작성하고 자원을 선택하는 형태였습니다. 최근에는 LLM 기반 AI 에이전트가 목표를 이해하고 도구를 선택해 워크플로우 자체를 조립하는 방향으로 변하고 있습니다.그리드에서 컴퓨팅 연속체로그리드 컴퓨팅은 여러 지역의 슈퍼컴퓨터를 묶었고, 클라우드는 자원의 탄력성을, 엣지는 데이터 발생 지점 가까이의 연산을 가능하게 했습니다. 최근의 흐름은 이들을 따로 보지 않고 하나의 ‘Computing Continuum’으로 연결하는 것입니다. 데이터가 어디에서 생기고, 어디에서 처리하는 것이 가장 합리적인지에 따라 실행 위치가 바뀝니다.에이전트는 무엇을 하는가AI 에이전트는 단순한 챗봇.. 2026. 9. 16.