반복영역 건너뛰기
주메뉴 바로가기
본문 바로가기
제품/서비스
EMS Solution
Features
클라우드 관리
서버관리
데이터베이스 관리
네트워크 관리
트래픽 관리
설비 IoT 관리
무선 AP 관리
교환기 관리
운영자동화
실시간 관리
백업 관리
스토리지 관리
예방 점검
APM Solution
애플리케이션 관리
URL 관리
브라우저 관리
ITSM Solution
서비스데스크
IT 서비스 관리
Big Data Solution
SIEM
AI 인공지능
Dashboard
대시보드
Consulting Service
컨설팅 서비스
고객
레퍼런스
고객FAQ
문의하기
가격
자료실
카탈로그
회사소개
비전·미션
연혁
2016~현재
2000~2015
인증서·수상
투자정보
재무정보
전자공고
IR자료
새소식
공고
보도자료
오시는 길
채용
피플
컬처
공고
FAQ
블로그
열기
메인 페이지로 이동
블로그
최신이야기
블로그
최신이야기
사람이야기
회사이야기
기술이야기
다양한이야기
[브레인저가 알려주는 IT#1] 네트워크 관리, SNMP가 뭔가요?
카프카를 통한 로그 관리 방법
김채욱
2023.09.19
페이스북 공유하기
트위터 공유하기
링크드인 공유하기
블로그 공유하기
메모리 누수 위험있는 FinalReference 참조 분석하기
안녕하세요! 저는 개발4그룹에서 제니우스(Zenius) SIEM의 로그 관리 기능 개발을 담당하고 있는 김채욱 입니다. 제가 하고 있는 일은 실시간으로 대용량 로그 데이터를 수집하여 분석 후, 사용자에게 가치 있는 정보를 시각화하여 보여주는 일입니다.
이번 글에서 다룰 내용은
1) 그동안 로그(Log)에 대해 조사한 것과 2) 최근에 CCDAK 카프카 자격증을 딴 기념으로, 카프카(Kafka)를 이용하여 어떻게 로그 관리를 하는지
에 대해 이야기해 보겠습니다.
PART1. 로그
1. 로그의 표면적 형태
로그(Log)는 기본적으로 시스템의 일련된 동작이나 사건의 기록입니다. 시스템의 일기장과도 같죠. 로그를 통해 특정 시간에 시스템에서 ‘어떤 일’이 일어났는지 파악할 수도 있습니다. 이렇게 로그는 시간에 따른 시스템의 동작을 기록하고, 정보는 순차적으로 저장됩니다.
이처럼
로그의 핵심 개념은 ‘시간’
입니다. 순차적으로 발생된 로그를 통해 시스템의 동작을 이해하며, 일종의 생활기록부 역할을 하죠. 시스템 내에서 어떤 행동이 발생하였고, 어떤 문제가 일어났으며, 유저와의 어떤 교류가 일어났는지 모두 알 수 있습니다.
만약 시간의 개념이 없다면 어떻게 될까요? 발생한 모든 일들이 뒤섞이며, 로그 해석을 하는데 어려움이 생기겠죠.
이처럼 로그를 통해 시스템은 과거의 변화를 추적합니다. 똑같은 상황이 주어지면 항상 같은 결과를 내놓는 ‘결정론적’인 동작을 보장할 수 있죠. 로그의 중요성, 이제 조금 이해가 되실까요?
2. 로그와 카프카의 관계
자, 그렇다면! 로그(Log)와 카프카(Kafka)는 어떤 관계일까요? 우선 카프카는 분산 스트리밍 플랫폼으로서, 실시간으로 대용량의 데이터를 처리하고 전송하는데 탁월한 성능을 자랑합니다. 그 중심에는 바로 ‘로그’라는 개념이 있는데요. 좀 더 자세히 짚고 넘어가 보겠습니다.
3. 카프카에서의 로그 시스템
카프카에서의 로그 시스템은, 단순히 시스템의 에러나 이벤트를 기록하는 것만이 아닙니다. 연속된 데이터 레코드들의 스트림을 의미하며, 이를 ‘토픽(Topic)’이라는 카테고리로 구분하죠. 각 토픽은 다시 *파티션(Partition)으로 나누어, 단일 혹은 여러 서버에 분산 저장됩니다. 이렇게 분산 저장되는 로그 데이터는, 높은 내구성과 가용성을 보장합니다.
*파티션(Partition): 하드디스크를 논리적으로 나눈 구역
4. 카프카가 로그를 사용하는 이유
로그의 순차적인 특성은 카프카의 ‘핵심 아키텍처’와 깊게 연결되어 있습니다. 로그를 사용하면,
데이터의 순서를 보장할 수 있어 대용량의 데이터 스트림을 효율적
으로 처리할 수 있기 때문이죠. 데이터를 ‘영구적’으로 저장할 수 있어,
데이터 손실 위험 또한 크게 줄어
듭니다.
로그를 사용하는 또 다른 이유는 ‘장애 복구’
입니다. 서버가 장애로 인해 중단되었다가 다시 시작되면, 저장된 로그를 이용하여 이전 상태로 복구할 수 있게 되죠. 이는 ‘카프카가 높은 가용성’을 보장하는 데 중요한 요소입니다.
∴
로그 요약
로그는 단순한 시스템 메시지를 넘어 ‘데이터 스트림’의 핵심 요소로 활용됩니다. 카프카와 같은 현대의 데이터 처리 시스템은
로그의 이러한 특성을 극대화하여, 대용량의 실시간 데이터 스트림을 효율적으로 처리
할 수 있는 거죠. 로그의 중요성을 다시 한번 깨닫게 되는 순간이네요!
PART2. 카프카
로그에 이어 에 대해 설명하겠습니다. 들어가기에 앞서 가볍게 ‘구조’부터 알아가 볼까요?
1. 카프카 구조
· 브로커(Broker)
브로커는 *클러스터(Cluster) 안에 구성된 여러 서버 중 각 서버를 의미합니다. 이러한 브로커들은, 레코드 형태인 메시지 데이터의 저장과 검색 및 컨슈머에게 전달하고 관리합니다.
*클러스터(Cluster): 여러 대의 컴퓨터들이 연결되어 하나의 시스템처럼 동작하는 컴퓨터들의 집합
데이터 분배와 중복성도 촉진합니다. 브로커에 문제가 발생하면, 데이터가 여러 브로커에 데이터가 복제되어 데이터 손실이 되지 않죠.
·
프로듀서(Producer)
프로듀서는 토픽에 레코드를 전송 또는 생성하는 *엔터티(Entity)입니다. 카프카 생태계에서 ‘데이터의 진입점’ 역할도 함께 하고 있죠. 레코드가 전송될 토픽 및 파티션도 결정할 수 있습니다.
*엔터티(Entity): 업무에 필요한 정보를 저장하고 관리하는 집합적인 것
·
컨슈머(Consumer)
컨슈머는 토픽에서 레코드를 읽습니다. 하나 이상의 토픽을 구독하고, 브로커로부터 레코드를 소비합니다. 데이터의 출구점을 나타내기도 하며, 프로듀서에 의해 전송된 메시지를 최종적으로 읽히고 처리되도록 합니다.
·
토픽(Topic)
토픽은 프로듀서로부터 전송된 레코드 카테고리입니다. 각 토픽은 파티션으로 나뉘며, 이 파티션은 브로커 간에 복제됩니다.
카프카로 들어오는 데이터를 조직화하고, 분류하는 방법을 제공하기도 합니다. 파티션으로 나눔으로써 카프카는 ‘수평 확장성과 장애 허용성’을 보장합니다.
·
주키퍼(ZooKeeper)
주키퍼는 브로커를 관리하고 조정하는 데 도움을 주는 ‘중앙 관리소’입니다. 클러스터 노드의 상태, 토픽 *메타데이터(Metadata) 등의 상태를 추적합니다.
*메타데이터(Metadata): 데이터에 관한 구조화된 데이터로, 다른 데이터를 설명해 주는 데이터
카프카는 분산 조정을 위해 주키퍼에 의존합니다. 주키퍼는 브로커에 문제가 발생하면, 다른 브로커에 알리고 클러스터 전체에 일관된 데이터를 보장하죠.
∴
카프카 구조 요약
요약한다면 카프카는
1) 복잡하지만 견고한 아키텍처 2) 대규모 스트림 데이터를 실시간으로 처리하는 데 있어 안정적이고 장애 허용성이 있음 3) 고도로 확장 가능한 플랫폼을 제공
으로 정리할 수 있습니다.
이처럼 카프카가 큰 데이터 환경에서 ‘어떻게’ 정보 흐름을 관리하고 최적화하는지 5가지의 구조를 통해 살펴보았습니다. 이제 카프카에 대해 조금 더 명확한 그림이 그려지지 않나요?
2. 컨슈머 그룹과 성능을 위한 탐색
카프카의 가장 주목할 만한 특징 중 하나는
‘컨슈머 그룹의 구현’
입니다. 이는 카프카의 확장성과 성능 잠재력을 이해하는 데 중심적인 개념이죠.
컨슈머 그룹 이해하기
카프카의 핵심은
‘메시지를 생산하고 소비’
하는 것입니다. 그런데 수백만, 심지어 수십억의 메시지가 흐르고 있을 때 어떻게 효율적으로 소비될까요?
여기서 컨슈머 그룹(Consumer Group)이 등장합니다. 컨슈머 그룹은, 하나 또는 그 이상의 컨슈머로 구성되어 하나 또는 여러 토픽에서 메시지를 소비하는데 협력합니다. 그렇다면 왜 효율적인지 알아보겠습니다.
·
로드 밸런싱:
하나의 컨슈머가 모든 메시지를 처리하는 대신, 그룹이 부하를 분산할 수 있습니다. 토픽의 각 파티션은 그룹 내에서 정확히 하나의 컨슈머에 의해 소비됩니다. 이는 메시지가 더 빠르고 효율적으로 처리된다는 것을 보장합니다.
·
장애 허용성:
컨슈머에 문제가 발생하면, 그룹 내의 다른 컨슈머가 그 파티션을 인수하여 메시지 처리에 차질이 없도록 합니다.
·
유연성:
데이터 흐름이 변함에 따라 그룹에서 컨슈머를 쉽게 추가하거나 제거합니다. 이에 따라 증가하거나 감소하는 부하를 처리할 수 있습니다.
여기까지는 최적의 성능을 위한 ‘카프카 튜닝 컨슈머 그룹의 기본 사항’을 다루었으니, 이와 관련된 ‘성능 튜닝 전략’에 대해 알아볼까요?
성능 튜닝 전략
·
파티션 전략:
토픽의 파티션 수는, 얼마나 많은 컨슈머가 활성화되어 메시지를 소비할 수 있는지 영향을 줍니다. 더 많은 파티션은 더 많은 컨슈머가 병렬로 작동할 수 있음을 의미하는 거죠. 그러나 너무 많은 파티션은 *오버헤드를 야기할 수 있습니다.
*오버헤드: 어떤 처리를 하기 위해 간접적인 처리 시간
·
컨슈머 구성:
*fetch.min.bytes 및 *fetch.max.wait.ms와 같은 매개변수를 조정합니다. 그다음 한 번에 얼마나 많은 데이터를 컨슈머가 가져오는지 제어합니다. 이러한 최적화를 통해 브로커에게 요청하는 횟수를 줄이고, 처리량을 높입니다.
*fetch.min.bytes: 한 번에 가져올 수 있는 최소 데이터 사이즈 *fetch.max.wait.ms: 데이터가 최소 크기가 될 때까지 기다릴 시간
·
메시지 배치:
프로듀서는 메시지를 함께 배치하여 처리량을 높일 수 있게 구성됩니다. *batch.size 및 *linger.ms와 같은 매개변수를 조정하여, 대기 시간과 처리량 사이의 균형을 찾을 수 있게 되죠.
*batch.size: 한 번에 모델이 학습하는 데이터 샘플의 개수 *linger.ms: 전송 대기 시간
·
압축:
카프카는 메시지 압축을 지원하여 전송 및 저장되는 데이터의 양을 줄입니다. 이로 인해 전송 속도가 빨라지고 전체 성능이 향상될 수 있습니다.
·
로그 정리 정책:
카프카 토픽은, 설정된 기간 또는 크기 동안 메시지를 유지할 수 있습니다. 보존 정책을 조정하면, 브로커가 저장 공간이 부족해지는 점과 성능이 저하되는 점을 방지할 수 있습니다.
3. 컨슈머 그룹과 성능을 위한 실제 코드 예시
다음 그림과 같은 코드를 보며 조금 더 자세히 살펴보겠습니다. NodeJS 코드 중 일부를 발췌했습니다. 카프카 설치 시에 사용되는 설정 파일 *server.properties에서 파티션의 개수를 CPU 코어 수와 같게 설정하는 코드입니다. 이에 대한 장점들을 쭉 살펴볼까요?
*server.properties: 마인크래프트 서버 옵션을 설정할 수 있는 파일
CPU 코어 수에 파티션 수를 맞추었을 때의 장점
·
최적화된 리소스 활용:
카프카에서는 각 파티션이 읽기와 쓰기를 위한 자체 *I/O(입출력) 스레드를 종종 운영합니다. 사용 가능한 CPU 코어 수와 파티션 수를 일치시키면, 각 코어가 특정 파티션의 I/O 작업을 처리합니다. 이 동시성은 리소스에서 최대의 성능을 추출하는 데 도움 됩니다.
·
최대 병렬 처리:
카프카의 설계 철학은 ‘병렬 데이터 처리’를 중심으로 합니다. 코어 수와 파티션 수 사이의 일치는, 동시에 처리되어 처리량을 높일 수 있습니다.
·
간소화된 용량 계획:
이 접근 방식은, 리소스 계획에 대한 명확한 기준을 제공합니다. 성능 병목이 발생하면 CPU에 *바인딩(Binding)되어 있는지 명확하게 알 수 있습니다. 인프라를 정확하게 조정할 수도 있게 되죠.
*바인딩(Binding): 두 프로그래밍 언어를 이어주는 래퍼 라이브러리
·
오버헤드 감소:
병렬 처리와 오버헤드 사이의 균형은 미묘합니다. 파티션 증가는 병렬 처리를 촉진할 수 있습니다. 하지만 더 많은 주키퍼 부하, 브로커 시작 시간 연장, 리더 선거 빈도 증가와 같은 오버헤드도 가져올 수도 있습니다. 파티션을 CPU 코어에 맞추는 것은 균형을 이룰 수 있게 합니다.
다음은 프로세스 수를 CPU 코어 수만큼 생성하여, 토픽의 파티션 개수와 일치시킨 코드에 대한 장점입니다.
파티션 수와 컨슈머 프로세스 수 일치의 장점
·
최적의 병렬 처리:
카프카 파티션의 각각은 동시에 처리될 수 있습니다. 컨슈머 수가 파티션 수와 일치하면, 각 컨슈머는 특정 파티션에서 메시지를 독립적으로 소비할 수 있게 되죠. 따라서 병렬 처리가 향상됩니다.
·
리소스 효율성:
파티션 수와 컨슈머 수가 일치하면, 각 컨슈머가 처리하는 데이터의 양이 균등하게 분배됩니다. 이로 인해 전체 시스템의 리소스 사용이 균형을 이루게 되죠.
·
탄력성과 확장성:
트래픽이 증가하면, 추가적인 컨슈머를 컨슈머 그룹에 추가하여 처리 능력을 증가시킵니다. 동일한 방식으로 트래픽이 감소하면 컨슈머를 줄여 리소스를 절약할 수 있습니다.
·
고가용성과 오류 회복:
컨슈머 중 하나가 실패하면, 해당 컨슈머가 처리하던 파티션은 다른 컨슈머에게 자동 재분배됩니다. 이를 통해 시스템 내의 다른 컨슈머가 실패한 컨슈머의 작업을 빠르게 인수하여, 메시지 처리가 중단되지 않습니다.
마지막으로 각 프로세스별 컨슈머를 생성해서 토픽에 구독 후, 소비하는 과정을 나타낸 소스코드입니다.
∴
컨슈머 그룹 요약
컨슈머 그룹은 높은 처리량과 장애 허용성 있는 메시지 소비를 제공하는 능력이 핵심입니다. 카프카가 어떤 식으로 운영되는지에 대한 상세한 부분을 이해하고 다양한 매개변수를 신중하게 조정한다면, 어떠한 상황에서도 카프카의 최대 성능을 이끌어낼 수 있습니다!
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
©
참고 자료
· Jay Kreps, “I Hearts Logs”, Confluent
· 위키피디아, “Logging(computing)”
· Confluent, “https://docs.confluent.io/kafka/overview.html”
· Neha Narkhede, Gwen Shapira, Todd Palino, “Kafka: The Definitive Guide”
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
#LOG
#로그
#카프카
#컨슈머
#KAFKA
#SIEM
#제니우스
김채욱
개발4그룹
실시간 대용량 로그 데이터의 수집 및 가공에 관심을 가지고 있습니다. 함께 발전해 나가는 개발을 추구합니다.
필진 글 더보기
목록으로
추천 콘텐츠
이전 슬라이드 보기
범정부 정보시스템 예방점검체계 대응 솔루션, Zenius GPM의 4가지 장점
범정부 정보시스템 예방점검체계 대응 솔루션, Zenius GPM의 4가지 장점
최근 디지털 행정서비스의 중요성이 날로 커짐에 따라 행정안전부는 범정부 정보시스템에 대한 예방점검 체계 도입을 의무화했습니다. 안정적인 서비스를 제공하기 위한 필수적인 조치이지만, 현장의 실무자들에게는 만만치 않은 도전이기도 합니다. 매일 약 120개에 달하는 점검 항목을 수동으로 확인하고 보고서를 작성하는 일은 업무 피로도를 높일 뿐만 아니라, 자칫 집중력 저하로 인한 점검 누락이나 데이터 오기입과 같은 인적 오류를 유발할 수 있기 때문입니다. Zenius GPM(Government Preventive Monitoring)은 이러한 현장의 어려움을 해결하고 보다 효율적인 모니터링 환경을 제공하기 위한 솔루션입니다. 행정안전부의 예방점검 매뉴얼을 충실히 시스템화하여 업무 효율성과 시스템 안정성을 동시에 잡은 Zenius GPM의 핵심 특장점 4가지를 자세히 살펴보겠습니다. 범정부 정보시스템 예방점검체계 대응 솔루션, Zenius GPM의 4가지 장점 1. 행정안전부 매뉴얼을 준수하는 자동 점검 체계 구현 Zenius GPM의 가장 큰 강점은 행정안전부가 규정한 '범정부 정보시스템 예방점검 매뉴얼'을 기반으로 설계되었다는 점입니다. 기존에는 관리자가 직접 서버나 장비에 접속하여 CPU, 메모리, 디스크 상태 등을 일일이 확인하는 수동 점검이 주를 이뤘습니다. 하지만 Zenius GPM은 매뉴얼에 명시된 약 120여 개의 필수 점검 항목을 시스템 내에 내재화하여, 서버, WEB, WAS, DBMS, 네트워크 장비 등 이기종 IT 자원에 대해 Agent의 수집기능과 명령어 수행을 통해 자동 점검을 수행합니다. 이러한 자동화는 단순히 편리함만을 제공하는 것이 아닙니다. 수작업 시 발생할 수 있는 점검 누락을 원천적으로 차단하고, 데이터를 수기로 입력하는 과정에서 생길 수 있는 실수를 방지하여 데이터의 신뢰성을 크게 높여줍니다. 또한, 단순히 점검을 수행하는 것에 그치지 않고 매뉴얼에 따른 표준 운영 절차를 시스템적으로 강제함으로써, 조직 전체가 일관된 기준에 따라 시스템을 관리할 수 있는 환경을 조성합니다. 이는 결과적으로 시스템 장애를 사전에 탐지하고 예방하는 데 큰 역할을 수행합니다. 2. 직관적인 통합 모니터링 뷰(Dashboard View) 제공 수많은 장비의 상태를 실시간으로 파악해야 하는 모니터링 업무에서 시각적인 직관성은 무엇보다 중요합니다. Zenius GPM은 방대한 점검 데이터를 시각화하여 관리자가 시스템의 전반적인 건강 상태를 한눈에 파악할 수 있는 통합 모니터링 뷰를 제공합니다. 일상점검 요약 대시보드를 통해 전체 IT 자원의 점검 현황을 종합적으로 보여주며, 정상, 이상의 상태를 색상(Color-coded)으로 명확히 구분하여 관리자가 직관적으로 상황을 인지할 수 있도록 돕습니다. 텍스트 위주의 나열식 화면이 아닌, 아이콘 차트와 그래프를 활용해 점검 진행률과 결과를 가시적으로 표현하기 때문에 관리자는 어떤 영역에서 문제가 발생했는지 즉각적으로 식별할 수 있습니다. 만약 요약 화면에서 이상 징후가 발견된다면, 클릭 한 번으로 상세 점검 결과 화면으로 이동하여 구체적인 원인을 파악할 수 있는 드릴다운(Drill-down) 기능을 지원합니다. 이러한 사용자 중심의 인터페이스는 문제 발생 시 대응 시간을 단축시키고 관제 업무의 효율을 높여줍니다. 3. 운영 환경에 최적화된 유연한 설정과 확장성 모든 기관의 IT 환경이 동일할 수는 없기에, 솔루션은 다양한 운영 환경을 수용할 수 있는 유연성을 갖춰야 합니다. Zenius GPM은 정해진 시간에 자동으로 점검을 수행하는 스케줄링 기능을 기본으로 제공하며, 장애가 의심되거나 긴급한 확인이 필요할 때는 언제든 관리자가 즉시 점검을 실행할 수 있는 온디맨드(On-demand) 기능을 지원합니다. 또한 Zenius GPM은 기본 제공되는 점검 항목을 그대로 사용하는 데 그치지 않고, 각 항목에 적용되는 점검 명령어와 판단 기준을 운영 환경에 맞게 조정할 수 있도록 설계되어 있습니다. 기관별 시스템 구성이나 운영 정책에 따라 비정상 패턴이나 임계치를 항목 단위로 개별 수정하거나, 필요 시 일괄 적용할 수 있어 점검 기준을 현실적인 수준으로 유지할 수 있습니다. 이를 통해 환경 특성과 맞지 않는 과도한 알람을 줄이고, 실제 운영에 의미 있는 이상 징후를 보다 정확하게 식별할 수 있습니다. 아울러 Zenius GPM은 Zenius EMS 프레임워크 기반 위에서 NMS, SMS, APM 등 다른 모니터링 솔루션과 유기적으로 연동될 수 있도록 구성되어 있습니다. 이를 통해 예방점검 결과를 기존 관제·모니터링 체계와 자연스럽게 연결하고, 점검과 관제를 아우르는 통합 IT 운영 관리 플랫폼으로 확장할 수 있습니다. 4. 보고서 작성 자동화 및 체계적인 이력 관리 실무자들이 가장 많은 시간을 할애하면서도 번거로워하는 업무 중 하나가 바로 보고서 작성입니다. Zenius GPM은 이 부분을 획기적으로 개선했습니다. 일상점검, 특별점검, 구조진단 등 행정안전부 기준 양식에 맞는 다양한 보고서 폼을 내장하고 있어, 시스템이 수집한 데이터를 바탕으로 클릭 몇 번이면 규격에 맞는 보고서를 자동으로 생성해 줍니다. 생성된 보고서는 시스템에 이력이 남게 되어 언제든 다시 조회하거나 다운로드할 수 있으며, 필요에 따라 점검 결과 리스트를 엑셀파일로 내보내는 기능을 지원하여 2차 가공이나 별도 보고 자료 작성 시에도 유용하게 활용할 수 있습니다. 축적된 점검 데이터와 보고서는 단순한 기록을 넘어 시스템의 장기적인 성능 추이를 분석하고, 향후 인프라 증설이나 개선 계획을 수립하는 데 있어 객관적인 근거 자료로 활용될 수 있어 데이터 기반의 의사결정을 강력하게 지원합니다. Zenius GPM은 단순한 모니터링 도구를 넘어, 복잡하고 반복적인 범정부 예방점검 업무를 시스템화하여 관리자가 보다 생산적이고 핵심적인 업무에 집중할 수 있도록 돕는 든든한 운영 파트너입니다. 표준화된 점검 체계를 통해 장애를 사전에 예방하고, 자동화를 통해 업무 효율을 높이고자 하는 담당자분들에게 Zenius GPM은 가장 확실한 해답이 될 것입니다. 이미 1,500여 개의 고객사에서 검증된 기술력을 바탕으로 여러분의 IT 운영 환경을 한 단계 더 발전시켜 보시기를 권해 드립니다. { "@context": "https://schema.org", "@type": "BlogPosting", "headline": "범정부 정보시스템 예방점검체계 대응 솔루션, Zenius GPM의 4가지 장점", "description": "행정안전부의 예방점검 매뉴얼을 시스템화하여 업무 효율성과 시스템 안정성을 높이는 Zenius GPM의 핵심 기능 4가지(자동 점검, 통합 뷰, 유연한 설정, 보고서 자동화)를 소개합니다.", "image": "https://www.brainz.co.kr/og_image/blog/436", "datePublished": "2025-12-11", "author": { "@type": "Person", "name": "차정환", "jobTitle": "차장", "description": "브레인즈컴퍼니의 마케팅과 브랜딩, 홍보를 총괄하고 있습니다." }, "publisher": { "@type": "Organization", "name": "브레인즈컴퍼니", "logo": { "@type": "ImageObject", "url": "https://www.brainz.co.kr/_html/images/layout/logo.svg" } }, "mainEntityOfPage": { "@type": "WebPage", "@id": "https://www.brainz.co.kr/recent-story/view/id/436" }, "articleBody": "Zenius GPM의 4가지 장점: 1. 행정안전부 매뉴얼을 준수하는 자동 점검 체계 구현 2. 직관적인 통합 모니터링 뷰(Dashboard View) 제공 3. 운영 환경에 최적화된 유연한 설정과 확장성 4. 보고서 작성 자동화 및 체계적인 이력 관리" }
2025.12.11
Zenius GPM으로 범정부 예방점검 WAS 일상점검 체계 구성하는 방법
Zenius GPM으로 범정부 예방점검 WAS 일상점검 체계 구성하는 방법
공공기관 정보시스템 운영에서 예방점검은 정해진 항목을 확인하는 데 그치지 않고, 시스템 상태를 지속적으로 점검하고 그 결과를 체계적으로 관리하기 위한 기본 운영 절차입니다. 특히 WAS(Web Application Server)는 웹 애플리케이션의 로직과 요청 처리를 담당하는 주요 구성요소인 만큼 CPU·메모리 사용률, JVM Heap Memory, Thread, DB Connection Pool 등 다양한 상태를 정기적으로 확인할 필요가 있습니다. 다만 점검해야 할 항목이 많고 시스템마다 확인 방식도 다르기 때문에, 담당자가 매번 항목별 상태를 직접 확인하고 결과를 기록하는 방식은 반복 업무를 늘리고 점검 결과 관리의 부담으로 이어질 수 있습니다. 따라서 예방점검 업무를 보다 일관되고 체계적으로 운영하려면, 점검 항목 설정부터 실행 결과 확인, 이력 관리, 보고까지 하나의 흐름으로 관리할 수 있는 전문 솔루션을 활용하는 것이 효과적입니다. Zenius GPM은 행정안전부의 범정부 정보시스템 예방점검 매뉴얼을 기반으로 WAS를 포함한 주요 IT 자원의 예방점검을 자동·수동 방식으로 수행하고, 점검 결과와 이력, 보고서를 함께 관리할 수 있도록 지원합니다. Zenius GPM을 활용해 예방점검 체계를 구성하기 위해서는 먼저 WAS 영역에서 어떤 항목을 점검하고, 각 항목이 어떤 상태를 확인하기 위한 것인지 살펴볼 필요가 있습니다. 범정부 예방점검의 WAS 점검 항목부터 확인해보겠습니다. WAS 예방점검에서는 어떤 항목을 확인할까? 범정부 정보시스템 예방점검체계에서는 WAS 영역에 대해 프로세스 CPU·메모리 사용률, JVM Heap Memory, Thread Pool, DB Connection Pool, Dump 파일 등 다양한 점검 항목을 제시하고 있습니다. 범정부 정보시스템 예방점검체계 WAS 영역 점검 항목 이처럼 WAS 예방점검은 단순히 애플리케이션의 동작 여부만 확인하는 것이 아니라, WAS 프로세스와 JVM 자원, Thread, DB Connection 등 서비스 운영에 영향을 줄 수 있는 여러 항목을 함께 살펴보는 것이 중요합니다. 또한 각 점검 항목마다 확인해야 하는 정보와 점검 방식이 다를 수 있기 때문에, 실제 운영 환경에서는 점검 대상과 항목을 먼저 구성하고 각 항목에 맞는 점검 방법과 판정 기준을 설정해야 합니다. Zenius GPM에서는 이러한 과정을 예방점검 기능 활성화부터 대상 및 항목 등록, 세부 설정, 결과 확인, 보고서 관리까지 단계적으로 구성할 수 있습니다. 이제 실제 화면을 통해 WAS 일상점검을 어떻게 설정하는지 살펴보겠습니다. Zenius GPM으로 WAS 일상점검 구성하기 WAS 일상점검은 대상 및 항목 등록, 세부 설정, 결과 확인, 보고서 관리 순으로 구성할 수 있습니다. 먼저 예방점검 기능을 활성화하는 단계부터 살펴보겠습니다. Step 1. WAS 일상점검 대상과 항목을 등록합니다: [예방점검 > 설정 > 일상점검] 일상점검 설정 화면에서 WAS에 적용할 점검 항목을 선택하고 대상 시스템을 지정합니다. - 분류: WAS - 대상: SMS 및 APM 인스턴스 선택 WAS 점검 항목 중에는 APM 정보뿐 아니라 OS단 정보가 필요한 항목도 포함되어 있기 때문에, 어떤 대상을 선택하느냐에 따라 일부 점검 항목의 처리 방식이 달라집니다. WAS 일상점검 대상 등록 화면 여기서 확인해야 할 부분은 APM만 선택한 경우와 SMS·APM을 함께 선택한 경우 OS단 점검 항목의 상태가 서로 다르게 표시된다는 점입니다. APM만 선택하면 OS단 점검 항목은 수동점검으로 전환됩니다 APM 인스턴스만 선택하면 OS단 점검 항목은 수동점검으로 전환됩니다. 해당 항목은 운영자가 점검 결과를 직접 확인하고 정상 여부를 판단하는 방식으로 운영됩니다. APM만 선택했을 때 수동점검으로 전환된 항목 SMS와 APM을 함께 선택하면 추가 설정이 필요한 항목을 확인할 수 있습니다 SMS와 APM 인스턴스를 함께 선택하면 OS단 점검 항목은 미완성(정보 확인 모드) 상태로 표시됩니다. 미완성으로 표시된 항목은 실제 운영 환경에 맞게 세부 설정을 진행해야 합니다. 첨부 원고 기준으로 이러한 항목은 SMS를 통해 점검하는 항목으로, 추가적인 수동 설정이 필요합니다. SMS·APM 동시 선택 시 점검 항목 상태 대상과 항목을 등록했다면, 다음으로 미완성 상태의 점검 항목을 실제 환경에 맞게 설정합니다. Step 2. 미완성 점검 항목을 운영 환경에 맞게 설정합니다: [예방점검 > 설정 > 일상점검] 미완성 상태로 표시된 항목은 실제 운영 환경에 맞게 점검 방식과 결과 판정 방식을 설정합니다. 점검 방법 - Zenius: Zenius에서 수집하는 데이터를 기반으로 점검합니다. - 전체 데이터 실행: 입력한 전체 명령어를 실행하여 점검합니다. 점검 결과 판정 방식 - 자동: 설정된 점검 기준에 따라 Zenius 시스템이 실행 결과의 정상 여부를 자동으로 판단합니다. - 수동: 운영자가 점검 결과를 직접 확인하고 정상 여부를 판단합니다. 또한 점검 결과에 포함할 내용도 항목별로 설정할 수 있습니다. 필요한 결과만 지정하거나 해당 점검에서 수집된 전체 내용을 결과로 활용하도록 구성할 수 있습니다. WAS 예방점검 항목 상세 설정 화면 이처럼 항목별 점검 방식과 판정 기준을 설정하면 실제 운영 환경에 맞는 WAS 일상점검 구성을 완료할 수 있습니다.설정이 끝났다면 이제 실제 예방점검 결과를 확인할 차례입니다. Step 3. WAS 일상점검 결과를 확인합니다: [예방점검 > 모니터링] 점검 항목 설정이 완료되면 예방점검을 실행한 뒤 결과를 확인합니다. Zenius GPM에서는 전체 점검 결과를 한눈에 확인하는 요약 화면과 항목별 결과를 상세하게 조회하는 화면을 함께 제공합니다. 따라서 전체 현황 확인 → 대상별 이력 확인 → 항목별 결과 확인 → 상세 내용 확인의 순서로 결과를 살펴볼 수 있습니다. 일상점검 요약에서 전체 결과를 확인합니다: [예방점검 > 모니터링 > 일상점검 요약] 일상점검 요약 화면에서는 WAS를 포함한 분류별 점검 결과와 점검 실행 현황을 한눈에 확인할 수 있습니다. 운영자는 먼저 전체 결과를 확인해 정상·이상 여부와 추가 확인이 필요한 대상이 있는지 파악할 수 있습니다. 일상점검 요약 화면 전체 현황에서 확인이 필요한 대상을 찾았다면 해당 대상의 실행 이력을 좀 더 구체적으로 살펴볼 수 있습니다. 대상별 점검 실행 이력을 확인합니다: [예방점검 > 모니터링 > 일상점검 요약] 요약 화면에서 특정 점검 또는 대상 항목을 클릭하면 해당 대상의 점검 실행 이력을 상세하게 확인할 수 있습니다. 이를 통해 대상별로 어떤 점검이 언제 수행되었는지와 해당 점검의 실행 이력을 확인할 수 있습니다. 점검 실행 이력 상세 화면 점검 실행 이력을 확인했다면 다음으로 개별 항목의 정상·이상 여부와 과거 결과를 확인합니다. 항목별 정상·이상 여부와 과거 이력을 확인합니다: [예방점검 > 모니터링 > 일상점검 현황] 일상점검 현황에서는 점검 항목별 정상·이상 여부를 확인할 수 있습니다. 또한 점검일을 선택하면 과거에 수행했던 예방점검 결과도 조회할 수 있습니다. 이를 통해 현재 결과뿐 아니라 과거 점검 이력도 함께 확인할 수 있어 시점별 상태를 비교하는 데 활용할 수 있습니다. 일상점검 항목별 결과 및 과거 이력 화면 특정 항목의 결과를 더 자세히 확인해야 한다면 개별 점검 결과 상세 화면으로 이동합니다. 개별 점검 결과의 상세 내용을 확인합니다: [예방점검 > 모니터링 > 일상점검 현황] 특정 점검 항목을 클릭하면 해당 항목의 점검 결과를 상세하게 확인할 수 있습니다. 단순히 정상·이상 여부만 확인하는 것이 아니라 실제 점검 결과와 세부 내용을 함께 확인할 수 있어 해당 항목의 상태를 보다 구체적으로 살펴볼 수 있습니다. 개별 예방점검 결과 상세 화면 이처럼 전체 결과에서 시작해 대상, 항목, 상세 결과까지 단계적으로 확인하면 필요한 점검 정보를 보다 체계적으로 살펴볼 수 있습니다. 점검 결과를 확인했다면 마지막으로 필요한 결과를 보고서로 정리하고 이력으로 관리할 수 있습니다. Step 4. 예방점검 보고서를 등록합니다: [예방점검 > 보고서 > 설정] 점검 결과를 정기적으로 관리하거나 공유해야 하는 경우 보고서 설정 기능을 활용할 수 있습니다. 보고서 설정 화면에서는 필요한 보고서 유형과 대상 등을 지정해 다양한 종류의 보고서를 등록할 수 있습니다. 이를 통해 일상점검 결과를 화면에서 확인하는 데 그치지 않고 이후 보고서 생성과 이력 관리로 이어질 수 있도록 사전에 보고서 유형을 구성할 수 있습니다. 예방점검 보고서 등록 화면 보고서 설정이 완료되면 등록한 내용을 기준으로 실제 보고서를 생성합니다. Step 5. 등록한 설정을 바탕으로 보고서를 생성합니다: [예방점검 > 보고서 > 설정] 등록한 보고서를 선택해 실제 보고서를 생성할 수 있습니다. 반복적인 예방점검 업무에서는 점검 결과를 확인하는 것뿐 아니라 결과를 일정한 형태로 정리하고 관리하는 과정도 중요합니다. Zenius GPM에서는 등록한 보고서를 기준으로 필요한 보고서를 생성할 수 있습니다. 예방점검 보고서 생성 화면 생성된 보고서는 이후 다시 확인할 수 있도록 생성 이력으로 관리됩니다. Step 6. 생성한 보고서와 과거 이력을 확인합니다: [예방점검 > 보고서 > 생성이력] 생성된 보고서는 생성이력 화면에서 확인할 수 있습니다. 운영자는 과거에 생성한 보고서의 이력을 조회하고 필요한 보고서 파일을 다시 확인할 수 있습니다. 이를 통해 예방점검 결과를 당일 확인하는 데 그치지 않고 시점별 보고서 이력을 지속적으로 관리할 수 있습니다. 예방점검 보고서 생성 이력 화면 여기까지가 Zenius GPM에서 WAS 일상점검을 구성하고, 결과를 확인한 뒤 보고서로 관리하는 기본 흐름입니다. 그렇다면 이러한 기능은 실제 운영 환경에서 어떤 경우에 활용할 수 있을까요? Zenius GPM의 WAS 예방점검 활용 케이스 Case 1. 범정부 예방점검 일상점검을 지속적으로 수행해야 하는 경우 범정부 정보시스템 예방점검 기준에 따라 일상점검을 수행해야 하는 환경에서는 반복적으로 여러 점검 항목을 확인하고 결과를 기록해야 합니다. Zenius GPM을 활용하면 설정한 예방점검 항목을 기준으로 자동·수동 점검을 수행하고, 일상점검 현황에서 결과를 한눈에 확인할 수 있습니다. 운영자가 매일 개별 항목을 직접 찾아 확인하는 부담을 줄이고, 필요한 항목을 중심으로 점검할 수 있어 예방점검 업무를 보다 체계적으로 수행할 수 있습니다. WAS 일상점검 결과 예시 Case 2. WAS의 주요 상태를 지속적으로 점검해야 하는 경우 WAS는 실제 웹 서비스 요청을 처리하는 주요 구성요소이기 때문에 장애 발생 이후 대응하는 것뿐 아니라 주요 상태를 지속적으로 점검하는 것이 중요합니다. Zenius GPM에서는 CPU·메모리, JVM Heap Memory, Thread, DB Connection Pool 등 WAS 운영과 관련된 주요 항목을 예방점검 항목으로 구성할 수 있습니다. 점검 결과의 정상·이상 여부와 과거 이력을 함께 확인할 수 있어 현재 상태뿐 아니라 이전 점검 결과도 함께 살펴볼 수 있습니다. 이를 통해 WAS 운영자는 일상점검 절차를 일정한 기준에 따라 수행하고, 필요한 항목을 중심으로 결과를 확인할 수 있습니다. 고객사 적용 사례 ○○원 예방점검 구축을 통한 범정부 예방점검 체계 구성 해당 기관은 범정부 정보시스템 예방점검 기준에 따라 WAS를 포함한 주요 IT 자원의 일상점검을 지속적으로 수행하고 관리할 수 있는 체계가 필요했습니다. Zenius GPM을 통해 예방점검 항목과 실행 방식을 구성하고, 점검 결과를 요약 화면과 상세 화면에서 확인할 수 있도록 운영 환경을 구축했습니다. 또한 과거 점검 이력과 보고서를 함께 관리함으로써 예방점검 결과 확인부터 이력 관리, 보고까지 하나의 흐름으로 수행할 수 있게 되었습니다. 반복 점검에서 체계적인 예방점검 운영으로 예방점검은 단순히 점검 항목을 확인하는 것보다 정해진 기준에 따라 지속적으로 실행하고, 결과와 이력을 체계적으로 관리하는 것이 중요합니다. Zenius GPM을 활용하면 범정부 예방점검 기준에 맞춰 WAS 일상점검을 구성하고, 점검 실행부터 결과 확인, 이력 관리, 보고서 생성까지 하나의 흐름으로 운영할 수 있습니다. 이를 통해 반복적인 점검 업무의 부담을 줄이고, 보다 체계적인 예방점검 환경을 구축할 수 있습니다.
2026.09.28
다음 슬라이드 보기