반복영역 건너뛰기
주메뉴 바로가기
본문 바로가기
제품/서비스
EMS Solution
Features
클라우드 관리
서버관리
데이터베이스 관리
네트워크 관리
트래픽 관리
설비 IoT 관리
무선 AP 관리
교환기 관리
운영자동화
실시간 관리
백업 관리
스토리지 관리
예방 점검
APM Solution
애플리케이션 관리
URL 관리
브라우저 관리
ITSM Solution
서비스데스크
IT 서비스 관리
Big Data Solution
SIEM
AI 인공지능
Dashboard
대시보드
Consulting Service
컨설팅 서비스
고객
레퍼런스
고객FAQ
문의하기
가격
자료실
카탈로그
회사소개
비전·미션
연혁
2016~현재
2000~2015
인증서·수상
투자정보
재무정보
전자공고
IR자료
새소식
공고
보도자료
오시는 길
채용
피플
컬처
공고
FAQ
블로그
열기
메인 페이지로 이동
블로그
기술이야기
블로그
최신이야기
사람이야기
회사이야기
기술이야기
다양한이야기
카프카를 통한 로그 관리 방법
메모리 누수 위험있는 FinalReference 참조 분석하기
김진광
2023.10.12
페이스북 공유하기
트위터 공유하기
링크드인 공유하기
블로그 공유하기
[행사] 브레인즈컴퍼니 ‘가을문화행사 2023’
Java에서 가장 많이 접하는 문제는 무엇이라 생각하시나요? 바로 리소스 부족 특히 ‘JVM(Java Virtual Machine) 메모리 부족 오류’가 아닐까 생각해요.
메모리 부족 원인에는 우리가 일반적으로 자주 접하는 누수, 긴 생명주기, 다량의 데이터 처리 등 몇 가지 패턴들이 있는데요. 오늘은 좀 일반적이지 않은(?) 유형에 대해 이야기해 볼게요!
Java 객체 참조 시스템은 강력한 참조 외에도 4가지 참조를 구현해요. 바로 성능과 확장성 기타 고려사항에 대한 SoftReference, WeakReference, PhantomReference, FinalReference이죠. 이번 포스팅은
FinalReference를 대표적인 사례
로 다루어 볼게요.
PART1. 분석툴을 활용해 메모리 누수 발생 원인 파악하기
메모리 분석 도구를 통해 힙 덤프(Heap Dump)를 분석할 때, java.lang.ref.Finalizer 객체가 많은 메모리를 점유하는 경우가 있어요. 이 클래스는 FinalReference와 불가분의 관계에요. 나눌 수 없는 관계라는 의미죠.
아래 그림 사례는 힙 메모리(Heap Memory)의 지속적인 증가 후 최대 Heap에 근접 도달 시, 서비스 무응답 현상에 빠지는 분석 사례인데요. 이를 통해 FinalReference 참조가 메모리 누수를 발생시킬 수 있는 조건을 살펴볼게요!
Heap Analyzer 분석툴을 활용하여, 힙 덤프 전체 메모리 요약 현황을 볼게요. java.lang.ref.Finalizer의 점유율이 메모리의 대부분을 점유하고 있죠. 여기서 Finalizer는, 앞에서 언급된 FinalReference를 확장하여 구현한 클래스에요.
JVM은 GC(Garbage Collection) 실행 시 해제 대상 객체(Object)를 수집하기 전, Finalize를 처리해야 해요.
Java Object 클래스에는 아래 그림과 같이 Finalize 메서드(Method)가 존재하는데요. 모든 객체가 Finalize 대상은 아니에요.
JVM은 클래스 로드 시, Finalize 메서드가 재정의(Override)된 객체를 식별해요. 객체 생성 시에는 Finalizer.register() 메서드를 통해, 해당 객체를 참조하는 Finalizer 객체를 생성하죠.
그다음은 Unfinalized 체인(Chain)에 등록해요. 이러한 객체는 GC 발생 시 즉시 Heap에서 수집되진 않아요. Finalizer의 대기 큐(Queue)에 들어가 객체에 재정의된 Finalize 처리를 위해 대기(Pending) 상태에 놓여있죠.
위 그림과 같이 참조 트리(Tree)를 확인해 보면, 많은 Finalizer 객체가 체인처럼 연결되어 있어요. 그럼 Finalizer 객체가 실제 참조하고 있는 객체는 무엇인지 바로 살펴볼까요?
그림에 나온 바와 같이 PostgreSql JDBC Driver의 org.postgresql.jdbc3g.Jdbc3gPreparedStatement인 점을 확인할 수 있어요. 해당 시스템은 PostgreSql DB를 사용하고 있었네요.
이처럼 Finalizer 참조 객체 대부분은 Jdbc3gPreparedStatement 객체임을 알 수 있어요. 여기서 Statement 객체는, DB에 SQL Query를 실행하기 위한 객체에요.
그렇다면, 아직 Finalize 처리되지 않은 Statement 객체가 증가하는 이유는 무엇일까요?
먼저 해당 Statement 객체는 실제로 어디서 참조하는지 살펴볼게요. 해당 객체는 TimerThread가 참조하는 TaskQueue에 들어가 있어요. 해당 Timer는 Postgresql Driver의 CancelTimer이죠.
해당 Timer의 작업 큐를 확인해 보면 PostgreSql Statement 객체와 관련된 Task 객체도 알 수도 있어요.
그럼 org.postgresql.jdbc3g.Jdbc3gPreparedStatement 클래스가 어떻게 동작하는지 자세히 알아볼까요?
org.postgresql.jdbc3g.Jdbc3gPreparedStatement는 org.postgresql.jdbc2.AbstractJdbc2Statement의 상속 클래스이며 finalize() 메서드를 재정의한 클래스에요. Finalize 처리를 위해 객체 생성 시, JVM에 의해 Finalizer 체인으로 등록되죠.
위와 같은 코드로 보아 CancelTimer는, Query 실행 후 일정 시간이 지나면 자동으로 TimeOut 취소 처리를 위한 Timer에요.
정해진 시간 내에 정상적으로 Query가 수행되고 객체를 종료(Close) 시, Timer를 취소하도록 되어 있어요. 이때 취소된 Task는 상태 값만 변경되고, 실제로는 Timer의 큐에서 아직 사라지진 않아요.
Timer에 등록된 작업은, TimerThread에 의해 순차적으로 처리돼요. Task는 TimerThread에서 처리를 해야 비로소 큐에서 제거되거든요.
이때 가져온 Task는 취소 상태가 아니며, 처리 시간에 아직 도달하지 않은 경우 해당 Task의 실행 예정 시간까지 대기해야 돼요.
여기서 문제점이 발생해요.
이 대기 시간이 길어지면 TimerThread의 처리가 지연되기 때문이죠. 이후 대기 Task들은 상태 여부에 상관없이, 큐에 지속적으로 남아있게 돼요.
만약 오랜 시간 동안 처리가 진행되지 않는다면, 여러 번의 Minor GC 발생 후 참조 객체들은 영구 영역(Old Gen)으로 이동될 수 있어요.
영구 영역으로 이동된 객체는, 메모리에 즉시 제거되지 못하고 오랜 기간 남게 되죠. 이는 Old(Full) GC를 발생시켜 시스템 부하를 유발하게 해요. 실제로 시스템에 설정된 TimeOut 값은 3,000초(50분)에요.
Finalizer 참조 객체는 GC 발생 시, 즉시 메모리에서 수집되지 않고 Finalize 처리를 위한 대기 큐에 들어가요. 그다음 FinalizerThread에 의해 Finalize 처리 후 GC 발생 시 비로소 제거되죠. 때문에 리소스의 수집 처리가 지연될 수 있어요.
또한 FinalizerThread 스레드는 우선순위가 낮아요. Finalize 처리 객체가 많은 경우, CPU 리소스가 상대적으로 부족해지면 개체의 Finalize 메서드 실행을 지연하게 만들어요. 처리되지 못한 객체는 누적되게 만들죠.
요약한다면 FinalReference 참조 객체의 잘못된 관리는
1) 객체의 재 참조를 유발 2) 불필요한 객체의 누적을 유발 3) Finalize 처리 지연으로 인한 리소스 누적을 유발
하게 해요.
PART2.
제니우스 APM을 통해 Finalize 객체를 모니터링하는 방법
Zenius APM에서는 JVM 메모리를 모니터링하고 분석하기 위한, 다양한 데이터를 수집하고 있어요. 상단에서 보았던
FinalReference 참조 객체의 현황에 대한 항목도 확인
할 수 있죠.
APM 모니터링을 통해 Finalize 처리에 대한 문제 발생 가능성도
‘사전’
에 확인
할 수 있답니다!
위에 있는 그림은 Finalize 처리 대기(Pending)중인 객체의 개수를 확인 가능한 컴포넌트에요.
이외에도 영역별 메모리 현황 정보와 GC 처리 현황에 대해서도 다양한 정보를 확인 할 수 있어요!
이상으로 Finalize 처리 객체에 의한 리소스 문제 발생 가능성을, 사례를 통해 살펴봤어요. 서비스에 리소스 문제가 발생하고 있다면, 꼭 도움이 되었길 바라요!
------------------------------------------------------------
©참고 자료
◾ uxys, http://www.uxys.com/html/JavaKfjs/20200117/101590.html
◾ Peter Lawrey, 「is memory leak? why java.lang.ref.Finalizer eat so much memory」, stackoverflow, https://stackoverflow.com/questions/8355064/is-memory-leak-why-java-lang-ref-finalizer-eat-so-much-memory
◾ Florian Weimer, 「Performance issues with Java finalizersenyo」, enyo,
https://www.enyo.de/fw/notes/java-gc-finalizers.html
------------------------------------------------------------
#APM
#Finalize
#제니우스
#메모리 누수
#Zenius
#FinalReference
#제니우스 APM
김진광
APM팀(개발3그룹)
개발3그룹 APM팀에서 제품 개발과 기술 지원을 담당하고 있습니다.
필진 글 더보기
목록으로
추천 콘텐츠
이전 슬라이드 보기
쿠버네티스(K8s) 모니터링 시 꼭 기억해야 할 3가지
쿠버네티스(K8s) 모니터링 시 꼭 기억해야 할 3가지
최근 Kubernetes 활용 범위가 일반 컨테이너 애플리케이션을 넘어 AI·GPU 워크로드 운영까지 확대되고 있습니다. 멀티 클러스터와 하이브리드 클라우드 운영이 늘어나면서 모니터링 대상도 Pod, Node, Service 상태를 확인하는 수준에 머무르지 않고, 서비스 간 관계, 오토스케일링 패턴, GPU·리소스 사용량, 이벤트·로그 연계까지 넓어지고 있습니다. 이러한 변화는 쿠버네티스 모니터링의 기준도 함께 바꾸고 있습니다. 이제는 단순히 많은 지표를 수집하는 것보다, 변화가 잦은 운영 환경에서 정상 패턴과 이상 징후를 구분하고, 장애 원인을 빠르게 좁힐 수 있는 관점이 중요합니다. 특히 AI·GPU 워크로드, 멀티 클러스터, 하이브리드 클라우드, 비용 최적화, 보안 권한 관리까지 함께 고려해야 하는 환경에서는 모니터링을 단순 지표 확인이 아니라 운영 판단 체계로 설계해야 합니다. 쿠버네티스 운영 환경은 기존 서버 운영 환경과 차이가 있습니다. 기존 서버 운영 환경에서는 고정된 장비와 프로세스 상태를 지속적으로 관찰하는 방식이 중심이었다면, 쿠버네티스에서는 Pod가 생성·삭제되고, Replica 수가 조정되며, 워크로드가 노드 간에 이동하고, 서비스 트래픽이 여러 구성요소를 거쳐 처리됩니다. 같은 장애처럼 보이더라도 실제 원인은 애플리케이션 부하, 노드 리소스 부족, 스케줄링 실패, 이미지 Pull 오류, 네트워크 지연, 권한 문제 등으로 다양하게 나뉠 수 있습니다. 따라서 쿠버네티스 모니터링에서 중요한 것은 “어떤 지표를 수집할 것인가”를 넘어, 수집된 지표를 어떤 관계와 맥락 안에서 해석할 것인가입니다. 쿠버네티스 모니터링 시 꼭 기억해야 할 세 가지 기준을 자세히 살펴보겠습니다. 1. 구성요소 간 관계를 함께 봐야 합니다 쿠버네티스 모니터링에서 먼저 기억해야 할 점은 개별 지표만으로 장애 원인을 판단하기 어렵다는 것입니다. 쿠버네티스는 Cluster를 중심으로 Node, Namespace, Workload(Deployment, StatefulSet 등), Pod, Service가 유기적으로 연결되어 운영됩니다. 예를 들어 특정 Pod의 CPU 사용률이 높거나 재시작이 발생했다고 해서, 반드시 해당 Pod 자체에 문제가 있다고 단정할 수는 없습니다. 애플리케이션 부하가 원인일 수도 있고, 노드 리소스 부족, 스케줄링 문제, 특정 Namespace의 리소스 쏠림, 네트워크 지연이 함께 영향을 미쳤을 수도 있습니다. Pod가 Pending 상태일 때도 마찬가지입니다. 단순히 Pod가 실행되지 않았다는 상태만 확인해서는 원인을 알기 어렵습니다. 노드 리소스가 부족한 것인지, 스케줄링 정책에 걸린 것인지, PVC 연결 문제가 있는지, taint/toleration 설정 문제인지, 이미지 Pull 실패인지 함께 확인해야 합니다. 서비스 응답 지연이 발생했을 때도 Pod 상태만 확인해서는 충분하지 않습니다. 해당 Pod가 배치된 Node 상태, Service와 Ingress 흐름, 네트워크 지연, 최근 배포 이력까지 함께 봐야 실제 영향 범위를 파악할 수 있습니다. 즉, 쿠버네티스 모니터링은 점 단위 지표 확인이 아니라 관계 기반 해석으로 접근해야 합니다. 관계 기반으로 쿠버네티스를 모니터링하려면 다음 구성요소를 함께 확인해야 합니다. Cluster: 전체 리소스 사용량, API Server 상태, 이벤트 발생 현황을 통해 클러스터 전반의 안정성을 확인합니다. Node: Ready 상태와 CPU, Memory, Disk, Network 사용량을 함께 보며 워크로드 수용 가능성과 병목 여부를 판단합니다. Pod: Running, Pending, Failed, Restart 상태를 확인해 서비스 단위 이상 징후를 파악합니다. Workload: Deployment, ReplicaSet, StatefulSet 등의 상태를 통해 배포·확장·복구 흐름을 확인합니다. Service/Ingress: 트래픽 흐름, 응답 지연, 연결 오류를 확인해 사용자 영향도와 서비스 경로를 파악합니다. Namespace: 리소스 사용량과 정책, 워크로드 집중도를 확인해 특정 업무나 조직 단위의 리소스 쏠림을 점검합니다. 특히 멀티 클러스터나 하이브리드 클라우드 환경에서는 관계 해석이 더 중요해집니다. 온프레미스와 클라우드, 여러 클러스터, 서로 다른 Namespace에 분산된 워크로드를 운영하는 경우 장애가 발생한 지점과 실제 서비스 영향 지점이 다를 수 있기 때문입니다. 따라서 쿠버네티스 모니터링 체계는 단순 지표 목록이 아니라, Cluster → Node → Pod → Service로 이어지는 드릴다운 구조와 구성요소 간 토폴로지 관점을 함께 제공해야 합니다. 2. 상태 변화의 반복성·시점·영향도를 봐야 합니다 쿠버네티스 운영 환경에서는 상태 변화가 자주 발생합니다. Pod는 새로 생성되거나 종료되고, HPA에 따라 Replica 수가 늘어나거나 줄어듭니다. 배포 과정에서 기존 Pod가 교체되기도 하고, 특정 워크로드가 다른 Node로 이동하기도 합니다. 따라서 “상태가 바뀌었다”는 사실만으로 장애를 판단해서는 안 됩니다. 중요한 것은 해당 변화가 정상적인 운영 흐름인지, 이상 징후인지 구분하는 것입니다. 예를 들어 Pod Restart가 한 번 발생했다고 해서 반드시 장애라고 보기는 어렵습니다. 배포나 설정 변경, 일시적인 리소스 부족으로도 재시작은 발생할 수 있습니다. 그러나 특정 시간대마다 반복되거나, 배포 이후 지속적으로 증가하거나, 특정 Node에 배치된 Pod에서만 집중적으로 발생한다면 단순 이벤트가 아니라 장애 징후로 봐야 합니다. Pod 수의 변화도 함께 확인해야 합니다. ReplicaSet에 의해 정상적으로 Pod가 유지되는 것인지, 반복적인 Pod 생성·삭제가 발생하는 것인지, 또는 노드 리소스 부족으로 원하는 수의 Pod가 유지되지 않는 것인지 함께 확인해야 운영 리스크를 정확하게 판단할 수 있습니다. 상태 변화가 정상 흐름인지 이상 징후인지 판단할 때는 다음 기준을 함께 봐야 합니다. 반복성: 같은 현상이 반복되는지 확인해야 합니다. 예를 들어 특정 Pod의 Restart가 계속 증가한다면 일시적인 현상으로 보기 어렵습니다. 시점: 변화가 언제 발생했는지 확인해야 합니다. 배포 직후, 트래픽 피크, 야간 배치 이후에 발생한 변화는 원인 분석의 중요한 단서가 됩니다. 집중도: 특정 Node, Namespace, Service에만 문제가 집중되는지 확인해야 합니다. 특정 영역에만 반복적으로 문제가 발생한다면 리소스 쏠림이나 설정 문제를 의심할 수 있습니다. 영향도: 사용자 서비스에 실제 영향을 주는지 확인해야 합니다. 응답 지연, 오류율 증가, 연결 실패가 동반된다면 우선 대응이 필요합니다. 기준선: 평상시 패턴과 얼마나 다른지 확인해야 합니다. 평소 대비 CPU, 메모리, 네트워크 사용량이 급증했다면 이상 징후로 볼 수 있습니다. AI·GPU 워크로드를 쿠버네티스 위에서 운영하는 경우에는 이러한 관점이 더 중요해집니다. AI 학습이나 추론 워크로드는 일반 웹 애플리케이션보다 리소스 사용 패턴이 급격하게 변할 수 있습니다. GPU 사용률, 메모리 점유, 작업 대기 시간, 추론 지연 같은 지표가 짧은 시간 안에 크게 흔들릴 수 있기 때문에 단순 임계값만으로는 정상과 이상을 구분하기 어렵습니다. 또한 GPU, FPGA 같은 특수 리소스를 사용하는 워크로드에서는 리소스 준비 상태와 스케줄링 조건까지 함께 확인해야 합니다. Kubernetes v1.36에서도 Dynamic Resource Allocation과 workload-aware scheduling 관련 개선이 이어지고 있으며, 이는 AI/ML 및 고성능 워크로드 운영에서 리소스 배치와 스케줄링 가시성이 점점 중요해지고 있음을 보여줍니다. 따라서 쿠버네티스 모니터링에서는 특정 시점의 상태보다 시간 흐름에 따른 패턴을 봐야 합니다. 지표가 임계값을 넘었는지뿐 아니라, 왜 그 시점에 변화가 발생했는지, 반복되는지, 서비스 영향으로 이어졌는지를 함께 판단해야 합니다. 3. 메트릭·이벤트·로그를 연결해 원인을 분석해야 합니다 쿠버네티스 모니터링에서 메트릭은 중요한 출발점입니다. CPU, 메모리, 네트워크, 디스크, Pod 상태, Node 상태 같은 지표는 현재 시스템이 어떤 상태인지 빠르게 보여줍니다. 하지만 메트릭만으로 장애 원인을 충분히 설명하기는 어렵습니다. 예를 들어 Pod가 Pending 상태인 경우를 생각해볼 수 있습니다. 메트릭만 보면 Pod가 정상 실행되지 않았다는 사실은 알 수 있습니다. 그러나 원인이 노드 리소스 부족인지, 이미지 Pull 실패인지, PVC 마운트 문제인지, 스케줄링 정책 때문인지, 권한 문제인지는 이벤트와 로그를 함께 확인해야 알 수 있습니다. 쿠버네티스 장애 분석에서는 메트릭, 이벤트, 로그, 트레이스를 각각 다른 역할로 봐야 합니다. 메트릭은 상태와 성능 추이를 보여줍니다. CPU, Memory, Disk, Network, Pod 상태를 통해 현재 시스템의 이상 여부를 빠르게 확인할 수 있습니다. 이벤트는 쿠버네티스 내부 판단 과정을 보여줍니다. Scheduling 실패, ImagePullBackOff, OOMKilled 같은 이벤트는 왜 특정 상태가 발생했는지 파악하는 데 도움이 됩니다. 로그는 애플리케이션과 컨테이너 내부 원인을 보여줍니다. 예외 메시지, 오류 코드, 요청 실패 기록을 통해 실제 장애 원인을 좁힐 수 있습니다. 트레이스는 서비스 간 호출 흐름과 병목을 보여줍니다. API 지연, 서비스 호출 경로, 특정 구간의 병목을 확인할 때 유용합니다. 최근에는 OpenTelemetry 확산으로 메트릭, 로그, 트레이스를 표준화된 방식으로 수집하고 연계하려는 흐름이 강화되고 있습니다. 쿠버네티스 운영 데이터가 여러 도구에 흩어져 있으면 장애 발생 시 원인을 찾기 어렵기 때문에, 관측 데이터를 일관된 방식으로 수집하고 연결해 분석할 수 있어야 합니다. 또한 모니터링 데이터 접근 자체도 보안 관점에서 관리해야 합니다. kubelet API는 노드 메트릭, Pod 목록, 컨테이너 로그 등 민감한 운영 정보를 제공할 수 있습니다. 따라서 모니터링 도구가 어떤 권한으로 어떤 데이터를 조회하는지도 확인해야 합니다. 결국 쿠버네티스 장애 대응에서는 “무슨 일이 발생했는가”와 “왜 발생했는가”를 구분해야 합니다. 메트릭이 상태 변화를 보여준다면, 이벤트는 쿠버네티스가 어떤 판단을 했는지 보여주고, 로그는 애플리케이션 내부에서 어떤 문제가 있었는지 설명합니다. 이 세 가지를 연결해야 장애 원인을 빠르게 좁힐 수 있습니다. 쿠버네티스 모니터링은 단순히 지표를 많이 수집하는 작업이 아니라, 변화가 잦은 운영 환경을 해석하는 과정에 가깝습니다. Pod가 생성·삭제되고, 워크로드가 이동하며, 서비스 경로가 계속 바뀌는 구조에서는 개별 지표만으로는 장애의 원인과 영향 범위를 파악하기 어렵습니다. 따라서 모니터링 체계를 설계할 때는 수집 대상의 범위를 넓히는 것만큼이나, 수집된 데이터를 어떤 기준으로 연결하고 해석할 것인지가 중요합니다. 특히 AI·GPU 워크로드, 멀티 클러스터, 하이브리드 클라우드처럼 운영 환경이 복잡해질수록 모니터링은 상태 확인을 넘어 장애 징후를 조기에 발견하고 대응 우선순위를 판단하는 역할을 해야 합니다. 결국 쿠버네티스 모니터링의 목적은 “현재 상태를 보는 것”에 머무르지 않습니다. 운영자가 문제의 위치와 원인, 서비스 영향도를 빠르게 좁히고 안정적인 운영 판단을 내릴 수 있도록 돕는 데 있습니다.
2026.08.26
다음 슬라이드 보기