본문으로 건너뛰기
버전: 5.1.0-11.0

R3. 이벤트 종류 레퍼런스

Diátaxis: Reference(찾아보는 사전) · 대상: 운영자 / 관리자 ← 목차로

이벤트 목록·알림에서 마주치는 이벤트별 의미·원인·예상 문제·조사 포인트를 사전처럼 정리합니다. 읽는 순서는 없으며, 만난 이벤트를 찾아보는 용도입니다.

참고 이 사전의 원천은 제품 내 이벤트 상세 Drawer의 "이벤트 설명" 섹션(어떤 이벤트인가 / 왜 발생하나 / 예상되는 문제 / 조사 포인트)과 동일합니다. 화면에서는 이벤트 행을 클릭해 같은 설명을 볼 수 있습니다. 이벤트를 보고 알림을 만드는 절차는 H15. 알림 정책, 폭주를 줄이는 법은 H16을 보세요.

여는 법 — 좌측 메뉴 ▸ 이벤트 ▸ 이벤트 목록 (/event/events)

이벤트 목록

이벤트 레벨 (심각도)

레벨표기의미
INFO정보상태 변화·작업 결과 알림. 대개 조치 불필요
WARN경고주의가 필요한 수준. 임계값 초과 등
CRITICAL심각즉시 대응이 필요한 수준. 장애에 가까움
FORECAST예측현재 추세대로면 곧 심각에 도달할 것이라는 선제 경고
NOTI알림관리자 공지 등 정보 전달

R3.1 임계·예측·이상치 (지표 기반)

지표가 정책 임계값을 벗어났을 때 나는 이벤트입니다. 이벤트 종류(아래) 는 "어떻게 벗어났나"를, 메트릭(다음 표) 은 "어떤 지표인가"를 나타냅니다. 원인·예상 문제·조사 포인트는 메트릭에 따라 다릅니다.

이벤트의미
임계값 초과(WARN/CRITICAL)해당 지표의 평균값이 설정된 경고/심각 임계값을 초과
예측 임계 도달(FORECAST)현재 추세대로면 곧 심각 임계값에 도달할 것으로 예측(아직 초과 전)
이상치 탐지(WARN)지표가 평소 패턴과 통계적으로 크게 다른 값을 기록

예측은 임계 전에 선제 조치(리소스 확보·작업 중지·재배치)가 가능한지 보는 신호이고, 이상치는 단발이면 영향이 제한적이나 반복되면 임계 초과의 전조입니다.

메트릭별 원인·예상 문제·조사 포인트

메트릭원인(흔한)예상 문제조사 포인트
CPU 사용률트래픽·CPU 집약 작업·무한 루프·DDoS응답 지연·TPS 저하프로세스별 CPU, User/System/IOWait 구분, 배치 작업
메모리 사용률누수·캐시 과다·대량 처리스왑 시작 → 급격한 저하, OOM프로세스별 메모리, 증가 추세(누수), 스왑 시작
평균 로드실행 대기 프로세스 증가(CPU 포화/IO 대기)전반적 처리 지연CPU와 비교(낮은데 부하 높으면 I/O), 디스크 응답시간
디스크 사용량로그·임시파일 누적, 데이터 증가쓰기 실패 → 오류·중단대용량 파일, 보존 정책, 증가 속도
스왑물리 메모리 부족응답 수십 배 지연(심각)메모리 과점유 프로세스, 증설·정리
네트워크 오류NIC·드라이버·케이블 불량패킷 손실·재전송·끊김인터페이스 에러 유형, 하드웨어·스위치
네트워크 트래픽트래픽 급증·대용량 전송·공격대역폭 포화 → 통신 지연발생원(연결·프로세스), 정상 작업 여부
JVM 힙누수·캐시 과다·대량 객체GC 빈발·지연, OOM힙 히스토그램 상위 클래스·증가 추세, GC 시간
GC힙 부족·누수로 GC 빈발STW 누적 → 응답 지연힙 사용률과 함께(회수 후도 높으면 누수)
대기 트랜잭션(Pending)느린 외부호출·DB, 락 경합, 풀 고갈응답 지연·타임아웃스레드 덤프의 BLOCKED/WAITING 공통 스택
APDEX응답 지연·오류 증가사용자 체감 품질 저하응답시간·오류율 분해, 느린 URL
응답시간느린 쿼리·외부호출, 자원 부족, 락대기 증가·타임아웃구간별 소요(DB·외부), CPU/GC
오류율예외·잘못된 요청, 의존 서비스 장애요청 실패오류 집중 URL·예외 유형, 의존 서비스
DB 커넥션 풀사용 증가·누수·풀 부족·점유 장기화풀 고갈 → 대기·실패활성 커넥션 추이, 누수 이벤트, 느린 쿼리
DB 응답시간느린 쿼리·인덱스 누락·락앱 전체 지연 전파장시간 쿼리·실행계획
Metaspace(Perm)반복 재배포·클래스 누적Metaspace OOM재배포 이력·클래스 수 추이
웹 워커 사용률요청 폭증·백엔드 지연워커 고갈 → 접속 실패백엔드 응답시간, busy/idle, 워커 수 설정
웹 트래픽급증·대용량 응답·크롤러·공격대역폭·워커 포화상위 URL/클라이언트, 정상 이벤트 여부
CUBRID CAS느린 쿼리·커넥션 폭증브로커 포화 → 대기·실패busy/wait CAS, jobQ, longT/longQ
MySQL 커넥션풀 과다·누수·트래픽한도 도달 → 연결 거부PROCESSLIST, 풀·max_connections

위 표는 흔한 메트릭만 추렸습니다. 임시 테이블·풀 테이블 스캔·버퍼 풀·쓰기 지연 등 DBMS 세부 지표도 같은 4항목 설명이 이벤트 상세에 제공됩니다.


R3.2 진단 정보 수집 (자동·수동)

심각 초과나 사용자 요청 시, 원인 분석용 데이터가 저장되었음을 알리는 이벤트입니다. 대개 INFO이며, 자동 수집분은 직전의 임계·이상 상황이 트리거입니다.

이벤트의미 / 조사 포인트
전체 스레드 덤프사용자 요청 또는 대기 트랜잭션 급증 시 자동 수집. BLOCKED/WAITING 공통 스택·데드락·느린 호출 대상 확인
활성 스레드 덤프실행 중인 요청 파악용(사용자 요청). 오래 실행 중인 스레드의 스택·호출 대상 확인
시스템 프로세스 정보사용자 요청 또는 CPU/메모리 심각 시 자동. CPU/메모리 상위·비정상·신규 프로세스 확인
JVM 힙 히스토그램사용자 요청 또는 힙 심각 시 자동. 메모리 상위 클래스·인스턴스 수·증가 추세(누수) 확인
오픈 파일(lsof)FD 사용량 분석(요청). FD 과다 프로세스·누수 패턴 확인
네트워크 연결(netstat)TCP 상태 분석(요청). ESTABLISHED/TIME_WAIT/CLOSE_WAIT 분포 확인
CUBRID 브로커 상태요청 또는 CAS 심각 시 자동. busy/wait CAS·jobQ·장기 쿼리 확인
DBMS 통계/진단요청 또는 DBMS 지표 임계 시 자동. 장시간 쿼리·락 대기·상태 변수 확인
Full GC 실행사용자가 수동 트리거. GC 후 힙 회수량 확인(회수 적으면 누수 의심)
컨테이너 정보사용자 요청. 비정상 상태 컨테이너·리소스 사용량 확인

참고 이들 자동 수집 데이터는 AI 진단(H14)이 요약·분석해 줍니다. 덤프 활용 절차는 H7. 메모리 누수 점검·H20. 에이전트 점검을 보세요.


R3.3 JVM 위험 (심각)

이벤트의미예상 문제조사 포인트
데드락 감지둘 이상 스레드가 서로의 락을 기다려 영구 대기관련 요청 영구 대기 → 풀 고갈 확산스레드 덤프의 락 획득 순서, 코드의 락 순서 통일
OutOfMemory힙 부족(누수·캐시·대량 처리·설정 부족)요청 실패·프로세스 중단(심각)힙 덤프/히스토그램으로 점유 객체, 누수 수정·힙 증설

R3.4 에이전트 (연결 상태)

이벤트의미예상 문제조사 포인트
에이전트 연결에이전트 시작·재연결(기동·재시작·배포·네트워크 복구)정상이나 예기치 않으면 직전 비정상 종료 의심직전 종료 이벤트 간격, 의도된 재시작인지
에이전트 종료연결 끊김(정지·재시작·비정상 종료·네트워크 단절)모니터링 중단 — 실제 서비스 중단일 수 있음의도된 정지인지, 프로세스가 실행 중인지, 호스트·네트워크
에이전트 무응답응답 없음(hang·과부하·네트워크 지연)요청 처리 불가 가능성 높음프로세스 상태, 호스트 리소스, 스레드 덤프

에이전트 상태 화면과 대응 절차는 H20. 에이전트 상태 점검에 있습니다.


R3.5 웹서버 로드밸런서 (워커)

이벤트의미예상 문제조사 포인트
그룹 전체 중지LB 그룹의 모든 워커 중지이 그룹 요청 전부 실패(5xx) — 서비스 중단백엔드 상태, 웹서버 에러 로그, 배포 이력(즉시)
그룹 복구그룹에 가용 워커 생김재개됐으나 중단 구간 영향이 남아 있음전체 멤버 복구 여부, 원인 해소
멤버 중지특정 멤버 워커 중지(백엔드 다운·헬스체크 실패)잔여 멤버로 재분배 → 과부하 위험멤버 백엔드 상태, 잔여 멤버 부하
멤버 시작백엔드 기동/복구로 멤버 활성화처리 용량 정상화예정 작업이었는지, 그룹 멤버 상태
멤버 복구오류 멤버가 헬스체크 통과 복귀트래픽 정상 분배 복귀복구 안정성(재발), 원인 해소

R3.6 트랜잭션·DB 이상

이벤트의미예상 문제조사 포인트
URL 상태 이상(WARN/CRITICAL)URL 점검에서 비정상 응답(코드/시간)요청 실패·체감 지연응답코드·시간, 대상 인스턴스, 오류율
데이터소스 일시중단DB 접속 불가·오류 누적으로 풀 보호 모드해당 풀 요청 실패·대기DB 상태·네트워크, 풀 설정(검증 쿼리·재시도)
커넥션 누수커넥션 미반환(close 누락) 코드 경로누적 시 풀 고갈 → 대기·실패감지 URL의 close/try-with-resources 누락
과다 Fetch한 요청이 비정상적으로 많은 행 조회(페이징 누락)메모리 급증·응답 지연해당 URL 쿼리의 LIMIT·조건 점검
트랜잭션 인덱스 누락조회 인덱스 삭제·미생성(내부 점검)조회 성능 저하(자동 복구 시도)복구 성공 여부, 실패 시 수동 생성

DB 풀 고갈 진단 절차는 H8. DB 커넥션 풀 고갈을 보세요.


R3.7 서비스 체크 (SLA)

이벤트의미조사 포인트
헬스체크 실패응답코드/내용 불일치·포트 미오픈·타임아웃실패 사유(코드/정규식/포트), 대상 프로세스·네트워크
헬스체크 테스트사용자가 설정을 테스트 실행(운영 영향 없음)기대한 성공/실패 조건과 일치 여부
복구 명령 성공헬스체크 실패 시 설정된 복구 명령 실행 성공후속 헬스체크로 실제 정상화 확인
복구 명령 실패복구 명령 오류(권한·경로·스크립트)오류 코드·메시지 확인, 수동 복구

SLA 설정·보고서는 H17. SLA 설정·보고서에 있습니다.


R3.8 라이센스·정책·보안·기타

이벤트의미 / 조사 포인트
라이센스 만료유효기간 경과 — 기능 제한 가능. 갱신 후 정보 변경 이벤트 확인
라이센스 만료 임박3일 이내 만료 예정 — 만료 전 갱신
라이센스 오류키·호스트/용량 불일치 — 키와 적용 대상 확인
라이센스 정보 변경갱신·재적용됨 — 적용된 용량·만료일 확인
경고 정책 재적용관리자가 임계값/정책 수정 — 변경 후 알림 빈도 적절성 확인
유효하지 않은 인스턴스ID명명 규칙(소문자 영숫자·하이픈) 위반 — 에이전트 instanceId 수정
브루트포스 공격 감지반복 시도 임계 초과 — 출처 IP/계정 확인, 차단·잠금 검토
관리자 공지(NOTI)관리자 공지 메시지 — 내용 확인
Kubernetes/OpenShift클러스터 Pod/노드 이벤트 — WARN이면 스케줄링·재시작 영향 가능. Pod/노드 상태 확인
웹서버 유입제어트래픽 차단/허용 명령 결과 — 실패 시 미적용. 대상 워커/그룹 적용 상태 확인
스레드 제어스레드 인터럽트 등 제어 결과 — 대상 인스턴스 스레드 상태 재확인

위 표에 없는 이벤트는 이벤트 메시지·파라미터를 참고하고, 레벨(정보/경고/심각)에 따라 영향도를 판단하세요. 이벤트 상세의 AI 진단으로 원인 추정을 받을 수 있습니다(H14).


관련 문서