R3. 이벤트 종류 레퍼런스
Diátaxis: Reference(찾아보는 사전) · 대상: 운영자 / 관리자 ← 목차로
이벤트 목록·알림에서 마주치는 이벤트별 의미·원인·예상 문제·조사 포인트를 사전처럼 정리합니다. 읽는 순서는 없으며, 만난 이벤트를 찾아보는 용도입니다.
참고 이 사전의 원천은 제품 내 이벤트 상세 Drawer의 "이벤트 설명" 섹션(어떤 이벤트인가 / 왜 발생하나 / 예상되는 문제 / 조사 포인트)과 동일합니다. 화면에서는 이벤트 행을 클릭해 같은 설명을 볼 수 있습니다. 이벤트를 보고 알림을 만드는 절차는 H15. 알림 정책, 폭주를 줄이는 법은 H16을 보세요.
여는 법 — 좌측 메뉴 ▸ 이벤트 ▸ 이벤트 목록 (/event/events)

이벤트 레벨 (심각도)
| 레벨 | 표기 | 의미 |
|---|---|---|
| INFO | 정보 | 상태 변화·작업 결과 알림. 대개 조치 불필요 |
| WARN | 경고 | 주의가 필요한 수준. 임계값 초과 등 |
| CRITICAL | 심각 | 즉시 대응이 필요한 수준. 장애에 가까움 |
| FORECAST | 예측 | 현재 추세대로면 곧 심각에 도달할 것이라는 선제 경고 |
| NOTI | 알림 | 관리자 공지 등 정보 전달 |
R3.1 임계·예측·이상치 (지표 기반)
지표가 정책 임계값을 벗어났을 때 나는 이벤트입니다. 이벤트 종류(아래) 는 "어떻게 벗어났나"를, 메트릭(다음 표) 은 "어떤 지표인가"를 나타냅니다. 원인·예상 문제·조사 포인트는 메트릭에 따라 다릅니다.
| 이벤트 | 의미 |
|---|---|
| 임계값 초과(WARN/CRITICAL) | 해당 지표의 평균값이 설정된 경고/심각 임계값을 초과 |
| 예측 임계 도달(FORECAST) | 현재 추세대로면 곧 심각 임계값에 도달할 것으로 예측(아직 초과 전) |
| 이상치 탐지(WARN) | 지표가 평소 패턴과 통계적으로 크게 다른 값을 기록 |
예측은 임계 전에 선제 조치(리소스 확보·작업 중지·재배치)가 가능한지 보는 신호이고, 이상치는 단발이면 영향이 제한적이나 반복되면 임계 초과의 전조입니다.
메트릭별 원인·예상 문제·조사 포인트
| 메트릭 | 원인(흔한) | 예상 문제 | 조사 포인트 |
|---|---|---|---|
| CPU 사용률 | 트래픽·CPU 집약 작업·무한 루프·DDoS | 응답 지연·TPS 저하 | 프로세스별 CPU, User/System/IOWait 구분, 배치 작업 |
| 메모리 사용률 | 누수·캐시 과다·대량 처리 | 스왑 시작 → 급격한 저하, OOM | 프로세스별 메모리, 증가 추세(누수), 스왑 시작 |
| 평균 로드 | 실행 대기 프로세스 증가(CPU 포화/IO 대기) | 전반적 처리 지연 | CPU와 비교(낮은데 부하 높으면 I/O), 디스크 응답시간 |
| 디스크 사용량 | 로그·임시파일 누적, 데이터 증가 | 쓰기 실패 → 오류·중단 | 대용량 파일, 보존 정책, 증가 속도 |
| 스왑 | 물리 메모리 부족 | 응답 수십 배 지연(심각) | 메모리 과점유 프로세스, 증설·정리 |
| 네트워크 오류 | NIC·드라이버·케이블 불량 | 패킷 손실·재전송·끊김 | 인터페이스 에러 유형, 하드웨어·스위치 |
| 네트워크 트래픽 | 트래픽 급증·대용량 전송·공격 | 대역폭 포화 → 통신 지연 | 발생원(연결·프로세스), 정상 작업 여부 |
| JVM 힙 | 누수·캐시 과다·대량 객체 | GC 빈발·지연, OOM | 힙 히스토그램 상위 클래스·증가 추세, GC 시간 |
| GC | 힙 부족·누수로 GC 빈발 | STW 누적 → 응답 지연 | 힙 사용률과 함께(회수 후도 높으면 누수) |
| 대기 트랜잭션(Pending) | 느린 외부호출·DB, 락 경합, 풀 고갈 | 응답 지연·타임아웃 | 스레드 덤프의 BLOCKED/WAITING 공통 스택 |
| APDEX | 응답 지연·오류 증가 | 사용자 체감 품질 저하 | 응답시간·오류율 분해, 느린 URL |
| 응답시간 | 느린 쿼리·외부호출, 자원 부족, 락 | 대기 증가·타임아웃 | 구간별 소요(DB·외부), CPU/GC |
| 오류율 | 예외·잘못된 요청, 의존 서비스 장애 | 요청 실패 | 오류 집중 URL·예외 유형, 의존 서비스 |
| DB 커넥션 풀 | 사용 증가·누수·풀 부족·점유 장기화 | 풀 고갈 → 대기·실패 | 활성 커넥션 추이, 누수 이벤트, 느린 쿼리 |
| DB 응답시간 | 느린 쿼리·인덱스 누락·락 | 앱 전체 지연 전파 | 장시간 쿼리·실행계획 |
| Metaspace(Perm) | 반복 재배포·클래스 누적 | Metaspace OOM | 재배포 이력·클래스 수 추이 |
| 웹 워커 사용률 | 요청 폭증·백엔드 지연 | 워커 고갈 → 접속 실패 | 백엔드 응답시간, busy/idle, 워커 수 설정 |
| 웹 트래픽 | 급증·대용량 응답·크롤러·공격 | 대역폭·워커 포화 | 상위 URL/클라이언트, 정상 이벤트 여부 |
| CUBRID CAS | 느린 쿼리·커넥션 폭증 | 브로커 포화 → 대기·실패 | busy/wait CAS, jobQ, longT/longQ |
| MySQL 커넥션 | 풀 과다·누수·트래픽 | 한도 도달 → 연결 거부 | PROCESSLIST, 풀·max_connections |
위 표는 흔한 메트릭만 추렸습니다. 임시 테이블·풀 테이블 스캔·버퍼 풀·쓰기 지연 등 DBMS 세부 지표도 같은 4항목 설명이 이벤트 상세에 제공됩니다.
R3.2 진단 정보 수집 (자동·수동)
심각 초과나 사용자 요청 시, 원인 분석용 데이터가 저장되었음을 알리는 이벤트입니다. 대개 INFO이며, 자동 수집분은 직전의 임계·이상 상황이 트리거입니다.
| 이벤트 | 의미 / 조사 포인트 |
|---|---|
| 전체 스레드 덤프 | 사용자 요청 또는 대기 트랜 잭션 급증 시 자동 수집. BLOCKED/WAITING 공통 스택·데드락·느린 호출 대상 확인 |
| 활성 스레드 덤프 | 실행 중인 요청 파악용(사용자 요청). 오래 실행 중인 스레드의 스택·호출 대상 확인 |
| 시스템 프로세스 정보 | 사용자 요청 또는 CPU/메모리 심각 시 자동. CPU/메모리 상위·비정상·신규 프로세스 확인 |
| JVM 힙 히스토그램 | 사용자 요청 또는 힙 심각 시 자동. 메모리 상위 클래스·인스턴스 수·증가 추세(누수) 확인 |
| 오픈 파일(lsof) | FD 사용량 분석(요청). FD 과다 프로세스·누수 패턴 확인 |
| 네트워크 연결(netstat) | TCP 상태 분석(요청). ESTABLISHED/TIME_WAIT/CLOSE_WAIT 분포 확인 |
| CUBRID 브로커 상태 | 요청 또는 CAS 심각 시 자동. busy/wait CAS·jobQ·장기 쿼리 확인 |
| DBMS 통계/진단 | 요청 또는 DBMS 지표 임계 시 자동. 장시간 쿼리·락 대기·상태 변수 확인 |
| Full GC 실행 | 사용자가 수동 트리거. GC 후 힙 회수량 확인(회수 적으면 누수 의심) |
| 컨테이너 정보 | 사용자 요청. 비정상 상태 컨테이너·리소스 사용량 확인 |
참고 이들 자동 수집 데이터는 AI 진단(H14)이 요약·분석해 줍니다. 덤프 활용 절차는 H7. 메모리 누수 점검·H20. 에이전트 점검을 보세요.
R3.3 JVM 위험 (심각)
| 이벤트 | 의미 | 예상 문제 | 조사 포인트 |
|---|---|---|---|
| 데드락 감지 | 둘 이상 스레드가 서로의 락을 기다려 영구 대기 | 관련 요청 영구 대기 → 풀 고갈 확산 | 스레드 덤프의 락 획득 순서, 코드의 락 순서 통일 |
| OutOfMemory | 힙 부족(누수·캐시·대량 처리·설정 부족) | 요청 실패·프로세스 중단(심각) | 힙 덤프/히스토그램으로 점유 객체, 누수 수정·힙 증설 |
R3.4 에이전트 (연결 상태)
| 이벤트 | 의미 | 예상 문제 | 조사 포인트 |
|---|---|---|---|
| 에이전트 연결 | 에이전트 시작·재연결(기동·재시작·배포·네트워크 복구) | 정상이나 예기치 않으면 직전 비정상 종료 의심 | 직전 종료 이벤트 간격, 의도된 재시작인지 |
| 에이전트 종료 | 연결 끊김(정지·재시작·비정상 종료·네트워크 단절) | 모니터링 중단 — 실제 서비스 중단일 수 있음 | 의도된 정지인지, 프로세스가 실행 중인지, 호스트·네트워크 |
| 에이전트 무응답 | 응답 없음(hang·과부하·네트워크 지연) | 요청 처리 불가 가능성 높음 | 프로세스 상태, 호스트 리소스, 스레드 덤프 |
에이전트 상태 화면과 대응 절차는 H20. 에이전트 상태 점검에 있습니다.
R3.5 웹서버 로드밸런서 (워커)
| 이벤트 | 의미 | 예상 문제 | 조사 포인트 |
|---|---|---|---|
| 그룹 전체 중지 | LB 그룹의 모든 워커 중지 | 이 그룹 요청 전부 실패(5xx) — 서비스 중단 | 백엔드 상태, 웹서버 에러 로그, 배포 이력(즉시) |
| 그룹 복구 | 그룹에 가용 워커 생김 | 재개됐으나 중단 구간 영향이 남아 있음 | 전체 멤버 복구 여부, 원인 해소 |
| 멤버 중지 | 특정 멤버 워커 중지(백엔드 다운·헬스체크 실패) | 잔여 멤버로 재분배 → 과부하 위험 | 멤버 백엔드 상태, 잔여 멤버 부하 |
| 멤버 시작 | 백엔드 기동/복구로 멤버 활성화 | 처리 용량 정상화 | 예정 작업이었는지, 그룹 멤버 상태 |
| 멤버 복구 | 오류 멤버가 헬스체크 통과 복귀 | 트래픽 정상 분배 복귀 | 복구 안정성(재발), 원인 해소 |
R3.6 트랜잭션·DB 이상
| 이벤트 | 의미 | 예상 문제 | 조사 포인트 |
|---|---|---|---|
| URL 상태 이상(WARN/CRITICAL) | URL 점검에서 비정상 응답(코드/시간) | 요청 실패·체감 지연 | 응답코드·시간, 대상 인스턴스, 오류율 |
| 데이터소스 일시중단 | DB 접속 불가·오류 누적으로 풀 보호 모드 | 해당 풀 요청 실패·대기 | DB 상태·네트워크, 풀 설정(검증 쿼리·재시도) |
| 커넥션 누수 | 커넥션 미반환(close 누락) 코드 경로 | 누적 시 풀 고갈 → 대기·실패 | 감지 URL의 close/try-with-resources 누락 |
| 과다 Fetch | 한 요청이 비정상적으로 많은 행 조회(페이징 누락) | 메모리 급증·응답 지연 | 해당 URL 쿼리의 LIMIT·조건 점검 |
| 트랜잭션 인덱스 누락 | 조회 인덱스 삭제·미생성(내부 점검) | 조회 성능 저하(자동 복구 시도) | 복구 성공 여부, 실패 시 수동 생성 |
DB 풀 고갈 진단 절차는 H8. DB 커넥션 풀 고갈을 보세요.
R3.7 서비스 체크 (SLA)
| 이벤트 | 의미 | 조사 포인트 |
|---|---|---|
| 헬스체크 실패 | 응답코드/내용 불일 치·포트 미오픈·타임아웃 | 실패 사유(코드/정규식/포트), 대상 프로세스·네트워크 |
| 헬스체크 테스트 | 사용자가 설정을 테스트 실행(운영 영향 없음) | 기대한 성공/실패 조건과 일치 여부 |
| 복구 명령 성공 | 헬스체크 실패 시 설정된 복구 명령 실행 성공 | 후속 헬스체크로 실제 정상화 확인 |
| 복구 명령 실패 | 복구 명령 오류(권한·경로·스크립트) | 오류 코드·메시지 확인, 수동 복구 |
SLA 설정·보고서는 H17. SLA 설정·보고서에 있습니다.
R3.8 라이센스·정책·보안·기타
| 이벤트 | 의미 / 조사 포인트 |
|---|---|
| 라이센스 만료 | 유효기간 경과 — 기능 제한 가능. 갱신 후 정보 변경 이벤트 확인 |
| 라이센스 만료 임박 | 3일 이내 만료 예정 — 만료 전 갱신 |
| 라이센스 오류 | 키·호스트/용량 불일치 — 키와 적용 대상 확인 |
| 라이센스 정보 변경 | 갱신·재적용됨 — 적용된 용량·만료일 확인 |
| 경고 정책 재적용 | 관리자가 임계값/정책 수정 — 변경 후 알림 빈도 적절성 확인 |
| 유효하지 않은 인스턴스ID | 명명 규칙(소문자 영숫자·하이픈) 위반 — 에이전트 instanceId 수정 |
| 브루트포스 공격 감지 | 반복 시도 임계 초과 — 출처 IP/계정 확인, 차단·잠금 검토 |
| 관리자 공지(NOTI) | 관리자 공지 메시지 — 내용 확인 |
| Kubernetes/OpenShift | 클러스터 Pod/노드 이벤트 — WARN이면 스케줄링·재시작 영향 가능. Pod/노드 상태 확인 |
| 웹서버 유입제어 | 트래픽 차단/허용 명령 결과 — 실패 시 미적용. 대상 워커/그룹 적용 상태 확인 |
| 스레드 제어 | 스레드 인터럽트 등 제어 결과 — 대상 인스턴스 스레드 상태 재확인 |
위 표에 없는 이벤트는 이벤트 메시지·파라미터를 참고하고, 레벨(정보/경고/심각)에 따라 영향도를 판단하세요. 이벤트 상세의 AI 진단으로 원인 추정을 받을 수 있습니다(H14).
관련 문서
- H15. 알림 정책 만들기·튜닝 · H16. 알림 폭주 줄이기
- R2. 차트 지표 레퍼런스 — 이벤트를 일으킨 지표를 차트로
- E3. 지표의 의미 — 지표 개념
- 진단 절차: H7 · H8 · H10 · H20