본문으로 건너뛰기

5.1. 인시던트

SLO(서비스 수준 목표) 위반 또는 시스템 이상이 탐지되면 자동으로 생성되는 경보 목록을 확인하고 근본 원인을 분석합니다.

인시던트 화면

개요

인시던트 메뉴에서는 OPENMARU Observability가 자동으로 탐지한 인시던트(Incident)를 한눈에 파악할 수 있습니다. 인시던트(Incident)는 SLO(Service Level Objective, 서비스 수준 목표)를 위반하거나 애플리케이션 이상이 탐지될 때 자동으로 생성되는 경보입니다.

이 화면에서는 현재 진행 중인 인시던트와 해결된 인시던트를 조회하고, 인시던트별 심각도(Severity), 지속 시간, 영향받은 요청 비율, 오류 예산(Error Budget) 소비량을 확인할 수 있습니다. 각 인시던트를 클릭하면 상세 페이지로 이동하여 RCA(Root Cause Analysis, 근본원인분석)를 통해 인시던트 발생 원인을 파악할 수 있습니다.

화면 구성

인시던트 페이지는 다음 영역으로 구성됩니다.

  • 상단 헤더: 애플리케이션 필터
  • 상태 요약 스트립: 심각도별 인시던트 개수 및 해결된 인시던트 표시 옵션
  • 인시던트 목록 테이블: 전체 인시던트 목록 및 SLO 영향 지표

주요 기능

상태 요약 스트립으로 현황 파악

상태 요약 스트립

화면 상단의 상태 요약 스트립에서 심각도별 인시던트 개수를 한눈에 확인할 수 있습니다.

상태의미
심각(Critical)즉각 조치가 필요한 인시던트 수
경고(Warning)주의가 필요한 인시던트 수
해결됨 (심각)심각 상태에서 해결된 인시던트 수
해결됨 (경고)경고 상태에서 해결된 인시던트 수

특정 상태 항목을 클릭하면 해당 상태의 인시던트만 목록에 필터링되어 표시됩니다. 다시 클릭하면 필터가 해제됩니다.

: 심각(Critical) 상태를 클릭하면 즉각 대응이 필요한 인시던트를 빠르게 확인할 수 있습니다.

해결된 인시던트 표시

해결된 인시던트 표시 토글

기본적으로 현재 진행 중인(해결되지 않은) 인시던트만 표시됩니다. 해결된 인시던트 표시 체크박스를 활성화하면 해결된 인시던트도 목록에 포함됩니다.

해결된 인시던트는 목록에서 반투명하게 표시되며, 지속 시간 열에 해결됨 배지가 표시됩니다.

참고: 해결된 인시던트 표시 설정은 브라우저에 저장되어, 다음 접속 시에도 마지막 선택이 유지됩니다.

오래된 인시던트는 자동으로 지워집니다

인시던트와 알림 이력은 메트릭 캐시 보존 기간 + 2일이 지나면 서버가 자동으로 삭제합니다. 기본 설정(캐시 30일)에서는 약 32일입니다.

기준을 캐시에 맞춘 이유는, 인시던트를 열어도 그 근거가 되는 차트가 이미 사라진 뒤라면 볼 것이 없기 때문입니다. 이력과 근거 데이터가 함께 사라집니다.

참고: 해결되지 않은 인시던트와 알림은 기간이 지나도 지우지 않습니다. 목록에서 사라진 것은 모두 해결 처리된 항목입니다.

보존 기간을 늘리려면 서버의 캐시 보존 설정(cache-ttl)을 늘립니다. 그만큼 메트릭 저장 공간도 더 필요합니다.

애플리케이션 필터

애플리케이션 필터

페이지 우측 상단의 애플리케이션 필터를 사용해 특정 애플리케이션 또는 네임스페이스(Namespace)의 인시던트만 표시할 수 있습니다. 인시던트 ID나 키워드를 검색하여 특정 인시던트를 빠르게 찾을 수도 있습니다.

인시던트 목록 테이블

인시던트 목록 테이블

인시던트 목록 테이블에는 다음 정보가 표시됩니다.

컬럼설명
인시던트인시던트 ID (예: i-123). 심각도에 따라 색상이 다르게 표시됩니다.
애플리케이션인시던트가 발생한 애플리케이션 이름
네임스페이스애플리케이션이 속한 네임스페이스(Namespace)
종류(Kind)Kubernetes 워크로드 종류 (예: Deployment, StatefulSet) 또는 외부 서비스(ExternalService)
열린 시간인시던트 최초 감지 시각 및 경과 시간
지속 시간인시던트 지속 시간. 진행 중이면 해결안됨, 종료되었으면 해결됨 배지 표시
가용성가용성(Availability) SLO 준수율. SLO를 위반한 경우 빨간색으로 강조 표시됩니다.
응답 시간응답 시간(Latency) SLO 준수율. SLO를 위반한 경우 빨간색으로 강조 표시됩니다.
영향을 받은 요청인시던트로 영향받은 요청 비율(막대 그래프)
소비된 오류 예산오류 예산(Error Budget) 소비율(막대 그래프). 100% 초과 시 빨간색으로 표시됩니다.

참고: 가용성, 응답 시간, 영향을 받은 요청, 소비된 오류 예산 값은 인시던트 데이터를 추가 분석한 후 표시되므로, 로딩 중에는 스피너가 표시될 수 있습니다.

컬럼 헤더를 클릭하면 해당 컬럼 기준으로 오름차순/내림차순 정렬이 가능합니다.

SLO 조정

SLO 조정 메뉴

각 인시던트 행의 오른쪽 끝에 있는 더보기(...) 버튼을 클릭하면 해당 애플리케이션의 SLO 임계값을 빠르게 조정할 수 있습니다.

  • 가용성 SLO 조정: 가용성(Availability) SLO 임계값 수정
  • 응답 시간 SLO 조정: 응답 시간(Latency) SLO 임계값 수정
  • 알림 재전송: 미해결 인시던트에 한해 알림을 다시 전송합니다(미해결 상태일 때만 표시).

참고: SLO 임계값 조정은 해당 애플리케이션에만 적용됩니다. 전체 기본값 변경은 설정 > 검사 조건 설정에서 할 수 있습니다.


인시던트 상세

인시던트 목록에서 인시던트 ID 또는 애플리케이션 이름을 클릭하면 해당 인시던트의 상세 페이지로 이동합니다.

인시던트 상세 화면

헤더 정보

인시던트 상세 헤더

상세 페이지 상단에는 다음 정보가 표시됩니다.

  • 인시던트 ID: i- 접두사가 붙은 고유 식별자
  • 심각도 배지: 심각(Critical) 또는 경고(Warning)
  • 상태 배지: 진행 중이면 아직 지속되고 있음, 종료되었으면 해결됨
  • 메타 정보: 애플리케이션 이름, 네임스페이스, 시작 시간, 지속 시간

인시던트 목록 링크를 클릭하면 인시던트 목록 페이지로 돌아갑니다.

인시던트 상세 정보

인시던트 상세 정보 섹션

인시던트 상세 섹션에서는 인시던트의 기본 속성을 그리드 형태로 확인할 수 있습니다.

항목설명
심각도심각(Critical) 또는 경고(Warning). 색상 배지로 표시됩니다.
애플리케이션영향받은 애플리케이션. 클릭 시 해당 애플리케이션의 상세 다이얼로그가 열립니다.
시작됨인시던트 최초 감지 시각 및 경과 시간
해결됨해결 시각 또는 아직 지속되고 있음 상태 표시
지속 시간총 인시던트 지속 시간
카테고리애플리케이션 카테고리. 클릭 시 해당 애플리케이션 상세 페이지로 이동합니다.

서비스 수준 목표(SLO) 섹션

SLO 섹션

서비스 수준 목표(SLO) 섹션에서는 인시던트가 발생한 SLO 항목을 확인할 수 있습니다. 테이블 형식으로 다음 정보가 표시됩니다.

설명
SLOSLO 항목 이름(가용성 또는 응답 시간). 위반 여부에 따라 녹색 체크 또는 빨간색 경고 아이콘이 표시됩니다.
준수율실제 SLO 준수율. 위반된 경우 빨간색으로 강조 표시됩니다.
목표SLO 목표 조건 (예: "99%의 요청이 500ms 이내에 서비스되어야 합니다"). 연필 아이콘을 클릭하면 SLO 임계값을 직접 수정할 수 있습니다.

분석 탭

분석 탭

인시던트 상세 페이지 하단에는 두 가지 분석 탭이 제공됩니다.

설명
루트 원인 분석(RCA)인시던트 원인을 시스템이 자동 분석한 결과. 기본 선택 탭입니다.
추적인시던트 발생 시간대의 추적(Trace) 데이터

RCA(근본원인분석) 탭

RCA(Root Cause Analysis, 근본원인분석) 탭은 인시던트 상세 페이지에서 기본으로 선택되는 탭으로, 인시던트 발생 원인을 시스템이 자동으로 분석한 결과를 보여줍니다. 이 탭은 다음 다섯 가지 섹션으로 구성되며, 근본원인분석 요약을 제외한 SLI·전파 경로·인과 타임라인·상세 보고서 네 개 섹션은 접기/펼치기가 가능합니다.

1. 서비스 수준 지표(SLI) 섹션

SLI 섹션

SLI(Service Level Indicator, 서비스 수준 지표) 섹션에서는 인시던트 분석 기간 동안의 서비스 상태를 차트로 확인할 수 있습니다. 섹션 헤더에는 대상 애플리케이션 이름과 인시던트 ID가 표시됩니다.

이 섹션에는 다음 두 가지 하위 영역이 포함됩니다.

응답 시간 히트맵

응답 시간 히트맵

인시던트 기간의 응답 시간 분포를 히트맵(Heatmap)으로 시각화합니다. X축은 시간, Y축은 응답 시간, 색상 농도는 해당 구간의 요청 밀도를 나타냅니다. 히트맵에서 특정 영역을 드래그하여 선택하면, 해당 시간 구간의 추적(Trace) 데이터를 확인할 수 있는 애플리케이션 상세 다이얼로그가 열립니다.

SLI 차트

SLI 차트

응답 시간 차트와 오류율 차트가 나란히 표시되어, 인시던트 분석 기간 동안 서비스의 성능 변화 추이를 확인할 수 있습니다.

  • 응답 시간 차트: 분석 기간 동안의 요청 응답 시간 추이
  • 오류율 차트: 분석 기간 동안의 오류 발생 추이

차트 하단에는 분석 기간 동안의 SLI를 표시한다는 안내 메시지가 표시됩니다.

: SLI 차트에서 특정 구간을 드래그하여 선택하면 해당 구간에 대한 상세 분석(해당 시간 범위에 국한된 RCA)을 수행할 수 있습니다. 선택한 구간은 차트에 하이라이트로 표시됩니다.

2. 근본원인분석 요약

근본원인분석 요약 카드

시스템이 자동으로 분석한 인시던트 원인의 요약 정보가 카드 형태로 표시됩니다. 이 섹션은 다음 세 부분으로 구성됩니다.

심각도별 발견 건수

카드 상단 우측에 발견된 원인 항목의 심각도별 개수가 배지로 표시됩니다.

배지의미
심각(Critical)즉각 조치가 필요한 발견 항목 수
경고(Warning)주의가 필요한 발견 항목 수
N건 발견전체 발견 항목 수

추정 근본 원인

추정 근본 원인 강조 표시

인시던트의 가장 가능성 높은 원인이 강조 카드로 표시됩니다. 다음 정보가 포함됩니다.

  • 원인 제목: 근본 원인으로 추정되는 항목 (예: 배포 변경, 리소스 포화, 업스트림 장애 등)
  • 애플리케이션 이름: 근본 원인이 발생한 애플리케이션
  • 상세 설명: 원인에 대한 추가 설명 (예: 특정 시각의 배포, 오류 발생 건수 등)

카테고리별 분류

발견된 원인이 다음 카테고리별로 분류되어 칩(chip) 형태로 표시됩니다. 각 칩에는 해당 카테고리의 발견 건수가 함께 표시됩니다.

카테고리설명
배포(Deployment)배포 변경사항 관련 원인 (새 버전 배포, 롤아웃 이벤트 등)
업스트림(Upstream)업스트림 서비스의 장애나 SLO 위반이 현재 서비스에 영향을 준 경우
리소스(Resource)CPU, 메모리, 디스크 등 리소스 포화 관련 원인
로그(Log)로그 이상 패턴 감지 관련 원인
SLO다른 서비스의 SLO 위반이 연쇄적으로 영향을 미친 경우
데이터베이스(Database)데이터베이스 관련 이슈

3. 이슈 전파 경로

이슈 전파 경로

인시던트가 여러 애플리케이션에 걸쳐 영향을 미친 경우, 장애가 전파된 경로를 서비스 간 의존 관계 맵으로 시각적으로 보여줍니다. 섹션 헤더에는 관련 애플리케이션 수가 표시됩니다.

전파 경로 읽는 방법

  • 노드(애플리케이션): 각 사각형은 하나의 애플리케이션을 나타냅니다. 노드의 테두리 색상은 해당 애플리케이션의 상태를 나타냅니다(빨간색: 심각, 노란색: 경고, 녹색: 정상).
  • 화살표(연결선): 애플리케이션 간의 트래픽 방향을 나타냅니다. 화살표 색상은 해당 연결의 상태를 나타냅니다. 심각(Critical) 또는 경고(Warning) 상태의 연결에는 흐름 애니메이션이 표시됩니다.
  • 인시던트 발생 표시: 인시던트가 발생한 애플리케이션(대상 애플리케이션)에는 조준점 아이콘이 표시됩니다.
  • 근본 원인 표시: 근본 원인으로 추정되는 애플리케이션에는 별 아이콘이 표시됩니다.
  • 인과 관계 경로: 근본 원인에서 인시던트 대상까지의 인과 관계 경로에 포함된 노드와 연결선이 강조 표시됩니다.
  • 트래픽 통계: 연결선 위에 트래픽 통계 레이블이 표시됩니다. 특정 애플리케이션에 마우스를 올리면 해당 애플리케이션과 직접 연결된 서비스만 강조되고, 나머지는 흐려집니다.

: 애플리케이션 이름을 클릭하면 해당 애플리케이션의 상세 다이얼로그가 열려 메트릭, 로그, 분산추적 등을 추가로 분석할 수 있습니다.

참고: 맵 영역에서 마우스 휠로 확대/축소가 가능하고, 드래그로 화면을 이동할 수 있습니다. 빈 영역을 더블클릭하면 기본 위치로 복원됩니다.

4. 인과 타임라인

인과 타임라인

인시던트 발생 전후의 관련 이벤트를 시간 순서로 나열하여, 인시던트로 이어진 인과 관계를 파악할 수 있습니다. 섹션 헤더에는 이벤트 건수가 표시됩니다.

뷰 모드 전환

인과 타임라인은 두 가지 뷰 모드를 제공합니다. 섹션 헤더 우측의 버튼으로 전환할 수 있습니다.

콤팩트 뷰

인과 타임라인 콤팩트 뷰

상단에 이벤트 요약 통계가 표시됩니다.

통계 항목의미
이벤트 건수타임라인에 포함된 전체 이벤트 수
심각(Critical)심각 수준의 이벤트 수
경고(Warning)경고 수준의 이벤트 수
추정 근본 원인근본 원인으로 추정된 이벤트 표시

통계 아래에 각 이벤트가 한 줄로 간결하게 나열됩니다. 각 행에는 시간, 심각도 점(dot), 애플리케이션 이름, 이벤트 제목이 표시됩니다. 근본 원인 이벤트에는 추정 근본 원인 배지가, 인시던트 시점에는 인시던트 배지가 표시됩니다.

전체 뷰

인과 타임라인 전체 뷰

각 이벤트가 카드 형태로 상세하게 표시됩니다. 시간 축을 따라 세로로 나열되며, 각 이벤트 카드에는 다음 정보가 포함됩니다.

  • 발생 시각: 이벤트가 감지된 시각
  • 심각도 마커: 색상 원형 마커로 심각도 구분 (빨간색: 심각, 노란색: 경고, 녹색: 정보)
  • 카테고리 칩: 이벤트의 원인 카테고리 (배포, 데이터베이스, 리소스, 업스트림, 로그, SLO)
  • 심각도 칩: 이벤트의 심각도 수준
  • 애플리케이션 링크: 관련 애플리케이션 이름 (클릭 시 상세 다이얼로그 열림)
  • 이벤트 제목: 발견 항목의 제목 (예: "SLO: 가용성", "배포 변경사항: v2.1.0" 등)
  • 상세 설명: 이벤트에 대한 추가 정보

근본 원인으로 추정된 이벤트 카드는 빨간색 좌측 테두리와 깜빡이는 효과로 강조 표시되며, 추정 근본 원인 배지가 표시됩니다.

인시던트 발생 시점은 별도의 인시던트 카드로 타임라인에 삽입되어, 인시던트 전후 이벤트를 시각적으로 구분할 수 있습니다. 인시던트가 아직 진행 중인 경우 종료 시각 대신 진행중 표시가 나타납니다.

: 인과 타임라인에서 근본 원인 이벤트의 시각과 인시던트 발생 시각을 비교하면, 원인과 결과 사이의 시간 간격을 파악할 수 있습니다.

5. 상세 RCA 보고서

상세 RCA 보고서

개별 원인 항목에 대한 분석 결과를 트리 구조로 확인할 수 있습니다. 이 섹션에서는 인시던트의 원인을 계층적으로 탐색할 수 있습니다.

인시던트 시간 범위 표시

상세 RCA 보고서 상단에는 인시던트 발생 시간 범위 바가 표시됩니다. 인시던트 대상 애플리케이션 이름과 인시던트 시작~종료 시각이 표시되며, 인시던트가 아직 진행 중인 경우 종료 시각 대신 진행중 표시가 나타납니다.

트리 구조 이해

RCA 보고서 트리 구조

트리의 최상위 노드는 인시던트가 발생한 애플리케이션의 SLO 위반 상태를 나타냅니다. 이 아래로 원인 카테고리별 그룹 노드가 배치되고, 각 그룹 아래에 개별 발견 항목(finding) 노드가 위치합니다.

트리 노드 구성 요소

각 노드에는 다음 정보가 표시됩니다.

요소설명
접기/펼치기 화살표하위 노드가 있는 경우 클릭하여 접기/펼치기 가능
노드 이름카테고리명 또는 발견 항목 제목
애플리케이션 링크관련 애플리케이션으로 이동하는 아이콘 (클릭 시 상세 다이얼로그 열림)
추정 근본 원인 배지근본 원인으로 판단된 노드에 빨간색 배지 표시
인시던트 배지인시던트 대상 노드에 표시
원인 가능성 아이콘원인일 가능성이 있는 노드에 빨간색 경고 아이콘 표시
신뢰도 배지원인의 신뢰도 수준 (높음/중간/낮음)
스파크 차트해당 항목의 시계열 데이터를 소형 꺾은선 차트로 시각화. 인시던트 발생 구간이 빨간색 음영으로 표시됩니다.
시간 범위이벤트가 발생한 시간 범위

카테고리 그룹 노드

트리에서 카테고리 그룹 노드는 발견된 원인을 유형별로 묶어 보여줍니다.

카테고리설명
배포 변경사항분석 기간 중 발생한 배포, 롤아웃 이벤트
업스트림 서비스 이슈상위 서비스의 장애나 SLO 위반
리소스 포화CPU, 메모리, 디스크 등 인프라 리소스의 포화 상태
로그 이상오류/경고 수준의 로그 패턴 급증
SLO 연쇄다른 서비스의 SLO 위반이 연쇄적으로 영향
데이터베이스 이슈데이터베이스 응답 시간 저하, 연결 문제 등

발견 항목(Finding) 노드

최하위 노드인 발견 항목에는 구체적인 원인 정보가 포함됩니다.

  • 애플리케이션 이름: 원인이 발생한 애플리케이션
  • 리포트 카테고리: 관련 리포트 영역 (예: SLO, CPU, 메모리, 네트워크 등)
  • 검사 항목: 임계값을 초과한 검사 조건 항목명
  • 스파크 차트: 해당 메트릭의 시계열 추이. 차트 위에 마우스를 올리면 해당 시점의 값과 시각이 툴팁으로 표시됩니다.

각 발견 항목의 스파크 차트에서도 인시던트 발생 구간이 빨간색 음영과 점선으로 표시되어, 원인 이벤트와 인시던트 발생 시점의 상관관계를 시각적으로 확인할 수 있습니다.

노드 상세 정보 확인

RCA 노드 상세 다이얼로그

발견 항목 노드를 클릭하면 상세 다이얼로그가 열립니다. 다이얼로그에서 제공하는 정보는 원인 유형에 따라 다릅니다.

로그 패턴 상세

로그 이상 카테고리의 발견 항목을 클릭하면 다음 정보가 포함된 로그 패턴 다이얼로그가 열립니다.

  • 심각도: 로그 레벨 (Critical, Error, Warning, Info, Debug)
  • 발생 건수: 해당 로그 패턴의 총 발생 횟수
  • 시계열 차트: 로그 패턴 발생 추이 차트
  • 샘플 메시지: 해당 로그 패턴에 해당하는 실제 로그 메시지 샘플

다이얼로그 하단의 메시지 보기 버튼을 클릭하면 해당 애플리케이션의 로그 탭에서 동일 패턴의 전체 로그 메시지를 확인할 수 있습니다.

메트릭 상세

리소스, SLO 등 메트릭 기반 발견 항목을 클릭하면 해당 메트릭의 상세 위젯(차트)이 다이얼로그로 표시됩니다. 인시던트 전후 기간의 메트릭 변화를 시각적으로 비교할 수 있습니다.


추적(분산추적) 탭

추적 탭

인시던트 상세의 추적 탭에서는 인시던트 발생 시간대의 추적(Trace) 데이터를 확인할 수 있습니다. 인시던트가 발생한 애플리케이션에 대해 인시던트 시간 범위로 자동 필터링된 추적 히트맵과 추적 목록이 표시됩니다.

응답 시간 SLO가 설정된 경우, 해당 임계값을 초과한 추적(Trace)이 자동으로 필터링되어 표시됩니다. 특정 추적을 클릭하면 스팬(Span) 상세 정보를 확인할 수 있습니다.

: 추적 탭에서 응답 시간이 급증한 추적(Trace)을 분석하면, RCA에서 추정한 근본 원인을 실제 요청 흐름 수준에서 검증할 수 있습니다.


인시던트 조사 워크플로

인시던트를 효과적으로 조사하려면 다음 단계를 따릅니다.

  1. 인시던트 목록에서 현황 파악: 상태 요약 스트립에서 심각(Critical)/경고(Warning) 인시던트 개수를 확인합니다.
  2. 대상 인시던트 선택: 심각도 필터 또는 애플리케이션 필터를 사용하여 조사할 인시던트를 선택합니다.
  3. SLO 위반 내역 확인: 인시던트 상세 페이지에서 가용성(Availability)과 응답 시간(Latency) SLO의 준수율을 확인합니다.
  4. RCA 요약으로 원인 파악: RCA 탭의 근본원인분석 요약에서 추정 근본 원인과 카테고리별 분류를 확인합니다.
  5. 전파 경로 분석: 이슈 전파 경로에서 장애가 어떤 서비스에서 시작되어 어디로 전파되었는지 확인합니다.
  6. 인과 타임라인 검토: 인과 타임라인에서 근본 원인 이벤트와 인시던트 발생 사이의 시간 관계를 파악합니다.
  7. 상세 분석: 필요에 따라 상세 RCA 보고서에서 개별 원인을 트리 구조로 탐색하거나, 분산추적 탭에서 실제 요청 흐름을 분석합니다.
  8. 애플리케이션 상세로 이동: 애플리케이션 링크를 클릭하여 관련 메트릭, 로그, 분산추적을 추가로 분석합니다.

알림(Alerts) 메뉴

좌측 사이드바의 인시던트 바로 아래에 알림 메뉴가 있습니다. 인시던트(Incident)가 SLO 위반·이상 탐지로 자동 생성되는 상위 이벤트라면, 알림(Alert)은 개별 검사 항목이나 사용자가 정의한 알림 규칙이 발화(firing)했을 때 생성되는 통지입니다. 알림 메뉴에서는 발화된 알림 목록을 조회하고 해결·일시 중지하거나, 알림을 발생시키는 규칙 자체를 관리합니다.

알림 목록 화면

화면은 상단 탭으로 알림 목록알림 규칙 두 가지로 나뉩니다.

알림 목록 탭

발화 중이거나 해결된 알림을 표 형태로 보여줍니다.

  • 상태 요약 카운터: 상단 좌측에 심각도별(위험/경고) 발화 건수가 표시되며, 클릭하면 해당 심각도만 필터링됩니다.
  • 해결된 알림 표시: 기본적으로 발화 중(firing)인 알림만 표시되며, 토글을 켜면 해결된 알림도 함께 표시됩니다.
  • 보안 알림만: 보안 공격 탐지로 생성된 알림만 필터링합니다.
  • 애플리케이션 필터: 우측 상단의 카테고리·네임스페이스 필터로 특정 앱 그룹의 알림만 조회할 수 있습니다.

목록 테이블의 각 컬럼은 다음과 같습니다.

컬럼설명
알림 메시지알림 요약과 알림 ID(a-...). 앞의 아이콘이 상태를 나타냅니다 — 경보 중(mdi-bell-alert), 해결됨(✓ mdi-check-circle), 일시 중지(mdi-bell-off)
애플리케이션알림이 발생한 애플리케이션. 클릭하면 앱 상세로 이동
네임스페이스애플리케이션이 속한 네임스페이스
종류워크로드 종류(Deployment, DaemonSet, StatefulSet 등)
알림 규칙 수정이 알림을 발생시킨 규칙의 편집 아이콘. 클릭하면 규칙 편집 화면으로 이동
발생 시각알림이 최초 발화한 시각과 경과 시간
지속 시간발화 이후 지속된 시간과 현재 상태(경보 중/해결됨)
심각도경고(WARNING) 또는 위험(CRITICAL)

체크박스로 여러 알림을 선택하면 상단에 일괄 작업 바가 나타나며, 선택한 알림을 한 번에 해결·일시 중지·재열기할 수 있습니다.

알림 상세

알림 행을 클릭하면 상세 다이얼로그가 열립니다.

알림 상세 다이얼로그
  • 헤더: 심각도 배지와 현재 상태(경보 중/해결됨/일시 중지)
  • 태그: 알림 ID, 애플리케이션, 네임스페이스, 워크로드 종류, 알림 규칙명
  • 알림 메시지: 발화 조건에 대한 사람이 읽을 수 있는 요약
  • 발생 위치: 알림이 걸린 애플리케이션(링크 클릭 시 앱 상세로 이동)
  • 시간 정보: 발생 시각, 지속 시간, 데이터 소스(예: Logs, SLO)
  • 액션 버튼: 해결(수동 해결), 일시 중지(지정 시간 동안 알림 억제), 알림 재전송(현재 발화 중인 알림을 Slack/Teams 등 외부 채널과 화면 토스트로 다시 전송)

알림 규칙 탭

상단 탭에서 알림 규칙을 클릭하면 알림을 발생시키는 규칙 목록이 표시됩니다.

알림 규칙 목록 화면
  • 상단에 활성화/비활성화 규칙 개수가 표시되고, 우측 상단의 버튼으로 새 규칙을 추가하거나 내보내기(Export) 아이콘으로 규칙을 JSON으로 내보낼 수 있습니다.
  • 규칙명 앞의 아이콘으로 종류를 세 가지로 구분합니다.
    • 잠금(mdi-lock) -- 설정 파일 관리(config-managed) 규칙. 설정 파일로 배포되어 화면에서는 편집·삭제할 수 없습니다.
    • 방패(mdi-shield-check) -- 기본 제공(builtin) 규칙. 시스템이 최초 설치 시 자동으로 만든 규칙이며, 사용자 정의 규칙과 동일하게 편집·삭제할 수 있습니다(규칙명이 한글로 번역되어 표시된다는 점이 다릅니다).
    • 벨(mdi-bell-ring) -- 사용자 정의 규칙. 편집·삭제가 모두 가능합니다.
컬럼설명
알림 규칙명규칙 이름(Slack/Teams 메시지에 표시). 기본 제공 규칙은 한글로 번역되어 표시
데이터 소스규칙이 평가하는 소스 유형(검사 항목 기반, 로그 패턴, PromQL, K8s 이벤트 등)
심각도경고 또는 위험
선택자규칙이 적용되는 대상(모든 애플리케이션 / 카테고리별 / 개별 선택)
현재 발생 건수이 규칙으로 현재 발화 중인 알림 수(클릭 시 해당 알림만 필터링)
상태규칙 활성/비활성 토글

시스템은 최초 설치 시 SLO·CPU·메모리·스토리지·네트워크·인스턴스·DB·런타임·DNS·로그 등 약 40여 개의 기본 제공 규칙을 자동 생성합니다. 기본 제공 규칙의 임계값은 설정 > 검사 조건 설정에서 프로젝트 수준으로 재정의할 수 있습니다.

알림 규칙 설정

버튼(또는 사용자 정의 규칙의 편집)을 클릭하면 규칙 설정 다이얼로그가 열립니다.

알림 규칙 생성 다이얼로그
설정 항목설명
규칙 이름알림 메시지에 표시되는 식별 이름(예: 주문 서비스 응답 지연)
데이터 소스규칙이 평가할 소스를 선택 — 검사 항목 기반(내장 검사의 상태), 로그 패턴(로그의 에러/경고 집계), PromQL(메트릭 쿼리 표현식), K8s 이벤트(FailedScheduling 등 이벤트 집계), 공격 IP(보안 탐지), 리소스 예측(자원 고갈 예측)
심각도경고(주의 필요) 또는 위험(즉각 대응 필요)
애플리케이션 선택모든 애플리케이션 / 특정 카테고리 / 개별 앱(glob 패턴)
타이밍경보 대기 시간·해결 유예 시간(아래 참조)
활성화규칙의 활성/비활성

타이밍: 경보 대기 시간과 해결 유예 시간

불필요한 알림(알림 피로)과 플래핑(flapping)을 방지하기 위한 두 가지 시간 설정입니다.

  • 경보 대기 시간(For): 조건이 연속으로 지속되어야 알림을 발생시키는 대기 시간입니다. 대기 중 조건이 해소되면 대기가 취소됩니다. 일시적 스파이크로 인한 오알림을 걸러냅니다. 0으로 두면 조건 감지 즉시 발화합니다.
  • 해결 유예 시간(KeepFiringFor): 조건이 해소된 후에도 알림을 유지하는 시간입니다. 유예 중 조건이 다시 충족되면 알림이 계속 유지됩니다. 조건이 해소·재발을 반복할 때 알림이 열렸다 닫혔다 하는 플래핑을 방지합니다.
경보 대기해결 유예동작
0초0초즉시 발화, 즉시 해결 (민감)
300초0초5분 지속 시 발화, 해소 즉시 해결
0초300초즉시 발화, 해소 후 5분 유지
300초300초5분 지속 시 발화, 해소 후 5분 유지 (안정적)

알림 채널 연결

발화된 알림을 Slack, MS Teams, Webhook 등 외부 채널로 통보하려면 설정 > 알림채널 연결에서 채널을 구성합니다. 채널별로 인시던트·배포·알림 수신 여부와 알림 언어(한국어/영어)를 선택할 수 있습니다. 자세한 내용은 설정 -- 알림채널 연결을 참조하세요.


관련 문서