5.1. 인시던트
SLO(서비스 수준 목표) 위반 또는 시스템 이상이 탐지되면 자동으로 생성되는 경보 목록을 확인하고 근본 원인을 분석합니다.

개요
인시던트 메뉴에서는 OPENMARU Observability가 자동으로 탐지한 인시던트(Incident)를 한눈에 파악할 수 있습니다. 인시던트(Incident)는 SLO(Service Level Objective, 서비스 수준 목표)를 위반하거나 애플리케이션 이상이 탐지될 때 자동으로 생성되는 경보입니다.
이 화면에서는 현재 진행 중인 인시던트와 해결된 인시던트를 조회하고, 인시던트별 심각도(Severity), 지속 시간, 영향받은 요청 비율, 오류 예산(Error Budget) 소비량을 확인할 수 있습니다. 각 인시던트를 클릭하면 상세 페이지로 이동하여 RCA(Root Cause Analysis, 근본원인분석)를 통해 인시던트 발생 원인을 파악할 수 있습니다.
화면 구성
인시던트 페이지는 다음 영역으로 구성됩니다.
- 상단 헤더: 애플리케이션 필터
- 상태 요약 스트립: 심각도별 인시던트 개수 및 해결된 인시던트 표시 옵션
- 인시던트 목록 테이블: 전체 인시던트 목록 및 SLO 영향 지표
주요 기능
상태 요약 스트립으로 현황 파악

화면 상단의 상태 요약 스트립에서 심각도별 인시던트 개수를 한눈에 확인할 수 있습니다.
| 상태 | 의미 |
|---|---|
| 심각 | 즉각 조치가 필요한 인시던트 수 |
| 경고 | 주의가 필요한 인시던트 수 |
| 해결됨 (심각) | 심각 상태에서 해결된 인시던트 수 |
| 해결됨 (경고) | 경고 상태에서 해결된 인시던트 수 |
특정 상태 항목을 클릭하면 해당 상태의 인시던트만 목록에 필터링되어 표시됩니다. 다시 클릭하면 필터가 해제됩니다.
팁: 심각을 클릭하면 즉각 대응이 필요한 인시던트를 빠르게 확인할 수 있습니다.
해결된 인시던트 표시

기본적으로 현재 진행 중인(해결되지 않은) 인시던트만 표시됩니다. 해결된 인시던트 표시 체크박스를 활성화하면 해결된 인시던트도 목록에 포함됩니다.
해결된 인시던트는 목록에서 반투명하게 표시되며, 지속 시간 열에 해결됨 배지가 표시됩니다.
참고: 해결된 인시던트 표시 설정은 브라우저에 저장되어, 다음 접속 시에도 마지막 선택이 유지됩니다.
인시던트는 해결 유예 시간이 지나야 해결됩니다
애플리케이션의 SLO 상태가 정상으로 돌아와도 서버는 인시던트를 바로 해결하지 않습니다. 서버는 정해진 시간(인시던트 해결 유예) 동안 기다린 뒤 인시던트를 해결합니다. 같은 장애로 인시던트가 해결되고 다시 열리는 일과, 그때마다 나가는 통보를 줄이기 위한 기능입니다.
| 항목 | 동작 |
|---|---|
| 기본값 | 5분(300초). 최대 3600초입니다. |
| 0 으로 설정 | 유예를 쓰지 않습니다. SLO 상태가 정상이 된 평가에서 바로 해결합니다. |
| 시간을 세는 기준 | SLO 상태가 정상으로 돌아온 평가 시각 |
| 유예 시간 안에 SLO 를 다시 위반 | 같은 인시던트가 이어집니다. 새 인시던트가 열리 지 않고, 통보도 나가지 않습니다. 다음에 정상으로 돌아오면 그때부터 다시 셉니다. 심각도가 바뀌면 심각도만 바꾸고 통보합니다. |
| 유예 시간 동안 SLO 가 계속 정상 | 인시던트를 해결하고 해결 통보를 보냅니다. |
| 기록되는 해결 시각 | SLO 상태가 정상으로 돌아온 시각 |
- 유예 중에는 SLO 상태가 정상이어도 목록에 해결안됨으로 남습니다. 그래서 해결 통보는 SLO 가 정상이 되고 유예 시간이 지난 뒤에 받습니다.
- 유예 중에 데이터가 없어 SLO 상태를 판정할 수 없게 되어도, 유예 시간이 지나면 인시던트를 해결합니다.
- 아래 "없어진 워크로드의 인시던트" 의 자동 해결에는 이 유예를 적용하지 않습니다.
유예 시간은 프로젝트마다 하나이며, 설정 > 알림채널 연결 탭의 인시던트 해결 유예 카드에서 바꿉니다. 자세한 내용은 설정 의 "인시던트 해결 유예" 절을 참고합니다. 이 값은 알림 규칙의 해결 유예 시간 (초) 와 다른 설정입니다. 두 설정의 차이는 아래 "타이밍: 경보 대기 시간과 해결 유예 시간" 절에 있습니다.
없어진 워크로드의 인시던트는 자동으로 해결됩니다
Kubernetes 에서 Deployment·StatefulSet·DaemonSet 을 삭제하면, 그 애플리케이션의 인시던트는 최대 약 1시간 뒤 자동으로 해결됨이 됩니다. 삭제한 직후에는 최근 1시간의 수집 데이터에 그 애플리케이션이 남아 있기 때문에 바로 해결되지 않습니다.
- 자동으로 해결될 때는 알림채널(Slack·MS Teams·이메일·Webhook)로 해결 알림을 보내지 않습니다.
- 같은 이름으로 다시 배포한 뒤 다시 문제가 생기면, 새 인시던트가 열립니다.
- 한 클러스터의 수집이 1시간 넘게 끊기면, 그 클러스터 워크로드의 인시던트가 알림 없이 해결될 수 있습니다.
다음 인시던트는 자동으로 해결되지 않습니다.
| 경우 | 결과 |
|---|---|
| 외부 서비스(ExternalService)의 호출이 끊김 | 해결안됨으로 남습니다. |
| 파드는 실행 중이지만 요청이 없는 애플리케이션 | 해결안됨으로 남습니다. 아래 기준에 따라 목록에서 지워집니다. |
참고: 인시던트 목록에는 수동 해결 메뉴가 없습니다. 수동 해결은 알림 메뉴의 알림에서만 할 수 있습니다.
오래된 인시던트는 자동으로 지워집니다
서버는 하루에 한 번 오래된 인시던트를 지웁니다. 기준은 서버의 메트릭 캐시 저장기 간(cache-ttl, 기본 60일)입니다.
인시던트 상세 화면의 그래프가 이 데이터로 그려지기 때문입니다.
| 인시던트 상태 | 열린 지 (저장기간 - 1일)이 지나면 |
|---|---|
| 해결됨 | 지웁니다. |
| 해결안됨, 애플리케이션이 지금도 오류 중 | 남깁니다. |
| 해결안됨, 요청이 없어 판단할 수 없거나 애플리케이션이 없음 | 지웁니다. |
기본 설정(저장기간 60일)에서는 열린 지 약 59일이 지난 인시던트를 지웁니다. 저장기간이 1일 이하이면 인시던트를 지우지 않습니다. 남긴 인시던트의 상세 화면은 최근 6시간 데이터로 표시됩니다. 아래 오래된 인시던트의 상세 화면 절을 참고합니다.
알림 이력은 다른 기준을 씁니다. 해결된 알림은 해결된 지 (저장기간 + 2일)이 지나면 지웁니다. 해결되지 않은 알림은 지우지 않습니다.
참고: 알림채널 메시지의 링크로 지워진 인시던트를 열면, 화면에 "failed to get incident" 가 나오고 인시던트 목록으로 돌아갑니다.
저장기간을 늘리려면 서버의 캐시 저장기간 설정(cache-ttl, 환경 변수 CACHE_TTL)을 늘립니다. 이 값은 화면에서 바꿀 수 없습니다.
저장기간을 늘리면 그만큼 메트릭 저장 공간도 더 필요합니다.
애플리케이션 필터

페이지 우측 상단의 애플리케이션 필터를 사용해 특정 애플리케이션 또는 네임스페이스(Namespace)의 인시던트만 표시할 수 있습니다. 인시던트 ID나 키워드를 검색하여 특정 인시던트를 빠르게 찾을 수도 있습니다.
인시던트 목록 테이블

인시던트 목록 테이블에는 다음 정보가 표시됩니다.
| 컬럼 | 설명 |
|---|---|
| 인시던트 | 인시던트 ID (예: i-123). 심각도에 따라 색상이 다르게 표시됩니다. |
| 애플리케이션 | 인시던트가 발생한 애플리케이션 이름 |
| 네임스페이스 | 애플리케이션이 속한 네임스페이스(Namespace) |
| 종류(Kind) | Kubernetes 워크로드 종류 (예: Deployment, StatefulSet) 또는 외부 서비스(ExternalService) |
| 열린 시간 | 인시던트 최초 감지 시각 및 경과 시간 |
| 지속 시간 | 인시던트 지속 시간. 진행 중이면 해결안됨, 종료되었으면 해결됨 배지 표시 |
| 가용성 | 가용성(Availability) SLO 준수율. SLO를 위반한 경우 빨간색으로 강조 표시됩니다. |
| 응답 시간 | 응답 시간(Latency) SLO 준수율. SLO를 위반한 경우 빨간색으로 강조 표시됩니다. |
| 영향을 받은 요청 | 인시던트로 영향받은 요청 비율(막대 그래프) |
| 소비된 오류 예산 | 오류 예산(Error Budget) 소비율(막대 그래프). 100% 초과 시 빨간색으로 표시됩니다. |
참고: 가용성, 응답 시간, 영향을 받은 요청, 소비된 오류 예산 값은 인시던트 데이터를 추가 분석한 후 표시되므로, 로딩 중에는 스피너가 표시될 수 있습니다.
컬럼 헤더를 클릭하면 해당 컬럼 기준으로 오름차순/내림차순 정렬이 가능합니다.
SLO 조정

각 인시던트 행의 오른쪽 끝에 있는 더보기(...) 버튼을 클릭하면 해당 애플리케이션의 SLO 임계값을 빠르게 조정할 수 있습니다.
- 가용성 SLO 조정: 가용성(Availability) SLO 임계값 수정
- 응답 시간 SLO 조정: 응답 시간(Latency) SLO 임계값 수정
- 알림 재전송: 미해결 인시던트에 한해 알림을 다시 전송합니다(미해결 상태일 때만 표시).
참고: SLO 임계값 조정은 해당 애플리케이션에만 적용됩니다. 전체 기본값 변경은 설정 > 검사 조건 설정에서 할 수 있습니다.
인시던트 상세
인시던트 목록에서 인시던트 ID 또는 애플리케이션 이름을 클릭하면 해당 인시던트의 상세 페이지로 이동합니다.

헤더 정보

상세 페이지 상단에는 다음 정보가 표시됩니다.
- 인시던트 ID:
i-접두사가 붙은 고유 식별자 - 심각도 배지: 심각 또는 경고
- 상태 배지: 진행 중이면 아직 지속되고 있음, 종료되었으면 해결됨
- 메타 정보: 애플리케이션 이름, 네임스페이스, 시작 시간, 지속 시간
인시던트 목록 링크를 클릭하면 인시던트 목록 페이지로 돌아갑니다.
오래된 인시던트의 상세 화면
열린 시각의 데이터가 저장기간을 지난 인시던트도, 애플리케이션이 지금 오류 중이면 목록에 남습니다. 이 인시던트의 상세 화면 상단에는 다음 안내가 나옵니다.
"2026-07-21 13:53부터 계속 오류 중입니다. 열린 시각의 데이터는 저장기간이 지나 볼 수 없어, 그래프와 영향을 받은 요청·소비된 오류 예산은 최근 6시간 기준으로 표시합니다."

| 항목 | 표시 기준 |
|---|---|
| 목록의 열린 시간·지속 시간, 상세의 시작 시간 | 원래 열린 시각 |
| 그래프(SLO 히트맵 포함), 루트 원인 분석 탭 | 최근 6시간 |
| 가용성·응답 시간·영향을 받은 요청·소비된 오류 예산 (목록과 상세) | 최근 6시간 |
같은 안내는 타임라인 맵에서 여는 인시던트 창에도 나옵니다.