Haru Utils

SERVER TROUBLESHOOTING PLAYBOOK

서버 이슈를
순서대로 해결하세요

Linux·Ubuntu 서버에서 자주 만나는 문제와 기본 점검 항목을 조회 명령어부터 결과 해석, 안전한 조치와 재확인까지 한 단계씩 안내합니다.
  1. 1
    증상 검색

    오류 문구나 현상으로 관련 가이드를 찾습니다.

  2. 2
    조회부터 실행

    변경 없는 명령어로 장애 범위를 좁힙니다.

  3. 3
    결과 해석

    출력에서 무엇을 확인할지 바로 안내합니다.

  4. 4
    조치 후 검증

    위험도를 확인하고 같은 기준으로 재검증합니다.

컨테이너5단계

Kubernetes Pending·PVC·Node NotReady 장애

Pending Pod의 scheduler 이벤트를 시작점으로 리소스·taint·affinity, PVC 바인딩, Node Ready·Pressure 상태를 분리하고 데이터 손실 없는 조치만 선택합니다.

Pod PendingFailedSchedulingunbound immediate PersistentVolumeClaims
진단 순서 시작
컨테이너5단계

Docker daemon·socket 권한 장애

Cannot connect와 permission denied를 daemon 중단, 잘못된 context·DOCKER_HOST, Unix socket 권한, rootless 모드로 나눠 과도한 chmod 없이 해결합니다.

Cannot connect to the Docker daemonpermission denied docker.sockIs the docker daemon running
진단 순서 시작
데이터베이스5단계

Redis 연결·메모리·eviction 장애

Connection refused·timeout·NOAUTH와 OOM·evicted_keys를 분리하고 INFO·CONFIG GET으로 메모리 여유와 정책을 확인한 뒤 데이터 성격에 맞는 조치만 적용합니다.

Redis connection refusedRedis timeout NOAUTHOOM command not allowed
진단 순서 시작
데이터베이스5단계

MySQL lock·deadlock·slow query 장애

잠금 대기, InnoDB deadlock, 느린 SQL을 performance_schema와 정규화된 digest로 구분하고 민감한 SQL 노출과 무분별한 세션 종료 없이 조치합니다.

MySQL lock wait timeoutDeadlock found when trying to get lockSHOW ENGINE INNODB STATUS
진단 순서 시작
CPU·메모리5단계

JVM OutOfMemoryError·OS OOM 장애

Java heap·Metaspace·direct/native memory와 Linux OOM kill을 구분하고 JVM flags, GC·class histogram, dump 공간과 민감도를 확인한 뒤 증거를 보존하며 최소 설정만 변경합니다.

Java heap spaceOutOfMemoryErrorMetaspace OOM
진단 순서 시작
서비스5단계

PM2 재시작 루프·errored 상태

PM2 restart count와 exit code, 애플리케이션 로그·cwd·Node 경로·의존성을 분리하고 watch·memory restart·startup PATH·backoff 설정을 검토해 반복 호출 없이 복구합니다.

PM2 restart loopPM2 erroredPM2 restart count
진단 순서 시작
서비스5단계

Kafka consumer lag·rebalance 장애

consumer group의 CURRENT-OFFSET·LOG-END-OFFSET·LAG·active member와 partition 편중, broker·application 처리율을 구분하고 offset reset의 중복·유실 위험을 차단하며 복구합니다.

Kafka consumer lagkafka-consumer-groupsconsumer group rebalance
진단 순서 시작
데이터베이스5단계

OpenSearch red·unassigned shard 장애

cluster health에서 primary·replica unassigned를 구분하고 Allocation Explain의 disk·filter·awareness·same_shard·max_retry 결정을 확인해 강제 stale primary 없이 안전하게 재할당합니다.

OpenSearch red clusterunassigned shardscluster allocation explain
진단 순서 시작
웹·보안5단계

TLS 인증서 만료·체인·SNI·프로토콜 장애

curl -k로 우회하지 않고 UTC 시각, SAN·만료일, 검증 체인, SNI별 leaf 인증서와 TLS 1.2·1.3 협상 결과를 분리해 확인한 뒤 NGINX 설정과 인증서 갱신을 안전하게 적용합니다.

certificate expiredunable to get local issuer certificateTLS SNI wrong certificate
진단 순서 시작

도구 빠른 검색

최근 사용한 도구를 다시 열거나, 이름과 기능으로 검색하세요.

검색어와 도구의 입력·결과는 저장하지 않습니다.

↑↓ 이동 · Enter 열기 · Esc 닫기