여기서는 멈추세요
- 명령 출력의 서버·서비스·경로가 예상 대상과 다르면 변경 단계로 넘어가지 않습니다.
- 현재 접속 세션, 백업 또는 콘솔 복구 경로를 확보하지 못했다면 상태 변경 명령을 실행하지 않습니다.
I/O LATENCY
SAFE OPERATING BOUNDARY
변경 전 설정과 출력값을 기록하고, 예상과 다른 결과가 나오면 추가 변경을 멈춘 뒤 승인된 운영 복구 절차로 되돌립니다.
BEFORE YOU START
CHECK THE BRANCH
CPU가 디스크 I/O 완료를 기다리는 시간이 큰 상황을 우선 조사합니다.
메모리 회수나 thrashing으로 모든 비유휴 작업이 멈춘 시간을 의심합니다.
게스트가 하이퍼바이저에 CPU 시간을 빼앗기는 상황을 인프라 지표와 대조합니다.
FOLLOW THE FLOW
한 번의 수치보다 짧은 구간의 흐름을 기록합니다.
uptimevmstat 1 5vmstat의 r은 실행 대기, b는 I/O 등으로 중단 불가능한 대기, wa는 I/O wait, st는 steal time입니다.
wa·b가 높으면 I/O, si·so가 지속되면 메모리 압박 분기로 이동합니다.
PSI가 제공되는 커널에서는 CPU·메모리·I/O 때문에 작업이 멈춘 비율을 비교합니다.
cat /proc/pressure/cpucat /proc/pressure/memorycat /proc/pressure/ioavg10·avg60·avg300은 최근 구간의 정체 비율입니다. full이 지속되면 전체 workload가 멈추는 병목을 뜻합니다.
가장 높은 pressure 자원을 기준으로 다음 조사를 좁힙니다.
운영 부하를 고려해 짧은 표본만 수집합니다. pidstat는 sysstat 패키지가 있을 때 사용합니다.
ps -eo state,pid,ppid,comm,wchan:32 --sort=state | grep '^D'pidstat -d 1 5명령이 없으면 설치를 강행하지 말고 기존 모니터링을 사용합니다.특정 PID의 읽기·쓰기와 await가 집중되면 해당 서비스·배치 작업을 조사합니다.
PID, 실행 명령, 장애 시작 시각을 기록합니다.
성능 병목과 실제 장치 오류를 구분합니다.
lsblk -o NAME,TYPE,SIZE,FSTYPE,MOUNTPOINTSjournalctl -k -b -p warning --no-pager | grep -Ei 'I/O error|timeout|reset|nvme|blk_update'I/O error·timeout·reset이 있으면 애플리케이션 튜닝보다 스토리지 안정성 확인이 먼저입니다.
장치 오류가 있으면 쓰기 작업을 줄이고 백업·인프라 담당자에게 증거를 전달합니다.
원인 서비스가 확정된 경우에만 배치 중단·동시성 축소·재시작 등 운영 절차를 적용합니다.
sudo systemctl restart SERVICE_NAMEvmstat 1 5 && cat /proc/pressure/io응답 시간이 회복되고 wa·b·I/O pressure가 함께 낮아지는지 확인합니다.
재발하면 장치 지연과 애플리케이션 I/O 패턴을 장기 지표로 비교합니다.
PRIMARY REFERENCES
배포판과 버전에 따라 옵션·로그 위치가 다를 수 있습니다. 실행 전 서버의 --help와 로컬 매뉴얼을 함께 확인하세요.