적용 대상과 진단 범위
서버에서 ECC Correctable Error가 반복되면 DIMM, 채널과 발생 추이를 기록하고 BMC, 운영체제 로그를 대조합니다.
Correctable은 오류가 교정됐다는 의미이지 원인 부품의 확정 진단이나 무시해도 된다는 보장은 아닙니다. 특정 슬롯 집중 여부, 재부팅, 부하와의 관계, BIOS, BMC 변경을 확인합니다. DIMM, 슬롯, 채널과 플랫폼 조건은 별도 근거로 좁혀야 합니다.
상태를 보존하며 확인할 순서
- 서버 모델, BIOS, BMC 버전과 메모리 배치를 기록합니다.
- BMC SEL과 운영체제 로그를 시각, DIMM, 채널별로 대조합니다.
- 빈도 변화와 Uncorrectable, 재부팅 동반 여부를 확인합니다.
- 로그를 보존한 뒤 해당 제조사의 모델별 진단, 교체 조건을 확인합니다.
작업을 보류할 조건
- Uncorrectable 오류나 반복 재시작이 나타나면 운영 안정성과 서비스 중단 계획을 먼저 검토합니다.
- DIMM 식별, 장착 순서, 정전 절차를 확인하지 못하면 이동, 교체 시험을 하지 않습니다.
혼동하기 쉬운 조치
- Correctable이라는 이유로 반복 오류를 무시하는 것
- SEL을 저장하지 않고 지우거나 임의 횟수 기준으로 DIMM을 교체하는 것
진단 기록
- 서버, 펌웨어 버전
- DIMM 슬롯, 채널 배치
- 로그, 발생 시각, 빈도
- 부하, 재부팅 동반
- 제조사 진단과 변경 결과
다음 판단의 기준
교정 여부와 원인 부품 판단을 구분합니다. 서비스 영향과 모델별 메모리 배치 조건을 확인하고 한 번에 한 항목씩 비교합니다.
Dell PowerEdge 문서의 절차를 다른 서버에 그대로 적용하지 않습니다. 모든 서버에 공통인 오류 횟수 임계값이나 자동 교체 기준을 제시하지 않습니다.