- Published on
2026년 5월 7일 저녁 AWS us-east-1의 가용 영역 use1-az4에서 데이터 홀 한 곳의 냉각 장치가 동시에 고장 났고, Coinbase는 거래와 입출금을 포함한 대부분의 서비스가 약 8시간 중단되는 장애를 겪었습니다. 6월 1일 공개된 Coinbase의 포스트모템은 5노드 Raft 체결 엔진 중 3노드가 동시에 죽어 쿼럼을 잃은 과정과, AWS 관리형 Kafka인 MSK의 컨트롤 플레인 결함으로 파티션 리더 재선출이 일어나지 않아 복구가 더 길어진 과정을 함께 설명합니다. 이 글은 그 포스트모템을 근거로, 쿼럼 산수가 장애의 독립성이라는 전제 위에서만 성립한다는 점, 클러스터 배치 그룹이 지연 시간을 얻는 대가로 그 전제를 의도적으로 깬다는 점, 재해 때만 실행되는 복구 경로는 사실상 테스트된 적 없는 코드라는 점을 짚습니다. 동시에 이 사건이 가르치지 않는 것도 함께 적습니다 — Coinbase는 코로케이션 선택 자체를 철회하지 않았고, 2-AZ 구성이 영향 범위를 키웠지만 MSK 결함은 2-AZ와 3-AZ에 똑같이 영향을 줬다고 스스로 밝혔습니다. 그리고 AWS는 이 사건에 대한 공식 post-event summary를 내지 않았기에, MSK 결함에 관한 서술은 전적으로 Coinbase 측 진술입니다.