Debezium CDC silent data errors

Debezium은 소스를 그대로 복제하지 않는다: 데이터가 조용히 어긋나는 세 가지 사례

회사 기술 블로그에서 Debezium과 Flink로 CDC 파이프라인을 재설계하고, 이를 기반으로 데이터 복제 방식을 증분 처리 중심으로 전환한 이야기를 다룬 적이 있습니다. MySQL의 변경분을 Debezium이 캡처하고, Kafka를 거쳐, Flink가 S3와 Iceberg 테이블로 복제하는 구조입니다. 전체 아키텍처와 선택 배경은 그 글들에서 다뤘으니 여기서는 생략하겠습니다. 이 글은 그 다음 이야기입니다. Debezium을 운영하면서 겪은 일은 크게 두 종류였습니다. 하나는 데이터가 조용히 어긋나는 문제였고, 다른 하나는 커넥터가 예상과 다르게 움직이는 문제였습니다. 이번 글에서는 먼저 데이터가 어긋났던 경우들만 정리합니다. ...

2026년 9월 5일 · 7 분 · Jaehyuk Jang
CDC Small File Problem

CDC 파이프라인의 숨겨진 비용: Small File이 만드는 S3 Request 폭탄

CDC 파이프라인을 Debezium과 Flink로 재설계한 이유에서 Debezium + Flink 기반 CDC 파이프라인을 소개했습니다. Debezium이 DB 변경분을 캡처하고, Kafka를 거쳐, Flink가 5분마다 S3에 Parquet 파일로 저장하는 구조입니다. 파이프라인은 1년 넘게 잘 동작했습니다. 데이터 정합성도 검증됐고, 운영도 안정적이었습니다. 문제는 데이터 플랫폼 TCO 분석을 하면서 S3 비용을 뜯어보기 전까지는 보이지 않았습니다. S3 비용, 스캔량만 보면 안 됩니다 AWS에서 Athena를 쓰는 팀이라면 대부분 이렇게 알고 있습니다: “Athena 비용 = 스캔한 데이터량 × $5/TB” ...

2026년 6월 11일 · 7 분 · Jaehyuk Jang