본문으로 이동
컬리의 BigQuery 도입기 - 1부
문서

컬리의 BigQuery 도입기 - 1부

허재진 · 컬리 · 컬리 기술 블로그

원본 보기

소개

컬리 데이터 파이프라인의 BigQuery 도입 배경과 그 주안점

AI 핵심 요약

컬리는 기존 Data Warehouse에서 최소 20분에서 1시간 이상 걸리는 적재 지연, 스토리지 부족, 파이프라인과 분석 쿼리의 자원 경쟁, 복잡한 적재 구조를 겪었습니다. 기존에는 AWS DMS와 Kafka, S3, Airflow 스크립트를 거쳐 데이터를 적재했으며, 장애 원인을 여러 단계에서 추적해야 했습니다. 이를 개선하기 위해 Kafka에서 BigQuery로 직접 적재하는 Streaming API를 도입하고, 파이프라인과 조회용 프로젝트를 분리하기로 했습니다. 비용 관리를 위해 생성일자 기준 파티션과 보관 기간을 설정하고 쿼리에 파티션 범위를 지정하도록 했으며, 프로젝트별로 예약 슬롯 또는 일일 스캔 용량 제한을 적용했습니다.

  • CDC 기반 적재에서 병목이 되는 단계와 지연 시간을 먼저 측정해 개선 대상을 좁히세요.
  • BigQuery Streaming API를 사용하면 중간 파일 저장과 재읽기 과정을 줄일 수 있습니다.
  • 파티션 만료 기간과 쿼리의 파티션 필터를 함께 설정해 저장·스캔 비용을 관리하세요.
  • 파이프라인과 분석 워크로드를 프로젝트 단위로 분리하면 자원 경쟁을 줄이고 쿼리 유형별 비용 정책을 적용할 수 있습니다.