본문으로 이동
토스증권의 수천 개 실시간 데이터 파이프라인 운영방법 #1: Visualize Lineage
문서

토스증권의 수천 개 실시간 데이터 파이프라인 운영방법 #1: Visualize Lineage

강병수 · 토스 · 토스 기술 블로그

원본 보기

소개

토스증권의 실시간 데이터 파이프라인을 대규모로 구성하고 운영해 온 경험을 소개합니다.

AI 핵심 요약

토스증권은 수천 개의 실시간 데이터 파이프라인을 운영하면서 각 Job의 용도와 연결 관계를 파악하고, 팀 간에 처리 로직을 설명하는 데 드는 비용을 줄여야 했다. 이를 위해 파이프라인의 흐름을 DAG 기반 데이터 리니지로 모델링하고, Node·Edge 메타데이터를 MongoDB에 저장한 뒤 Graph Search로 탐색해 시각화하는 사내 웹 서비스를 만들었다. MySQL CDC, Kafka, Flink, ClickHouse 등 다양한 원천·처리·저장 시스템의 메타데이터를 연결해 실제 데이터 흐름과 각 구성 요소의 상세 정보를 확인할 수 있게 했다. 그 결과 파이프라인 운영 효율과 접근성이 높아졌으며, 앞으로 구간별 메트릭과 SLA·담당자 정보, DBT 배치 파이프라인까지 연결해 전체 시스템 가시성을 확장할 계획이다.

  • 데이터 흐름과 Job 간 의존 관계를 표현할 때는 방향성과 비순환성을 갖는 DAG가 적합하다.
  • Node와 Edge의 유형·클러스터·이름·속성을 메타데이터로 관리하면 파이프라인을 검색하고 상세 정보를 제공할 수 있다.
  • 파이프라인 메타데이터는 원천 시스템, 처리 엔진, 저장소 등 구성 요소별로 수집해야 전체 흐름을 연결할 수 있다.
  • 리니지에 구간별 지연 시간과 전송량, SLA, 담당자 정보를 더하면 운영 가시성과 장애 대응에 활용할 수 있다.
  • 실시간 파이프라인과 DBT 기반 배치 파이프라인을 연결하면 데이터 적재 이후까지 이어지는 End-to-End 리니지를 만들 수 있다.