토스증권의 수천 개 실시간 데이터 파이프라인 운영방법 #1: Visualize Lineage
강병수 · 토스 · 토스 기술 블로그
소개
토스증권의 실시간 데이터 파이프라인을 대규모로 구성하고 운영해 온 경험을 소개합니다.
AI 핵심 요약
토스증권은 수천 개의 실시간 데이터 파이프라인을 운영하면서 각 Job의 용도와 연결 관계를 파악하고, 팀 간에 처리 로직을 설명하는 데 드는 비용을 줄여야 했다. 이를 위해 파이프라인의 흐름을 DAG 기반 데이터 리니지로 모델링하고, Node·Edge 메타데이터를 MongoDB에 저장한 뒤 Graph Search로 탐색해 시각화하는 사내 웹 서비스를 만들었다. MySQL CDC, Kafka, Flink, ClickHouse 등 다양한 원천·처리·저장 시스템의 메타데이터를 연결해 실제 데이터 흐름과 각 구성 요소의 상세 정보를 확인할 수 있게 했다. 그 결과 파이프라인 운영 효율과 접근성이 높아졌으며, 앞으로 구간별 메트릭과 SLA·담당자 정보, DBT 배치 파이프라인까지 연결해 전체 시스템 가시성을 확장할 계획이다.
- 데이터 흐름과 Job 간 의존 관계를 표현할 때는 방향성과 비순환성을 갖는 DAG가 적합하다.
- Node와 Edge의 유형·클러스터·이름·속성을 메타데이터로 관리하면 파이프라인을 검색하고 상세 정보를 제공할 수 있다.
- 파이프라인 메타데이터는 원천 시스템, 처리 엔진, 저장소 등 구성 요소별로 수집해야 전체 흐름을 연결할 수 있다.
- 리니지에 구간별 지연 시간과 전송량, SLA, 담당자 정보를 더하면 운영 가시성과 장애 대응에 활용할 수 있다.
- 실시간 파이프라인과 DBT 기반 배치 파이프라인을 연결하면 데이터 적재 이후까지 이어지는 End-to-End 리니지를 만들 수 있다.
비슷한 학습 자료
토스ㅣSLASH 24 - ClickHouse로 토스증권 랭킹 서비스 구조 개선하기
SLASH · YouTube
토스ㅣSLASH 23 - 실시간 시세 데이터 안전하고 빠르게 처리하기
SLASH · YouTube
토스ㅣSLASH 22 - 토스증권 실시간 시세 적용기
SLASH · YouTube
토스ㅣSLASH 21 - 토스 데이터의 흐름과 활용
SLASH · YouTube
토스증권의 수 천개 실시간 데이터 파이프라인 운영방법 #2: MSA 환경 Observability 높이기
· 토스 기술 블로그
ksqlDB를 활용한 증권사의 실시간 데이터 처리하기
강병수 · 토스 기술 블로그