데이터사이언스팀이 예측모델을 개발하고 운영하는 방법을 소개합니다.
송훈화 · 컬리 · 컬리 기술 블로그
소개
데이터사이언스팀에 대한 소개와 예측모델을 개발하고 운영하는 방법을 소개합니다.
AI 핵심 요약
컬리 데이터사이언스팀은 물류 수요예측과 개인화 추천·랭킹 모델을 개발하고, Feature Store·MLflow·Airflow 등을 활용해 현업에서 안정적으로 운영하는 업무를 소개합니다. 수요예측에는 다양한 피처를 활용하는 LGBM·Random Forest 같은 회귀 모델을 주로 쓰지만, 데이터 품질과 비즈니스 변화에 대응하는 배포 후 관리가 모델 개발만큼 중요하다고 설명합니다. 특히 예측 시점에 이용할 수 없는 실제값이 피처에 섞이지 않도록 lag 피처와 학습·테스트 구간을 설계해 데이터 누수를 방지해야 합니다. 모델 정확도만 좇기보다 현업의 의사결정 맥락과 사후 대응을 고려하고, 문제 정의와 기대치 합의부터 프로젝트를 관리하는 것이 핵심이라는 경험을 공유합니다.
- 예측 시점에 실제로 확보할 수 있는 데이터만 피처로 사용하도록 학습·검증 구간을 설계해야 합니다.
- 모델 성능 지표는 천재지변이나 시스템 장애 같은 맥락을 고려해 해석하고, 현업의 활용 목적에 맞춰야 합니다.
- 배포 후에는 데이터 이상, 비즈니스 변화, 서빙 문제를 지속적으로 점검하고 필요하면 룰 기반 대안을 마련합니다.
- 요청자와 결과물의 형태와 기대 효과를 미리 합의하고, WBS와 중간 공유로 프로젝트를 관리합니다.
비슷한 학습 자료
여기, 주문하신 '예측' 나왔습니다: 추천/ML에서 '예측'을 서빙한다는 것에 대하여 #우아콘2023 #우아한형제들
우아콘 2023 · YouTube
컬리의 Virtual 물류 센터
박수형 · 컬리 기술 블로그
함께 구매하면 좋은 상품이에요! - 장바구니 추천 개발기 2부
최재형, 김수지, 이상협, 구국원 · 컬리 기술 블로그
Dataflow로 컬리의 준실시간 수요 예측모델 파이프라인 구축하기 - 1편
한수진 · 컬리 기술 블로그
컬리는 물류 최적화 문제를 어떻게 풀고 있을까? - 2부
강동윤 · 컬리 기술 블로그
컬리에서 데이터 분석가로 일한다는 것
이민식 · 컬리 기술 블로그