본문으로 이동
데이터사이언스팀이 예측모델을 개발하고 운영하는 방법을 소개합니다.
문서

데이터사이언스팀이 예측모델을 개발하고 운영하는 방법을 소개합니다.

송훈화 · 컬리 · 컬리 기술 블로그

원본 보기

소개

데이터사이언스팀에 대한 소개와 예측모델을 개발하고 운영하는 방법을 소개합니다.

AI 핵심 요약

컬리 데이터사이언스팀은 물류 수요예측과 개인화 추천·랭킹 모델을 개발하고, Feature Store·MLflow·Airflow 등을 활용해 현업에서 안정적으로 운영하는 업무를 소개합니다. 수요예측에는 다양한 피처를 활용하는 LGBM·Random Forest 같은 회귀 모델을 주로 쓰지만, 데이터 품질과 비즈니스 변화에 대응하는 배포 후 관리가 모델 개발만큼 중요하다고 설명합니다. 특히 예측 시점에 이용할 수 없는 실제값이 피처에 섞이지 않도록 lag 피처와 학습·테스트 구간을 설계해 데이터 누수를 방지해야 합니다. 모델 정확도만 좇기보다 현업의 의사결정 맥락과 사후 대응을 고려하고, 문제 정의와 기대치 합의부터 프로젝트를 관리하는 것이 핵심이라는 경험을 공유합니다.

  • 예측 시점에 실제로 확보할 수 있는 데이터만 피처로 사용하도록 학습·검증 구간을 설계해야 합니다.
  • 모델 성능 지표는 천재지변이나 시스템 장애 같은 맥락을 고려해 해석하고, 현업의 활용 목적에 맞춰야 합니다.
  • 배포 후에는 데이터 이상, 비즈니스 변화, 서빙 문제를 지속적으로 점검하고 필요하면 룰 기반 대안을 마련합니다.
  • 요청자와 결과물의 형태와 기대 효과를 미리 합의하고, WBS와 중간 공유로 프로젝트를 관리합니다.