본문으로 이동
AWS MLOps 분산학습 워크숍 방문기
문서

AWS MLOps 분산학습 워크숍 방문기

김왕수 · 컬리 · 컬리 기술 블로그

원본 보기

소개

워크숍에 방문하여 경험한 내용들을 공유합니다.

AI 핵심 요약

AWS의 이틀간 MLOps·분산학습 워크숍에 참석해 해외·국내 기업의 도입 사례와 SageMaker 기능을 살펴봤다. SageMaker 실습에서는 ETL, Feature Store, Model Registry, 배포와 모니터링 등 ML 운영 기능을 경험했고, 둘째 날에는 데이터 병렬처리와 모델 병렬처리, GPT-2 분산학습 실습을 통해 대규모 학습 흐름을 익혔다. 데이터 규모에 따라 저장 옵션을 고르고 Debugger로 CPU·GPU 병목을 확인하는 등 학습 환경을 상황에 맞게 구성하는 방법도 소개됐다. 특히 배포 후 Data drift를 감지하고 재학습 시점을 정하는 일이 모델 성능 유지에 중요하며, SageMaker의 Data Clarify와 Model Monitor가 이를 지원할 수 있다는 점을 확인했다.

  • Data Mesh는 중앙집중형 데이터 레이크를 역할별로 나누고 카탈로그를 통해 소비자 애플리케이션에 연결하는 접근법이다.
  • SageMaker는 Feature Store, Model Registry, 배포, 모니터링, 오케스트레이션 등 ML 운영 단계를 폭넓게 지원한다.
  • 분산학습은 데이터 병렬처리와 모델 병렬처리로 나눌 수 있으며, 데이터와 모델 규모에 맞는 방식을 선택해야 한다.
  • 학습 병목은 SageMaker Debugger로 살펴보고, 테라바이트급 데이터에는 Amazon FSx for Lustre 같은 저장 옵션을 고려할 수 있다.
  • Data drift는 배포 후 입력 데이터 분포가 학습 데이터와 달라지는 현상으로, 모니터링과 재학습으로 대응해야 한다.