AWS MLOps 분산학습 워크숍 방문기
김왕수 · 컬리 · 컬리 기술 블로그
소개
워크숍에 방문하여 경험한 내용들을 공유합니다.
AI 핵심 요약
AWS의 이틀간 MLOps·분산학습 워크숍에 참석해 해외·국내 기업의 도입 사례와 SageMaker 기능을 살펴봤다. SageMaker 실습에서는 ETL, Feature Store, Model Registry, 배포와 모니터링 등 ML 운영 기능을 경험했고, 둘째 날에는 데이터 병렬처리와 모델 병렬처리, GPT-2 분산학습 실습을 통해 대규모 학습 흐름을 익혔다. 데이터 규모에 따라 저장 옵션을 고르고 Debugger로 CPU·GPU 병목을 확인하는 등 학습 환경을 상황에 맞게 구성하는 방법도 소개됐다. 특히 배포 후 Data drift를 감지하고 재학습 시점을 정하는 일이 모델 성능 유지에 중요하며, SageMaker의 Data Clarify와 Model Monitor가 이를 지원할 수 있다는 점을 확인했다.
- Data Mesh는 중앙집중형 데이터 레이크를 역할별로 나누고 카탈로그를 통해 소비자 애플리케이션에 연결하는 접근법이다.
- SageMaker는 Feature Store, Model Registry, 배포, 모니터링, 오케스트레이션 등 ML 운영 단계를 폭넓게 지원한다.
- 분산학습은 데이터 병렬처리와 모델 병렬처리로 나눌 수 있으며, 데이터와 모델 규모에 맞는 방식을 선택해야 한다.
- 학습 병목은 SageMaker Debugger로 살펴보고, 테라바이트급 데이터에는 Amazon FSx for Lustre 같은 저장 옵션을 고려할 수 있다.
- Data drift는 배포 후 입력 데이터 분포가 학습 데이터와 달라지는 현상으로, 모니터링과 재학습으로 대응해야 한다.
비슷한 학습 자료
카카오페이 MLOps 적용기 (feat. AWS) / if(kakao)2022
if kakao · YouTube
카카오뱅크의 MLOps / if(kakao)2022
if kakao · YouTube
VLOps:Event-driven MLOps & Omni-Evaluator
엔지니어링데이 2025 · YouTube
MLOps 실전 가이드
노아 기프트 · Yes24
Kurly만의 MLOps 구축하기 - 쿠브플로우 도입기
구국원 · 컬리 기술 블로그
Kurly만의 MLOps 구축하기 - 초석 다지기
이상협 · 컬리 기술 블로그