본문으로 이동
AWS Sagemaker Ground Truth로 훈련용 이미지를 편하게 분류하자
문서

AWS Sagemaker Ground Truth로 훈련용 이미지를 편하게 분류하자

김민섭 · 컬리 · 컬리 기술 블로그

원본 보기

소개

컬리에서도 소소하게 머신러닝을 사용하고 있습니다

AI 핵심 요약

후기 이미지 분류 모델을 개선하려 했지만, 대량의 훈련 이미지를 준비하고 정확하게 라벨링하는 일이 가장 큰 난관이었다. S3에서 이미지를 내려받은 뒤 SHA-1 해시로 중복을 제거하고 Pillow로 손상 파일을 걸러냈으며, 드래그앤드롭·이미지별 수동 분류·기존 모델의 선분류 후 검수 방식을 비교했다. 10만 장 규모에서는 파일 탐색기와 로컬 분류가 부담이 되어 AWS SageMaker Ground Truth의 프라이빗 작업자 기능을 검토했고, 작업 결과를 JSON으로 받아 훈련 데이터에 활용할 수 있음을 확인했다. 다만 작업자 수와 관계없이 레이블 수에 따른 비용이 커 실제 도입은 보류했으며, 대량 데이터 라벨링에서는 편의성뿐 아니라 비용과 작업 확장성을 함께 고려해야 한다고 정리했다.

  • 훈련 전에 파일 해시로 중복 이미지를 제거하고, Pillow로 이미지를 열어 손상 여부를 확인하면 학습 중단을 줄일 수 있다.
  • 분류 기준이 단순하고 데이터가 적다면 드래그앤드롭이 빠르지만, 오분류 위험과 작업자 확장성의 한계가 있다.
  • 기존 모델로 이미지를 먼저 분류한 뒤 사람이 검수하면 수작업 부담을 줄일 수 있지만, 로컬 처리 성능이 병목이 될 수 있다.
  • Ground Truth는 프라이빗 작업자를 초대해 분류를 나누고 결과를 JSON으로 받을 수 있지만, 레이블 수에 따른 비용을 먼저 따져야 한다.