AWS Sagemaker Ground Truth로 훈련용 이미지를 편하게 분류하자
김민섭 · 컬리 · 컬리 기술 블로그
소개
컬리에서도 소소하게 머신러닝을 사용하고 있습니다
AI 핵심 요약
후기 이미지 분류 모델을 개선하려 했지만, 대량의 훈련 이미지를 준비하고 정확하게 라벨링하는 일이 가장 큰 난관이었다. S3에서 이미지를 내려받은 뒤 SHA-1 해시로 중복을 제거하고 Pillow로 손상 파일을 걸러냈으며, 드래그앤드롭·이미지별 수동 분류·기존 모델의 선분류 후 검수 방식을 비교했다. 10만 장 규모에서는 파일 탐색기와 로컬 분류가 부담이 되어 AWS SageMaker Ground Truth의 프라이빗 작업자 기능을 검토했고, 작업 결과를 JSON으로 받아 훈련 데이터에 활용할 수 있음을 확인했다. 다만 작업자 수와 관계없이 레이블 수에 따른 비용이 커 실제 도입은 보류했으며, 대량 데이터 라벨링에서는 편의성뿐 아니라 비용과 작업 확장성을 함께 고려해야 한다고 정리했다.
- 훈련 전에 파일 해시로 중복 이미지를 제거하고, Pillow로 이미지를 열어 손상 여부를 확인하면 학습 중단을 줄일 수 있다.
- 분류 기준이 단순하고 데이터가 적다면 드래그앤드롭이 빠르지만, 오분류 위험과 작업자 확장성의 한계가 있다.
- 기존 모델로 이미지를 먼저 분류한 뒤 사람이 검수하면 수작업 부담을 줄일 수 있지만, 로컬 처리 성능이 병목이 될 수 있다.
- Ground Truth는 프라이빗 작업자를 초대해 분류를 나누고 결과를 JSON으로 받을 수 있지만, 레이블 수에 따른 비용을 먼저 따져야 한다.
비슷한 학습 자료
[팀네이버 컨퍼런스 DAN25] LLM 라우터: 맥락을 이해하고 분류하는 똑똑한 AI 분류기
DAN 2025 · YouTube
초소형 머신러닝 TinyML
피트 워든 · Yes24
BigQuery와 Gemini로 리뷰 분석 업무 자동화하기
김영준, 송재현 · 컬리 기술 블로그
고객에게 뚜렷한 경험을: 컬리의 후기 이미지 처리 기술
안은정 · 컬리 기술 블로그
AWS MLOps 분산학습 워크숍 방문기
김왕수 · 컬리 기술 블로그
컬리에서 데이터 분석가로 일한다는 것
이민식 · 컬리 기술 블로그