본문으로 이동
문서

Skill 품질 관리를 위한 Rubric 설계와 시스템 구현

조민규 · 토스 · 토스 기술 블로그

원본 보기

소개

갈수록 커지는 Skill의 품질 편차와 그 간극을 최소화하기 위한 방법

AI 핵심 요약

사내 Skill이 제대로 호출되지 않거나 형식 오류로 인식되지 않는 문제를 해결하기 위해, 작성자는 6개 섹션 30개 항목의 품질 Rubric과 자동 평가 시스템을 만들었습니다. 결정적으로 판별할 수 있는 17개 항목은 정규식·파싱 등 규칙 검사로, 의미 판단이 필요한 13개 항목은 LLM 검사로 분리해 정확성과 비용을 함께 고려했습니다. BLOCKER·MAJOR·MINOR 심각도와 S~F 등급을 적용하고, GitHub Actions의 PR 평가 및 Claude Code 로컬 셀프 체크가 같은 기준을 사용하도록 구성했습니다. 핵심 교훈은 형식·보안 같은 명확한 결함은 자동 게이트로 일관되게 막고, 의미 품질은 모델로 보완해 Skill의 호출 실패와 불필요한 컨텍스트 낭비를 줄이는 것입니다.

  • 형식처럼 결과가 명확한 결함은 정규식·파싱 등 규칙 기반 검사로 처리하고, 트리거 적합성이나 콘텐츠 유용성처럼 의미가 필요한 항목은 모델에 맡기세요.
  • 에이전트가 Skill 호출 여부를 판단할 때 description만 읽는다면, 사용 시점과 조건도 본문이 아니라 description에 적어야 합니다.
  • 호출 즉시 로드되는 본문은 짧게 유지하고, 상세 자료는 references/, 반복 실행의 일관성이 필요한 작업은 scripts/로 분리하세요.
  • 보안 검사에서는 secret 노출이나 파괴적 명령을 놓치는 비용이 크므로, 다른 항목보다 False Negative를 줄이는 방향으로 게이트를 설계하세요.
  • 로컬 셀프 체크와 PR 검사가 같은 Rubric과 스크립트를 공유하면 결과 불일치를 줄이고 리뷰어가 의미 품질에 집중할 수 있습니다.