본문으로 이동
리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기
문서

리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기

박찬용/최기원/김태정/이민영 · 토스 · 토스 기술 블로그

원본 보기

소개

Toss의 AI 기반 서비스에 적합한 LLM이 무엇인지 평가하는 Toss Benchmark 구축기

AI 핵심 요약

공개 리더보드의 순위가 한국어 요청, Reasoning 설정, 토스의 실제 업무에서도 유지되는지 알기 어려워 LLM Modeling 팀은 서비스 환경에 맞춘 Toss Benchmark를 구축했습니다. 한국어 범용 평가와 실제 운영 태스크에 더해, 프롬프트 정책 준수를 보는 Toss IFBench와 커머스 지식을 측정하는 Toss Knowledge를 만들고 형식 지시·판단 지시, 도메인별 지식 축을 나눠 평가했습니다. 벤치마크 점수와 별도 운영 태스크 성능을 비교해 정책 준수와 커머스 지식이 일부 실제 업무 성능과 양의 상관을 보이는지 확인했으며, 결과는 모델 카탈로그와 추천에 활용합니다. 핵심 교훈은 범용 점수나 종합 순위만으로 모델을 선택하지 말고, 실제 서비스의 언어·설정·업무 요구에 맞는 평가 기준을 마련해야 한다는 것입니다.

  • 공개 리더보드 점수만으로 모델을 고르지 말고, 서비스에서 사용할 언어와 Reasoning 설정을 맞춰 비교하세요.
  • 실제 업무 데이터와 프롬프트를 활용한 운영 태스크 평가에 공통 능력 벤치마크를 함께 두면, 개별 업무와 정책 준수·도메인 지식을 나눠 볼 수 있습니다.
  • 정책 준수는 출력 형식과 판단 규칙을 분리해 평가해야 모델이 규칙을 실제로 따르는지 확인할 수 있습니다.
  • 객관식 지식 평가에서는 정답 위치를 바꿔 반복 측정하면 보기 위치 선호가 점수에 미치는 영향을 줄일 수 있습니다.
  • 벤치마크를 참고해 만든 운영 태스크는 상관관계 분석에서 제외해, 평가 기준이 다른 업무 성능과도 연결되는지 확인하세요.