LLM 서빙, 띄우는 것과 잘 띄우는 것 사이
김민규 · 토스 · 토스 기술 블로그
소개
비어 있는 캐시, 완벽한 알리바이, 사라진 처리량
AI 핵심 요약
토스증권은 LLM 서빙 장애의 원인을 찾기 어려웠던 문제를 해결하기 위해 ML 플랫폼을 구축하고, Grafana·Kibana에 vLLM·SGLang의 LLM 특화 지표를 통합했습니다. 이 과정에서 Prefix Cache가 꺼진 모델 설정, 리즈닝 종료 토큰 처리와 관련된 vLLM 버그, 낮은 KV 캐시 사용량을 발견해 설정 변경과 워크어라운드, 동시성 테스트로 대응했습니다. 그 결과 특정 사례에서 TTFT와 에러율을 낮추고, 파드 증설 없이 더 많은 트래픽을 처리할 가능성도 확인했습니다. 빠르게 변하는 서빙 환경을 모두 예측하기보다 지표와 로그로 원인을 탐색하고, 가설을 검증한 뒤 안전하게 반영·롤백하는 체계를 갖추는 것이 중요하다고 설명합니다.
- LLM 모니터링에서는 요청 수와 전체 응답 시간 대신 생성 토큰 처리량과 TTFT를 살펴보세요.
- Prefix Cache Hit Rate가 비어 있거나 낮다면 수집 오류뿐 아니라 모델별 기본 설정도 확인해야 합니다.
- 메트릭이 정상이어도 finish_reason과 실제 출력 로그를 확인하면 생성 제한 실패나 프레임워크 버그를 찾을 수 있습니다.
- GPU 파드를 늘리기 전에 KV 캐시 사용량과 동시성 스트레스 테스트로 기존 자원의 여유를 확인하세요.
- 모델·옵션 변경은 검증 후 반영하고, 예상치 못한 부작용에 대비해 빠르게 롤백할 수 있어야 합니다.
비슷한 학습 자료
테크톡톡 2026 | ML Engineer - LLM 서빙, 띄우는 것과 잘 띄우는 것 사이
토스증권 Tech Talk Talk · YouTube
리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기
박찬용/최기원/김태정/이민영 · 토스 기술 블로그
LLM은 똑똑한데, 왜 우리 회사 일은 모를까
김병균 · 토스 기술 블로그
LLM을 이용한 서비스 취약점 분석 자동화 #1
표상영 · 토스 기술 블로그
Flowise와 LLM을 활용한 에러 분석 자동화
조민규 · 토스 기술 블로그
LLM 쉽고 빠르게 서빙하기
김민규 · 토스 기술 블로그