고성능 GPU 클러스터 도입기 #1: 요리하라고 해서 왔는데 프라이팬이 없어요
김진웅 · 토스 · 토스 기술 블로그
소개
오늘은 토스증권은 왜 자체 LLM을 개발하기로 결정했는지, 그리고 왜 고성능 자체 GPU 클러스터가 필요했는지 설명드릴게요. 다음 포스트에서는 더 자세한 도입기를 다뤄보겠습니다.
AI 핵심 요약
토스증권은 주가·거래량·뉴스 등 방대한 금융 데이터를 분석해 투자 정보를 제공하기 위해 LLM을 검토했지만, 일반 모델은 증권 데이터의 부족과 도메인 분석 한계가 있어 자체 금융 데이터 기반 모델을 추진하기로 했다. 개인정보 보호와 외부 API 사용 비용, 대규모 모델의 학습 및 빠른 추론 요구를 고려해 자체 고성능 GPU 클러스터가 필요하다고 설명한다. GPU는 행렬 연산과 높은 메모리 대역폭에 강점이 있지만, 데이터 전송 병목과 병렬 프로그래밍·디버깅의 어려움, 클러스터 내 성능 아웃라이어를 관리해야 한다. 따라서 GPU 수를 늘리는 것만으로는 충분하지 않으며, 데이터 이동과 장비·스토리지 성능을 함께 관측하고 최적화해야 한다는 점을 짚는다.
- 민감한 금융 데이터를 외부 클라우드나 API에 맡기면 개인정보 보호 조치와 규제 검토가 필요하고, 실시간 처리와 사용량 확대에도 제약이 생길 수 있다.
- GPU의 병렬 연산 성능을 활용하려면 CPU와 GPU 사이의 데이터 전송량을 줄이고, 데이터 분할과 동기화 문제를 고려해야 한다.
- 여러 GPU 서버를 묶으면 학습·추론 성능을 높일 수 있지만, 병렬 디버깅과 운영 복잡도도 함께 커진다.
- 클러스터에서는 느린 스토리지나 성능이 낮은 장비 하나가 전체 작업의 병목이 될 수 있으므로 하드웨어 균일성과 성능 테스트가 중요하다.
비슷한 학습 자료
[팀네이버 컨퍼런스 DAN25] MLXP: GPU 효율화를 선도하는 대규모 MLOps 플랫폼
DAN 2025 · YouTube
테크톡톡 2026 | ML Engineer - LLM 서빙, 띄우는 것과 잘 띄우는 것 사이
토스증권 Tech Talk Talk · YouTube
토스증권이 GPU-aware를 넘어 GPU-native 클러스터를 구축한 방법
장재영/김진웅 · 토스 기술 블로그
GPU를 밀도 있게 쓰는 방법 - 토스증권의 GPU 가상화(MIG) 도입기
김진웅 · 토스 기술 블로그
LLM 쉽고 빠르게 서빙하기
김민규 · 토스 기술 블로그
고성능 GPU 클러스터 도입기 #2: 이주하는 데이터
김진웅 · 토스 기술 블로그