본문으로 이동
고성능 GPU 클러스터 도입기 #2: 이주하는 데이터
문서

고성능 GPU 클러스터 도입기 #2: 이주하는 데이터

김진웅 · 토스 · 토스 기술 블로그

원본 보기

소개

이번 포스트에서는 토스증권에서 어떻게 고성능 GPU 클러스터를 구축했는지 자세히 공유하겠습니다.

AI 핵심 요약

LLM 클러스터는 GPU 성능만 높여서는 충분하지 않고, 스토리지·GPU·서버 사이에서 데이터가 이동하는 통신 비용이 전체 성능의 병목이 될 수 있습니다. 글은 워크로드를 모니터링해 병목을 파악한 뒤, 스토리지 전송에는 NVMe SSD, 서버 내부 GPU 통신에는 NVLink와 NVSwitch, 서버 간 통신에는 인피니밴드를 적용하는 방식을 설명합니다. 특히 NVSwitch로 여러 GPU가 NVLink 대역폭을 효율적으로 공유하고, 인피니밴드의 GPU 직접 전송으로 서버 간 데이터 복사를 줄이는 구성을 소개합니다. 클러스터는 비용과 시간이 많이 드는 만큼, 장비를 일괄적으로 최고 사양으로 맞추기보다 측정 결과와 PCIe 구조에 맞춰 설계해야 한다는 점이 핵심입니다.

  • 클러스터 장비를 고르기 전에 모니터링으로 워크로드의 통신량과 병목 구간을 측정하세요.
  • 스토리지에서 GPU로 데이터를 자주 옮긴다면 SATA 대신 PCIe에 직접 연결되는 NVMe SSD를 검토할 수 있습니다.
  • NVLink는 서버 내부 GPU 통신을 빠르게 하고, NVSwitch는 여러 GPU가 링크를 나누지 않고 대역폭을 활용하도록 돕습니다.
  • 서버 간 GPU 통신에서는 GPU 메모리에서 네트워크로 직접 데이터를 보내는 인피니밴드와 HCA 구성을 고려하세요.
  • 인피니밴드 카드 수와 대역폭은 PCIe 스위치 구조와 워크로드에 맞춰 정하고, 케이블 길이는 구축 전에 신중히 설계해야 합니다.