Skip to main content

5. ML/AI 성능 최적화

5.1 Model Serving 지연시간 최적화

5.2 배치 추론 병렬화

5.3 Vector Search 검색 속도 최적화


6. GPU 클러스터 사이징

6.1 GPU 인스턴스 비교

6.2 모델 크기별 GPU 선택 가이드

참고 GPU 메모리 계산 공식: 모델 파라미터를 float16(2바이트)으로 로드할 때 필요한 GPU 메모리 = 파라미터 수 × 2바이트. 예: 7B 모델 = 7 × 10^9 × 2 = 14GB. 학습 시에는 옵티마이저 상태와 그래디언트로 인해 3~4배 추가 메모리가 필요합니다.

6.3 GPU 활용률 모니터링


7. 분산 학습 성능 튜닝

7.1 TorchDistributor 활용

7.2 분산 학습 성능 최적화

주의 분산 학습 주의사항: 노드 간 네트워크 대역폭이 중요합니다. Databricks에서 멀티 노드 학습 시 EFA(Elastic Fabric Adapter) 또는 고대역폭 네트워크가 지원되는 인스턴스(p4d, p5)를 사용하세요. 네트워크 병목이 있으면 GPU가 유휴 상태로 대기합니다.

8. Spark ML vs 단일 노드 성능 비교

8.1 선택 가이드

8.2 하이브리드 패턴