2. 컴퓨트 최적화
2.1 Serverless vs Classic 선택 기준
💡 의사결정 공식: 일일 평균 가동률이 40% 미만 이면 Serverless가 경제적입니다. 40% 이상 상시 가동한다면 Classic + Reserved Capacity가 유리합니다.
2.2 Auto Stop 설정 전략
Auto Stop은 유휴 클러스터를 자동으로 종료하여 불필요한 비용을 방지합니다.2.3 Spot 인스턴스 활용
Spot 인스턴스(AWS) / Spot VM(Azure)을 활용하면 60~90% 비용 절감 이 가능합니다.2.4 클러스터 사이징 가이드
워크로드 유형에 따른 인스턴스 선택 기준입니다.
💡 사이징 공식: 필요 코어 수 = (데이터 크기 GB / 목표 처리 시간 분) × 2. 예를 들어 100GB 데이터를 10분 안에 처리하려면 약 20코어가 필요합니다. 이를 기준으로 워커 수를 결정하세요.
2.5 Instance Pool 활용
Instance Pool은 유휴 인스턴스를 미리 확보하여 클러스터 시작 시간을 단축합니다.3. Spot 인스턴스 심화 전략
3.1 Fault Tolerance 설계
Spot 인스턴스는 클라우드 제공자가 언제든 회수할 수 있으므로, 워크로드의 내결함성을 설계해야 합니다.3.2 Spot Interruption 핸들링
3.3 Spot 인스턴스 비용 절감 효과 분석
주의
GPU Spot 주의: GPU 인스턴스는 Spot 가용성이 낮고 회수 빈도가 높습니다. ML 학습에 GPU Spot을 사용할 때는 반드시 체크포인트를 짧은 주기(5~10분)로 저장하고, SPOT_WITH_FALLBACK 을 설정하세요.
4. Photon 비용 효과 분석
4.1 Photon 비용 구조
Photon은 DBU 단가가 약 2배이지만, 실행 시간이 크게 단축되어 총 비용이 절감됩니다.참고 Photon 적용 판단 기준: SQL 중심 워크로드(ETL, 대시보드, 집계)에는 Photon을 적극 사용하세요. Python UDF나 ML 학습 워크로드에는 Photon이 효과가 없으므로 비활성화하는 것이 비용 효율적입니다.
4.2 Photon vs Non-Photon 전환 가이드
5. Serverless vs Classic 비용 상세 비교
5.1 시나리오별 비용 시뮬레이션
5.2 의사결정 플로우차트
6. 클러스터 풀 (Instance Pool) 고급 활용
6.1 멀티 풀 전략
조직 규모가 크면 용도별로 Instance Pool을 분리하여 관리합니다.
참고
Pool 비용 팁: GPU Pool은 min_idle_instances: 0 으로 설정하세요. GPU 인스턴스는 유휴 비용이 매우 높으므로, 필요할 때만 확보하는 전략이 적합합니다. 시작 시간이 3~5분 걸리지만, GPU 유휴 비용을 절감하는 효과가 더 큽니다.
참고 링크
- Databricks: Cluster Configuration Best Practices
- Databricks: Serverless Compute
- Databricks: Instance Pools
- Databricks: Photon
- Databricks: Compute Policies