Skip to main content
이 문서는 데이터 엔지니어링 섹션의 일부입니다.

실습: 멀티태스크 Job 생성

다음은 E-Commerce 매출 파이프라인을 위한 완전한 Job 설정 예제입니다.

JSON 설정 (API 방식)


비용 최적화 팁

Spot 인스턴스 활용

클러스터 사이징 가이드

추가 비용 최적화 체크리스트

  • Auto-scaling 활용: autoscale.min_workersautoscale.max_workers를 설정하여 워크로드에 맞게 자동 조절합니다
  • Photon 엔진 사용: SQL 및 DataFrame 워크로드에서 성능이 2~8배 향상됩니다
  • 태스크별 클러스터 공유: 동일한 컴퓨트가 필요한 태스크는 job_cluster_key로 클러스터를 공유할 수 있습니다
  • 불필요한 셔플 제거: broadcast join, partition pruning 등으로 데이터 이동을 최소화합니다
  • Delta 최적화: optimizeWrite, autoCompact를 활성화하여 소규모 파일 문제를 방지합니다

정리


참고 링크