Skip to main content
이 문서는 컴퓨트 섹션의 일부입니다.

클러스터란?

💡 클러스터(Cluster) 란 Spark 코드를 실행하기 위한 컴퓨팅 리소스의 집합 입니다. 하나의 Driver 노드와 0개 이상의 Worker 노드로 구성됩니다.
Databricks에서 노트북의 코드를 실행하거나 ETL 작업을 수행하려면 반드시 클러스터가 필요합니다. 어떤 종류의 클러스터를 선택하느냐에 따라 비용, 성능, 관리 방식이 달라집니다.

클러스터 종류 비교

Databricks는 세 가지 유형의 클러스터를 제공합니다.

All-Purpose Cluster (대화형 클러스터)

언제 사용하나요?

  • 노트북에서 코드를 작성하고 대화형으로 결과를 확인 할 때
  • 데이터를 탐색하고 분석하는 개발 단계 에서
  • 여러 팀원이 하나의 클러스터를 공유하여 협업 할 때

특징


Job Cluster (작업용 클러스터)

언제 사용하나요?

  • 스케줄된 ETL 파이프라인 을 실행할 때
  • 프로덕션 워크로드 를 안정적으로 운영할 때
  • 비용을 최소화하면서 일회성 배치 작업 을 실행할 때

특징