> ## Documentation Index
> Fetch the complete documentation index at: https://docs.sifi.life/llms.txt
> Use this file to discover all available pages before exploring further.

# Notebook 기본 사용법

> 이 문서는 **[Databricks 플랫폼](/training/02-databricks-overview/what-is-databricks)** 섹션의 일부입니다.

## Notebook이란?

> 💡 **Notebook(노트북)** 은 코드, 텍스트 설명, 시각화 결과를 하나의 문서에 담을 수 있는 **대화형 개발 환경** 입니다. 마치 실험 노트처럼, 코드를 작성하고 바로 실행하여 결과를 확인하면서 작업을 진행할 수 있습니다.

Jupyter Notebook과 유사하지만, Databricks Notebook은 다음과 같은 추가 기능을 제공합니다.

| 기능           | 설명                                                 |
| ------------ | -------------------------------------------------- |
| **멀티 언어 지원** | 하나의 노트북 안에서 Python, SQL, Scala, R을 혼합하여 사용할 수 있습니다 |
| **실시간 협업**   | 여러 사용자가 동시에 같은 노트북을 편집할 수 있습니다 (Google Docs처럼)     |
| **클러스터 연결**  | 클릭 한 번으로 분산 컴퓨팅 클러스터에 연결됩니다                        |
| **버전 관리**    | 노트북의 변경 이력이 자동으로 저장됩니다                             |
| **Git 연동**   | 외부 Git 저장소와 직접 연동하여 코드를 관리할 수 있습니다                 |
| **시각화 내장**   | 실행 결과를 바로 차트로 변환할 수 있습니다                           |

***

## 셀(Cell)의 개념

Notebook은 여러 개의 **셀(Cell)** 로 구성되어 있습니다. 각 셀은 독립적으로 실행할 수 있습니다.

### 셀 유형

| 셀 유형              | 용도             | 표기 방법            |
| ----------------- | -------------- | ---------------- |
| **Code Cell**     | 코드를 작성하고 실행합니다 | 기본 셀 (별도 표기 불필요) |
| **Markdown Cell** | 설명 텍스트를 작성합니다  | 셀 상단에 `%md` 입력   |
| **SQL Cell**      | SQL 쿼리를 실행합니다  | 셀 상단에 `%sql` 입력  |
| **Shell Cell**    | 쉘 명령어를 실행합니다   | 셀 상단에 `%sh` 입력   |

### 언어 전환 (Magic Command)

기본 언어가 Python인 노트북에서도, 셀 첫 줄에 **매직 커맨드** 를 입력하면 다른 언어를 사용할 수 있습니다.

```python theme={null}
# 기본 언어가 Python인 노트북에서...

# Python 셀 (기본)
df = spark.read.table("catalog.schema.my_table")
df.show()
```

```sql theme={null}
%sql
-- SQL 셀
SELECT * FROM catalog.schema.my_table LIMIT 10
```

```markdown theme={null}
%md
## 분석 결과 요약
이 셀은 **Markdown** 으로 작성된 설명 텍스트입니다.
```

```bash theme={null}
%sh
# Shell 명령어 실행
pip list | grep pandas
```

```python theme={null}
%scala
// Scala 코드 실행
val df = spark.read.table("catalog.schema.my_table")
df.show()
```

***

## 기본 사용법

### 셀 실행

| 동작       | 단축키                | 설명                      |
| -------- | ------------------ | ----------------------- |
| 현재 셀 실행  | `Shift + Enter`    | 셀을 실행하고 다음 셀로 이동합니다     |
| 현재 셀만 실행 | `Ctrl/Cmd + Enter` | 셀을 실행하되 커서는 그 자리에 유지합니다 |
| 전체 실행    | 상단 **Run All** 버튼  | 노트북의 모든 셀을 순서대로 실행합니다   |
| 위쪽 전체 실행 | **Run All Above**  | 현재 셀 위의 모든 셀을 실행합니다     |

### 셀 관리

| 동작     | 방법                             |
| ------ | ------------------------------ |
| 새 셀 추가 | 셀 사이의 `+` 버튼 클릭                |
| 셀 삭제   | 셀 우측 `⋮` 메뉴 → Delete           |
| 셀 이동   | 셀 좌측을 드래그하여 이동                 |
| 셀 분할   | 커서 위치에서 `Ctrl/Cmd + Shift + -` |

***

## 실습: 첫 번째 Notebook 만들기

간단한 실습을 통해 Notebook 사용법을 익혀 보겠습니다.

### Step 1: Notebook 생성

1. Workspace에서 **+ New**→ **Notebook** 클릭
2. 이름: `my-first-notebook`
3. 기본 언어: **Python**
4. Cluster: **Serverless** 또는 사용 가능한 클러스터 선택

### Step 2: Python으로 데이터 생성

```python theme={null}
# 셀 1: 간단한 데이터 생성
data = [
    ("김철수", 28, "서울", 4500000),
    ("이영희", 34, "부산", 5200000),
    ("박민수", 25, "대구", 3800000),
    ("최지은", 31, "서울", 4800000),
    ("정하늘", 29, "인천", 4100000),
]

columns = ["이름", "나이", "도시", "연봉"]

df = spark.createDataFrame(data, columns)
df.show()
```

실행 결과:

```
+------+---+----+-------+
|  이름|나이|도시|   연봉|
+------+---+----+-------+
|김철수| 28|서울|4500000|
|이영희| 34|부산|5200000|
|박민수| 25|대구|3800000|
|최지은| 31|서울|4800000|
|정하늘| 29|인천|4100000|
+------+---+----+-------+
```

### Step 3: SQL로 분석

```sql theme={null}
%sql
-- 셀 2: 임시 뷰를 만들어서 SQL로 분석
-- (Python에서 만든 df를 SQL에서 사용하려면 임시 뷰를 만들어야 합니다)
```

```python theme={null}
# 셀 3: 임시 뷰 생성
df.createOrReplaceTempView("employees")
```

```sql theme={null}
%sql
-- 셀 4: 도시별 평균 연봉 조회
SELECT
    도시,
    COUNT(*) AS 인원수,
    FORMAT_NUMBER(AVG(연봉), 0) AS 평균연봉
FROM employees
GROUP BY 도시
ORDER BY AVG(연봉) DESC
```

### Step 4: 시각화

SQL 셀의 실행 결과 아래에 나타나는 **차트 아이콘(📊)** 을 클릭하면, 결과를 다양한 차트로 변환할 수 있습니다.

| 차트 유형            | 적합한 데이터              |
| ---------------- | -------------------- |
| **Bar Chart**    | 카테고리별 비교 (도시별 매출 등)  |
| **Line Chart**   | 시계열 데이터 (일별 매출 추이 등) |
| **Pie Chart**    | 비율 비교 (카테고리 비중 등)    |
| **Scatter Plot** | 두 변수 간의 관계           |
| **Map**          | 지리 데이터               |

### Step 5: Markdown으로 설명 추가

```markdown theme={null}
%md
## 분석 결과

위 데이터는 5명의 직원 샘플 데이터입니다.
- **서울** 근무자의 평균 연봉이 가장 높습니다.
- 전체 평균 나이는 약 **29세** 입니다.
```

***

## Jupyter에서 넘어온 사람이 처음 당황하는 5가지

Jupyter Notebook을 사용하던 분들이 Databricks Notebook으로 옮기면 겪는 흔한 혼란을 정리했습니다.

### 1. "pip install이 왜 다른가?"

Jupyter에서는 터미널에서 `pip install`을 하면 끝이지만, Databricks에서는 클러스터 전체에 라이브러리를 설치해야 합니다.

```python theme={null}
# Databricks에서 라이브러리 설치 (노트북 내에서)
%pip install pandas==2.1.0 scikit-learn==1.3.0

# 반드시 설치 후 restart 필요 (Databricks가 자동으로 안내합니다)
dbutils.library.restartPython()
```

> ⚠️ **주의**: `%pip install`은 해당 노트북이 연결된 클러스터에만 적용됩니다. 다른 사용자가 같은 클러스터를 공유하는 경우, 라이브러리 버전 충돌이 발생할 수 있습니다. 프로덕션에서는 클러스터 설정의 **Libraries** 탭에서 관리하는 것이 안전합니다.

### 2. "변수가 왜 사라지나?"

Jupyter는 커널이 항상 살아있지만, Databricks 클러스터는 **Auto-termination**(자동 종료) 이후 재시작하면 모든 변수가 초기화됩니다. 또한 클러스터를 **Detach** 했다가 다시 **Attach** 하면 상태가 초기화됩니다.

> 💡 **해결법**: 중간 결과는 Delta 테이블에 저장하세요. `df.write.saveAsTable("my_catalog.my_schema.temp_result")` 한 줄이면 됩니다. 변수가 사라져도 데이터는 남아 있습니다.

### 3. "spark라는 변수는 어디서 온 거지?"

Jupyter에서는 `SparkSession.builder.getOrCreate()`를 직접 호출해야 하지만, Databricks에서는 **`spark` 변수가 자동으로 생성** 되어 있습니다. 마찬가지로 `sc`(SparkContext), `sqlContext`, `dbutils`도 미리 선언되어 있습니다.

```python theme={null}
# Jupyter에서는 이렇게 해야 하지만...
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("my_app").getOrCreate()

# Databricks에서는 그냥 바로 사용합니다
df = spark.read.table("my_catalog.my_schema.my_table")
```

### 4. "display()가 뭐지?"

Databricks에는 `display()`라는 고유 함수가 있습니다. Jupyter의 `df.show()`와 달리, **인터랙티브한 테이블** 과 **차트 시각화** 를 제공합니다.

```python theme={null}
# df.show()는 텍스트 출력 (Jupyter 스타일)
df.show(10)

# display()는 인터랙티브 테이블 + 차트 (Databricks 스타일) — 이것을 쓰세요
display(df)
```

> ⚠️ **대형 테이블 주의**: `display(df)`는 기본적으로 1,000행만 표시하지만, 내부적으로 쿼리를 실행합니다. 수십억 건의 테이블에 `display()`를 호출하면 집계 없이 전체 스캔이 발생할 수 있습니다. 반드시 `display(df.limit(100))` 또는 `display(df.filter(...))` 처럼 범위를 제한하세요. 현업에서 실수로 `display(spark.read.table("10TB_table"))`을 호출하여 클러스터가 OOM(메모리 부족)으로 죽는 사고가 실제로 발생합니다.

### 5. "노트북 출력이 저장되지 않는다?"

Jupyter는 `.ipynb` 파일에 출력 결과가 함께 저장되지만, Databricks Notebook은 기본적으로 **코드만 Git에 저장** 됩니다. 출력 결과를 보존하려면 **HTML로 내보내기** 하거나, Databricks의 자체 리비전 히스토리를 사용해야 합니다.

***

***

## 참고 링크

* [Databricks: Notebooks](https://docs.databricks.com/aws/en/notebooks/)
* [Azure Databricks: Notebooks](https://learn.microsoft.com/en-us/azure/databricks/notebooks/)
* [Databricks: dbutils](https://docs.databricks.com/aws/en/dev-tools/databricks-utils.html)
