Skip to main content
이 문서는 머신러닝 섹션의 일부입니다.

AI Gateway란?

AI 애플리케이션을 프로덕션에 배포하면, LLM 호출을 안전하고 효율적으로 관리 하는 것이 큰 과제가 됩니다. 어떤 모델을 호출하고 있는지, 비용은 얼마나 발생하고 있는지, 부적절한 콘텐츠가 오가고 있지는 않은지 — 이 모든 것을 통제해야 합니다.
💡 Databricks AI Gateway 는 LLM 엔드포인트 앞에 위치하는 관리형 프록시 계층 으로, 트래픽 관리, 가드레일, 비용 제어, 사용량 추적을 중앙에서 처리합니다. 모든 Model Serving 엔드포인트에 자동으로 적용됩니다.

AI Gateway의 핵심 기능

1. 통합 엔드포인트 (Unified Endpoint)

하나의 엔드포인트에서 여러 LLM 제공자의 모델 을 동일한 API 형식(OpenAI 호환)으로 호출할 수 있습니다.
지원 모델 제공자:

External Model 엔드포인트 생성

외부 모델 제공자(OpenAI, Anthropic 등)의 API를 Databricks AI Gateway를 통해 호출하려면 External Model 엔드포인트 를 생성합니다.
💡 API 키가 Secret Scope에 저장됩니다. 애플리케이션 코드에 API 키가 노출되지 않으며, AI Gateway가 호출 시 자동으로 키를 주입합니다.

2. 가드레일 (Guardrails)

AI Gateway의 가드레일은 LLM의 입력과 출력을 실시간으로 검사 하여, 부적절한 콘텐츠를 차단합니다. 서버 측에서 동작하므로 클라이언트가 우회할 수 없습니다.

가드레일 유형

가드레일 설정 예시

가드레일 동작 흐름

⚠️ 가드레일은 100% 완벽하지 않습니다. LLM 기반 필터링이므로 엣지 케이스가 존재할 수 있습니다. 민감한 애플리케이션에서는 가드레일과 함께 추론 테이블 모니터링 을 병행하여, 사후 검토도 수행하는 것을 권장합니다.

3. Rate Limiting (사용량 제어)

팀별, 사용자별, 엔드포인트별로 분당/시간당 요청 수 를 제한하여 비용 폭주를 방지합니다.
💡 Rate Limit에 도달하면 HTTP 429 (Too Many Requests) 응답이 반환됩니다. 클라이언트에서 exponential backoff로 재시도하도록 구현하세요.

4. 사용량 추적 (Usage Tracking)

AI Gateway는 모든 LLM 호출을 자동으로 기록 합니다. 추론 테이블과 시스템 테이블에서 사용량, 비용, 성능을 분석할 수 있습니다.

추론 테이블 (Inference Table)

시스템 테이블에서 서빙 메트릭 조회


5. 모델 라우팅 및 Fallback

하나의 엔드포인트에서 여러 모델 간 트래픽을 분배 하거나, 주 모델 장애 시 대체 모델로 자동 전환 할 수 있습니다.

트래픽 분할 (A/B 테스트)

Fallback 시나리오


6. Payload 로깅 및 감사

모든 요청/응답의 전체 페이로드를 추론 테이블 에 자동 기록합니다. 이 데이터는 다음 용도로 활용됩니다:

실전 구성 예시

고객 지원 챗봇의 AI Gateway 설정


AI Gateway 도입 체크리스트


정리


부록: 클라이언트 측 LLM 관리의 한계

LiteLLM, LangChain Router 등 클라이언트 측 라이브러리로 LLM 호출을 관리하는 팀이 있습니다. 소규모 프로토타입에서는 유용하지만, 프로덕션 환경에서는 다음과 같은 한계가 있습니다.

AI Gateway vs 클라이언트 측 비교


참고 링크