Skip to main content
이 문서는 머신러닝 섹션의 일부입니다.

트래픽 분할 및 A/B 테스트

하나의 엔드포인트에 여러 모델 버전을 동시에 배포하고, 트래픽 비율을 조절하여 A/B 테스트 를 수행할 수 있습니다.
블루-그린 배포: 새 모델 버전을 100% 트래픽으로 전환하면서도 이전 버전을 유지하는 방식입니다. 문제 발생 시 즉시 이전 버전으로 롤백할 수 있습니다.

모니터링 (Monitoring)

Inference Table (추론 로그 테이블)

Inference Table 은 엔드포인트의 모든 요청/응답을 Unity Catalog 테이블에 자동으로 저장합니다. 모델 드리프트 감지, 디버깅, 감사 로그 목적으로 활용합니다.

엔드포인트 메트릭 확인


콜드 스타트 최적화

콜드 스타트 (Cold Start)scale_to_zero_enabled=True 설정 시 트래픽이 없다가 첫 요청이 들어올 때 컨테이너를 다시 시작하는 지연 시간입니다. 일반적으로 30초~5분이 소요됩니다.
load_context() 최적화: 무거운 초기화(모델 로드, 토크나이저 초기화 등)는 반드시 load_context()에서 수행하고 predict()에서는 수행하지 마십시오. load_context()는 인스턴스 시작 시 한 번만 실행되지만, predict()는 매 요청마다 실행됩니다.

비용 관리

커스텀 모델 서빙은 인스턴스 가동 시간 기준으로 과금됩니다. Foundation Model API의 토큰 기반 과금과 다른 비용 구조를 갖습니다.

실습: 모델 서빙 엔드포인트 생성 및 호출

엔드포인트 호출 방법


베스트 프랙티스와 흔한 실수

베스트 프랙티스

흔한 실수


트러블슈팅

자주 발생하는 문제와 해결 방법

엔드포인트 상태 확인

프로덕션 배포 체크리스트:
  • 모델 시그니처(input/output schema)가 올바른지 확인
  • pip_requirements에 모든 의존성과 정확한 버전을 명시
  • Scale-to-zero 비활성화 (지연 시간 민감한 경우)
  • Inference Table을 활성화하여 요청/응답 로깅
  • 엔드포인트 모니터링 알림 설정

정리


참고 링크