이 문서는 GenAI 개념 섹션의 일부입니다.< LLM 기초 목차로 돌아가기
모델 비교표
2025년 기준 주요 LLM 모델의 핵심 스펙을 비교합니다. 모델 선택 시 성능뿐 아니라 비용, 컨텍스트 크기, 오픈소스 여부 를 종합적으로 고려해야 합니다.주의 모델 성능은 빠르게 변화합니다. 최신 벤치마크는 LMSYS Chatbot Arena를 참고하세요. 위 가격은 2025년 기준 대략적 수치이며, 공식 가격표를 확인하세요.
MoE (Mixture of Experts) 아키텍처
위 모델 비교표에서 DBRX(132B), Llama 4 Maverick(400B)에 (MoE) 라는 표기가 있습니다. MoE는 현재 대형 LLM의 핵심 아키텍처 트렌드입니다. 기존 Dense 모델의 문제: 전통적인 Dense 모델은 모든 파라미터가 모든 토큰에 대해 활성화 됩니다. 예를 들어 Llama 70B는 하나의 토큰을 생성할 때마다 700억 개의 파라미터를 모두 사용합니다. 모델이 커질수록 추론 비용이 선형으로 증가합니다. MoE의 핵심 아이디어: 모델 내부에 여러 개의 Expert(전문가) 네트워크 를 두고, 각 토큰마다 Router 네트워크 가 가장 적합한 Top-K개의 Expert만 선택하여 활성화합니다. 나머지 Expert는 비활성 상태로 유지됩니다. 주요 MoE 모델 예시:
Dense vs MoE 비교:
참고 고객에게 설명할 때: MoE는 “132B 모델의 지능을 가지면서 36B 모델의 비용으로 운영할 수 있는” 아키텍처입니다. DBRX가 Foundation Model API에서 비용 효율적인 이유가 바로 이것입니다. 다만 메모리에는 전체 파라미터를 올려야 하므로, GPU 메모리 요구사항은 전체 파라미터 기준입니다.
Emergent Abilities (창발적 능력)
LLM에서 가장 흥미로운 현상 중 하나는 창발적 능력(Emergent Abilities) 입니다. 모델의 파라미터 수가 특정 임계점을 넘어서면, 작은 모델에는 존재하지 않던 완전히 새로운 능력이 갑자기 나타나는 현상입니다.대표적 창발 능력 사례
GPT-2(1.5B)에서 GPT-3(175B)로의 도약이 혁명적으로 느껴진 이유가 바로 이 창발적 능력 때문입니다. GPT-2는 텍스트를 그럴듯하게 이어쓰는 정도였지만, GPT-3는 번역, 코드 작성, 수학 문제 풀이 등 전혀 학습하지 않은 작업을 few-shot으로 수행할 수 있었습니다.
주의: 창발에 대한 최신 논쟁
최근 연구에서는 창발적 능력이 “진짜 불연속적 도약”이 아니라 평가 지표(metric)의 특성에 의한 착시 일 수 있다는 주장이 제기되었습니다 (Schaeffer et al., 2023). 비선형적 평가 지표(예: exact match)를 연속적 지표(예: token-level accuracy)로 바꾸면 능력이 “점진적으로” 향상되는 것처럼 보인다는 것입니다.참고 “파라미터가 많을수록 좋다” 오해와의 연결: 창발적 능력은 모델 크기의 중요성을 보여주지만, 이것이 “무조건 크면 좋다”는 의미는 아닙니다. MoE 아키텍처, 고품질 학습 데이터, RLHF 등 다른 요소도 동일하게 중요합니다. Llama 3 8B가 특정 작업에서 이전 세대 70B 모델을 능가하는 사례가 이를 증명합니다.
흔한 오해 (Common Misconceptions)
고객 미팅에서 자주 마주치는 LLM에 대한 대표적 오해와 이에 대한 정확한 사실을 정리합니다.모델 선택 의사결정 프레임워크
모델을 선택할 때 “가장 좋은 모델”이 아니라 “우리 상황에 가장 적합한 모델” 을 찾아야 합니다.의사결정 플로차트
사용 사례별 추천 모델
추론 모델 (Reasoning Models) 카테고리
2024~2025년에 등장한 새로운 카테고리로, 답변 전에 “생각하는 시간”을 가지는 모델입니다.
추론 모델은 언제 사용하는가?
- 복잡한 수학/논리 문제
- 다단계 코딩 과제 (버그 분석, 아키텍처 설계)
- 전략적 의사결정이 필요한 에이전트 오케스트레이션
- 단순 Q&A, 요약, 번역에는 불필요(비용 낭비)
추론 모델의 상세한 작동 원리는 추론 모델 (Reasoning Models) 페이지를 참고하세요.
증류 (Distillation): 큰 모델의 지식을 작은 모델로
증류는 Teacher 모델(대형)의 출력을 Student 모델(소형)이 모방 하도록 학습하는 기법입니다. 비용 최적화의 핵심 전략입니다.증류의 과정
증류의 실무적 활용
주의 라이선스 주의: OpenAI, Anthropic 등의 API 이용약관은 “경쟁 모델 학습을 위한 출력 사용”을 제한할 수 있습니다. 증류를 수행하기 전에 반드시 해당 모델의 이용약관을 확인하세요. 오픈소스 Teacher 모델(Llama 등)을 사용하면 이 제약이 없습니다.
Databricks Foundation Model APIs
Databricks에서 LLM을 사용하는 가장 빠른 방법은 Foundation Model APIs 입니다.사용 가능 모델 (2025년 기준)
Pay-per-token vs Provisioned Throughput
참고 모델 선택 가이드: 개발/PoC 단계에서는 Pay-per-token으로 Claude 4 Sonnet 또는 GPT-4o를 사용하세요. 프로덕션 전환 시 비용 분석을 통해 Provisioned Throughput(오픈소스 모델) 전환을 검토합니다. 대부분의 경우 Llama 3.3 70B의 Provisioned Throughput 이 가장 비용 효율적입니다.
멀티모달 모델 비교
최신 LLM은 텍스트뿐 아니라 이미지, 오디오, 비디오 를 이해하는 멀티모달 능력을 갖추고 있습니다.참고 멀티모달 활용 사례: 제조업의 불량 검출(이미지 입력), 콜센터 음성 분석(오디오 입력), 문서 OCR(이미지→텍스트) 등에서 멀티모달 모델이 활발히 사용됩니다. 상세한 내용은 멀티모달 LLM 페이지를 참고하세요.
< 이전: Hallucination | 다음: 실전 가이드 >