Skip to main content
이 문서는 AI 동향 섹션의 일부입니다.
참고 이 문서의 범위: 한국어 특화 LLM, 중국계 모델의 한국어 지원, 한국어 NLP 기술 과제, 벤치마크, 정부 정책을 종합 분석합니다. 한국어 RAG 최적화 상세는 한국어 RAG 최적화를 참고하세요.

1. 개요

2026년 초 현재, 한국어 LLM 생태계는 세 가지 축 으로 빠르게 재편되고 있습니다.
  1. 국내 기업의 자체 모델 고도화: NAVER HyperCLOVA X, LG EXAONE, Upstage SOLAR 등
  2. 글로벌 오픈소스 모델의 한국어 성능 급상승: Qwen, DeepSeek, Llama 등
  3. MoE 아키텍처의 주류화: K-EXAONE 236B, Qwen 3.5 397B 등
핵심 배경은 토큰화 효율성 개선, 학습 데이터 다양화, MoE를 통한 비용 효율적 스케일링 입니다.

2. 주요 한국 AI 기업별 동향

2.1 NAVER — HyperCLOVA X

NAVER는 한국어 LLM 시장의 선두주자로, HyperCLOVA X 시리즈를 CLOVA Studio API로 제공합니다. 모델 가중치를 공개하지 않는 폐쇄형 전략을 취하고 있습니다.

2.2 LG AI Research — EXAONE 시리즈 (가장 주목할 행보)

K-EXAONE 236B (Active 23B) — 한국어 MoE 플래그십

K-EXAONE은 한국어 최적화 MoE 아키텍처 의 대표 모델입니다. 한국어 벤치마크 성능:

EXAONE-Deep 시리즈 — 추론 특화

LG AI Research는 한국어 평가 데이터셋도 공개: KMMLU-Pro(2,820건), KMMLU-Redux(2,590건), Ko-LongRAG(600건).

2.3 Upstage — SOLAR 시리즈

Upstage는 Open Ko-LLM LeaderboardKo-FreshQA Leaderboard 를 운영하며 한국어 LLM 벤치마크 표준화에 기여하고 있습니다.

2.4 NCSOFT — VARCO 시리즈

한국어 비전-언어 벤치마크도 공개: K-MMStar, K-SEED, K-DTCBench, K-LLaVA-W, K-MMBench.

2.5 KRAFTON — Raon (한국어 음성 AI)

한국어 음성 AI의 오픈소스 공백을 메우는 역할을 하고 있습니다.

2.6 기타


3. 중국계 모델의 한국어 지원

3.1 Qwen (Alibaba) — 한국어 공식 지원 최강 오픈소스

Qwen은 한국어를 공식 지원 언어 에 포함하고 있으며, 한국어 테이블 이해, 구조화 출력 등에서도 잘 작동합니다. 오픈소스 모델 중 한국어 성능이 가장 높은 선택지 중 하나입니다.

3.2 DeepSeek — 범용 최강, 한국어는 비공식

한국어를 공식 지원하지 않지만, 대규모 다국어 데이터 학습으로 한국어 처리가 가능합니다. 한국 문화 맥락 이해는 국내 모델 대비 열세입니다.
주의 중국 AI 모델 사용 시 주의: 데이터 주권, 콘텐츠 검열, 규제 리스크를 고려해야 합니다. 금융/공공/방위산업 등 민감 도메인에서는 셀프호스팅하더라도 보안 정책 확인이 필수입니다.

4. 한국어 NLP 기술 과제

4.1 토큰화 방식 비교

한국어 전용 토크나이저는 범용 대비 동일 비용으로 약 1.5~2배 더 많은 한국어 텍스트 를 처리할 수 있습니다.

4.2 한국어 RAG 최적화 과제

한국어 RAG용 임베딩 모델 추천: 더 자세한 한국어 RAG 전략은 한국어 RAG 최적화 문서를 참고하세요.

5. 한국어 벤치마크 & 평가

KMMLU는 각 문항에 Human_Accuracy 가 포함되어 “AI가 인간 전문가 수준에 도달했는가”를 판단할 수 있습니다.

6. 정부 정책 & 산업 동향

6.1 주요 정책

6.2 데이터 인프라

6.3 산업별 AI 도입 현황

참고 공공 부문은 데이터 주권 이슈로 국산 AI 모델/국내 클라우드 우선 도입 정책이 강화되고 있습니다.

7. Databricks와 한국어 AI

7.1 세 가지 접근법

7.2 한국어 모델 선택 가이드 (Databricks 기준)


8. 향후 전망

단기 (2026)

  • MoE 기반 한국어 모델 보편화
  • 한국어 멀티모달 (비전+텍스트) 모델 확대
  • 한국어 음성 AI (TTS/ASR/대화) 성장

중기 (2026~2028)

  • 3B~7B 한국어 도메인 특화 모델 고도화
  • SuperBPE급 토크나이저 표준화
  • MCP/A2A 기반 한국어 에이전트 생태계 성숙
  • 공공 AI 전환 가속

핵심 과제


참고 자료: