지식 · AI 기초

전문가 혼합 · MoE

Mixture of Experts

📂AI 기초읽기 1분📊심화🔗관련 4

전문가 혼합이란?

한 줄 정의
하나의 거대 모델 대신 여러 '전문가' 하위 모델을 두고, 입력마다 필요한 전문가만 골라 쓰는 효율적 구조.
⚡ 3줄 요약
  • 여러 전문가 중 필요한 것만 활성화
  • 크지만 연산은 절약(희소 활성화)
  • 최신 대형 모델이 채택

MoE(전문가 혼합)는 모델 안에 여러 전문 영역의 하위 네트워크(전문가)를 두고, 질문이 오면 '라우터'가 그에 맞는 소수의 전문가만 활성화합니다. 병원에서 증상에 맞는 전문의에게 보내는 것과 비슷합니다.

전체 파라미터는 아주 크지만 매번 일부만 쓰기 때문에, 큰 모델의 성능을 내면서도 연산 비용은 절약됩니다. 최근 여러 최신 대형 모델이 이 구조를 채택해, '크지만 효율적인' 모델을 가능하게 합니다.

이런 방식을 '희소 활성화(sparse activation)'라고 합니다. 전체 파라미터는 메모리에 다 올려 둬야 해서 저장 부담은 크지만, 매 추론에서 실제 계산은 일부 전문가만 하므로 속도·비용이 절약됩니다. '모델은 크게, 연산은 작게'라는 절충이 MoE의 핵심 아이디어입니다.

💡 쉽게 말하면
병원에서 증상에 맞는 전문의에게만 보내듯 — 매번 일부 전문가만 써서 효율을 냅니다.
실무에서 왜 중요한가
'모델은 키우되 비용은 아끼는' 방법입니다. 최신 대형 모델의 효율을 이해하는 개념입니다.
유래와 출처

전문가 혼합 개념은 1991년 제이컵스·힌턴 등의 연구로 제시됐고, 대형 언어모델 시대에 효율적 확장 방법으로 다시 각광받고 있습니다.

출처 · 제이컵스·힌튼 등(1991), 샤지어(Shazeer) 등 희소 게이팅(2017)
사례로 이해하기

예를 들어, MoE 모델이 질문을 처리하는 과정을 봅시다.

  1. 입력 — 질문이 들어옵니다.
  2. 라우팅 — 라우터가 관련 전문가를 고릅니다.
  3. 선택 활성화 — 전체가 아닌 일부 전문가만 작동합니다.
  4. 효율 — 큰 모델이지만 연산은 적게 씁니다.
  5. 출력 — 성능은 유지하며 답을 냅니다.
관련 용어
이 용어와 연결된 교육
📚에이전트 AI 실무 입문나눔경영컨설팅 기업교육 · 대면/온라인과정 보기 →
이 주제로 사내 교육이 필요하신가요?
담당자 맞춤 커리큘럼·견적을 바로 받아보세요.
교육 문의하기
최종 수정 2026-07-11 · 감수 김종혁

자주 묻는 질문

매번 전부 쓰면 비용이 폭증합니다. 필요한 전문가만 골라 쓰면 성능과 효율을 함께 잡습니다.
일반 모델은 항상 전체를 쓰고, MoE는 입력마다 일부만 씁니다. 같은 성능을 더 싸게 낼 수 있습니다.
매번 일부 전문가만 활성화해 큰 성능을 내면서도 연산 비용을 아끼기 위해서입니다.
일반은 매번 전체를 쓰고, MoE는 '필요한 전문가만' 씁니다 — 크지만 효율적입니다.