[논문리뷰] Mixtral of Experts (2024)

sumin baek·2026년 5월 5일

논문리뷰

목록 보기
6/6

1. 도입: 모델 스케일링의 딜레마

  • 배경: 최근 자연어 처리 분야에서 모델의 성능을 높이기 위해 파라미터(매개변수) 크기를 무작정 키우는 추세가 지속되었습니다.
  • 문제점: 연산량이 기하급수적으로 증가하여 추론 속도가 느려지고 막대한 컴퓨팅 비용이 발생합니다.
  • 해결책 제시 (MoE): 모든 데이터를 처리할 때 전체 신경망을 다 쓰는 대신, "입력된 데이터에 가장 적합한 일부 네트워크만 활성화하자"는 희소(Sparse) 모델링 기법이 다시 주목받게 되었습니다.

2. 핵심 비유: '만능 천재 1명' vs '전문가 팀과 팀장'

MoE(Mixture of Experts)의 구조는 일상적인 업무 배분 방식과 같습니다.

  • 전통적 모델 (Dense Model): 모든 문제를 한 명의 만능 천재가 처음부터 끝까지 다 풉니다. 똑똑해질수록 덩치가 커져서 대답이 느려집니다.
  • MoE 모델 (Sparse Model): 8명의 분야별 전문가(Expert)와 1명의 라우터(Router, 팀장)로 구성됩니다.
  • 작동 방식: 입력이 들어오면 라우터가 문제를 분석하여 가장 잘 풀 수 있는 전문가 2명에게만 일을 배분합니다. 나머지 6명은 연산에 참여하지 않고 쉬고 있으므로 계산 자원을 크게 절약할 수 있습니다.

3. Mixtral 8x7B 아키텍처 상세

Mixtral 8x7B는 기존 트랜스포머(Transformer) 구조에서 피드포워드(FFN) 블록을 8개의 전문가 네트워크로 교체한 모델입니다.

스크린샷 2026-04-10 22.00.49.png

스크린샷 2026-04-10 22.01.50.png

  • 토큰 단위 라우팅: 문장이 아닌 '단어(Token)' 단위로 전문가를 매번 새로 평가하고 할당합니다.
  • 수식적 이해: 라우터는 입력값 xx에 가중치를 곱해 상위 2개의 전문가를 확률적으로 선택(Softmax)합니다. 선택된 두 전문가의 결과값을 가중합하여 최종 출력을 만듭니다. y=i=0n1Softmax(Top2(xWg))iSwiGLUi(x)y = \sum_{i=0}^{n-1} \text{Softmax}(\text{Top2}(x \cdot W_g))_i \cdot \text{SwiGLU}_i(x)
  • 연산 효율성 (Active vs Sparse)
    • 전체 파라미터 (Sparse): 470억 개 (47B) - 메모리에 올려두어야 하는 총용량.
    • 활성 파라미터 (Active): 130억 개 (13B) - 특정 단어를 처리할 때 실제로 연산되는 용량.

4. 객관적 성능 지표

단순히 연산량만 줄인 것이 아니라 훨씬 큰 단일 모델들을 뛰어넘는 결과를 보여주었습니다.

스크린샷 2026-04-10 22.02.55.png

  • 비교 우위: 활성 파라미터가 약 5배 더 큰 Llama 2 70B와 비교했을 때 대부분의 벤치마크(상식 추론, 세계 지식 등)에서 동등하거나 더 높은 성능을 기록했습니다.
  • 강세 분야: 특히 수학(Math)과 코드 생성(Code), 다국어 처리(프랑스어, 독일어 등) 능력이 기존 모델 대비 압도적으로 향상되었습니다.

5. 라우팅 분석: 전문가는 어떻게 역할을 나눌까?

  • 주제별 분할 (X): 수학, 생물학, 철학 등 도메인(주제)에 따라 전담 전문가가 나뉘지 않았습니다.
  • 구문/문법별 분할 (O): 특정 단어(예: 파이썬의 self, 영어의 Question)나 코드의 '들여쓰기(Indentation)' 등 텍스트의 구문적 구조(Syntax)에 따라 동일한 전문가가 반응하는 경향이 강했습니다.
  • 시간적 지역성: 방금 1번 전문가를 사용했다면, 바로 다음 단어에서도 1번 전문가를 연속으로 사용할 확률이 매우 높게 나타났습니다.

6. 한계점 및 비판적 평가

MoE 구조가 완벽한 해결책은 아니며 실무 적용 시 다음과 같은 명확한 한계가 존재합니다.

  1. VRAM (그래픽 메모리) 병목: 추론 연산량은 13B 수준으로 가볍지만 어떤 전문가가 호출될지 모르기 때문에 전체 47B 파라미터를 모두 GPU 메모리(VRAM)에 상주시켜야 합니다. 즉 하드웨어 메모리 요구량은 여전히 막대합니다.

  2. 전문가 붕괴 및 로드 밸런싱: 모델을 학습시킬 때 라우터가 일을 잘하는 특정 소수의 전문가에게만 계속 데이터를 몰아주는 현상이 발생할 수 있습니다. 이를 방지하기 위해 각 전문가가 고르게 학습되도록 강제하는 보조 손실 함수 등 까다로운 추가 최적화 과정이 필수적입니다.

  3. 분산 처리의 오버헤드

    여러 GPU에 전문가를 나누어 배치할 경우, GPU 간에 토큰 데이터를 주고받는 통신 비용이 발생하여 전체 시스템이 지연될 수 있습니다.

profile
낮에는 AI 엔지니어로, 밤에는 대학원생으로 인공지능을 탐구하며 기록하는 공간입니다.

0개의 댓글