ELECTRA: Pre-training Text Encoders as Discriminators Rather Than Generators 논문 리뷰

김준형·2025년 3월 17일

딥러닝 논문 리뷰

목록 보기
1/34

[논문리뷰] ELECTRA: Pre-training Text Encoders as Discriminators Rather Than Generators

Kevin Clark, Minh-Thang Luong, Quoc V. Le, Christopher D. Manning

Abstract (초록)
BERT와 같은 마스크 언어 모델(MLM)은 일부 토큰만 학습 대상으로 삼아 비효율적이며 많은 연산이 필요하다. MLM 대신 Replaced Token Detection (대체 토큰 감지)라는 새로운 사전학습 방식을 활용한다. 대체 토큰 감지는 입력 문장에 일부 그럴듯한 단어(토큰)를 삽입하고, 모든 토큰이 원본인지 아닌지를 구분하는 판별기(discriminator)를 학습한다. 모든 토큰을 학습 대상으로 사용하므로 BERT보다 효율적이다.

Introduction (서론)
최근 NLP의 사전학습 모델은 대부분 MLM을 사용한다. 이는 전체 토큰 중 15%만 학습에 사용되어 연산이 비효율적이라는 단점이 있다. Replaced Token Detection (대체 토큰 감지)라는 사전학습 방식을 제안한다. 대체 토큰 감지 방식을 통해 모든 토큰으로 학습 가능하고 사전학습 때와 실제작업에서의 불일치를 해결한다. 이 방식을 ELECTRA “Efficiently Learning an Encoder that Classifies Token Replacements Accurately”라고 명명한다. ELECTRA는 적은 자원으로 더 좋은 성능을 내고, 특히 소형 모델에서 효율적이다.

Method (방법론)
Replaced Token Detection (대체 토큰 감지)
Generator(G): MLM 기능 수행
Discriminator(D): 모든 토큰에 대해 원본/대체 여부를 예측
일부 토큰 마스크 -> G가 대체 토큰 생성 -> D가 모든 토큰의 원본/대체 여부 예측
특징으로는 G가 올바른 대체 토큰을 생성하면 D는 원본으로 예측한다. 또한 G와 D는 적대적으로 학습되는 것이 아니라 최대우도방식으로 예측한다.

EXPERIMENTS (실험)
실험 환경:
ⓐ 평가 데이터셋
다양한 자연어이해(NLU) 태스크로 구성된 종합 벤치마크인 GLUE (General Language Understanding Evaluation) 데이터셋
ⓑ 학습 데이터
BERT와 동일하게 Wikipedia + BooksCorpus, Large 모델은 더 큰 데이터셋

모델 구조: BERT와 유사한 Transformer 구조를 사용한다.

모델 최적화:
ⓐ 가중치 공유
판별기는 입력된 단어나 가짜 단어만 업데이트하는 반면에, 생성기는 전체 어휘에 대해 모든 토큰 임베딩을 고르게 업데이트한다. 인코더의 모든 가중치를 공유하는 것은 거의 성능 향상이 없다. 그래서 생성기와 판별기 간 임베딩의 가중치를 공유한다.

ⓑ 작은 생성기
생성기가 너무 크면 판별기가 학습하기 어려워져 비효율적이다. 생성기를 판별기보다 작게 설계해서 학습 효율을 개선한다. 다른 하이퍼파라미터들은 그대로 둔 채 층의 크기를 줄여 생성기를 더 작게 만든다. 적절한 생성기 크기는 판별기 크기의 1/4~1/2 크기다.

ⓒ 학습 알고리즘 실험
두 단계 방식: 생성기 먼저 학습, 이후 판별기만 학습 -> 실패
강화 학습: 적대적 학습으로 생성기 학습 -> 성능 하락
동시 학습 방식: 생성기와 판별기를 동시에 학습 -> 가장 효율적

소형 모델 실험: 적은 자원으로 훈련한 ELECTRA 모델의 조건은 다음과 같다.
Sequence Length: 512 -> 128
Batch Size: 256 -> 128
Hidden Size: 768 -> 256
Token Embeddings: 768 -> 128

ELECTRA-Small이 적은 연산량으로 좋은 GLUE 점수를 기록한 것을 확인할 수 있다.

대형 모델 실험: ELECTRA 모델이 대형 모델로 확장되었을 때도 효율적이고 강력한 성능을 낼 수 있는지 평가한다.

학습량 증가에 따라 성능이 확실히 향상한다. ELECTRA-1.75M은 RoBERTa와 XLNet보다 성능이 좋은 것을 확인할 수 있다.

학습 효율성: 변형 모델을 통해 ELECTRA 방식이 기존 MLM 기반 모델보다 실제로 학습 효율이 높은지 확인한다.
ELECTRA 15%: BERT와 유사하게 판별기가 15%만 진짜, 가짜를 판별한다. -> ELECTRA보다 나쁨
Replace MLM: 마스크가 아닌 생성기가 대체한 가짜 토큰을 사용하는 MLM 방식이다. -> BERT보다는 좋음
All-Tokens MLM: 모든 토큰을 대상으로 예측하는 MLM 방식이다. -> ELECTRA와 비슷한 성능
ELECTRA의 성능 향상은 모든 토큰으로부터 학습하는 것, 사전학습과 파인튜닝 간의 불일치 문제를 완화한 것 덕분임을 알 수 있다.

CONCLUSION (결론)
대체 토큰 감지 (replaced token detection)의 핵심 아이디어는, 생성기가 만들어낸 그럴듯한 가짜 토큰과 실제 입력 토큰을 구별하도록 텍스트 인코더를 훈련하는 것이다. ELECTRA 모델은 계산 자원을 더 효율적으로 사용하며, 다운스트림 작업에서도 더 나은 성능을 보인다.

profile
김준형

0개의 댓글