1. 데이터 준비와 확인
네이버 영화의 댓글을 모아 구성된 한국어 텍스트 감성 분석
Naver sentiment movie corpus
2. 데이터로더 구성
전혀 가공되지 않은 nsmc 데이터셋 텍스트 파일을 읽어 data_loader 생성
💡 data_loader 안에서 수행해야할 사항
3. 모델 구성을 위한 데이터 분석 및 가공
4. 모델 구성 및 validation set 구성
5. 모델 훈련 개시
6. Loss, Accuracy 그래프 시각화
7. 학습된 Embedding 레이어 분석
8. 한국어 Word2Vec 임베딩 활용하여 성능 개선
한국어 Word2Vec :Pre-trained word vectors of 30+ languages
gensim 버전을 3.x.x로 낮추기
PROJECT : movie reivew sentiment
3가지 모델 구현 결과
RNN 모델 : 0.8449
1-D Convolution Neural Network(1-D CNN)모델 : 0.8165
GlobalMaxPooling1D() : 0.8322
한국어 Word2Vec을 활용한 LSTM 모델
LSTM(128), epochs=20, batch_size=64 = 0.8522
최종 85.2%의 정확도를 보여 가시적인 성능 향상을 달성