Keras를 사용하여 한국어 텍스트의 긍정/부정 감성을 분류하는 딥러닝 모델을 구축함
Okt 형태소 분석, BiLSTM 레이어, Embedding 레이어를 활용하여 텍스트를 처리함
체크포인트, 얼리스탑 등 콜백 함수를 통해 모델의 학습 안정성을 확보함
한국어 감성 분석 모델은 텍스트 클렌징, 형태소 분석, 토큰화, 패딩 과정을 거친다. 구체적으로, Okt 형태소 분석기를 사용하여 문장을 단어 단위로 분리하고, 불용어를 제거한다. 따라서, 토크나이저를 통해 단어 사전 구축 후, 패딩으로 시퀀스 길이를 맞춘다.
BiLSTM 레이어는 문장의 양방향 문맥 정보를 학습하여 감성 분석 성능을 향상시킨다. 정방향과 역방향 LSTM을 결합하여, 각 단어의 앞뒤 문맥을 모두 고려한다. 따라서, 한국어와 같이 어순이 중요한 언어에서 감성 분류 정확도를 높이는 데 기여한다.
모델 학습 과정에서 과적합을 방지하고, 최적의 모델을 저장하기 위해 ModelCheckpoint, EarlyStopping 콜백을 사용한다. 구체적으로, EarlyStopping은 검증 손실이 개선되지 않으면 학습을 조기 종료한다. 따라서, 학습 시간 단축과 일반화 성능 향상을 동시에 달성한다.