[TIL]_2025.05.26 (1) : 네트워킹 데이 인사이트 정리

JIYUU·2025년 5월 26일

네트워킹 데이

선정 도메인 - 제조

배터리 불량 예측 모델 발표 자료


📌 1. 데이터 개요 및 EDA

▸ 데이터 설명의 중요성

  • 데이터 출처, 센서 개수, 측정 간격, 총 시간 범위 등을 구체적으로 설명해야 함.
  • 시계열 데이터인지, 공정별로 수집된 이산적 데이터인지 명확히 해야 함.
  • 각 컬럼(센서)의 의미 설명이 반드시 필요 (예: 전류, 전압, 온도 등)

▸ 결측치 처리

  • fillna(method='linear') 사용 → 선형 보간법(linear interpolation)으로 결측 구간을 채움
  • 예시: 3초간 데이터 비어 있고 앞뒤 값이 10, 16이면, 중간 값은 12, 14로 채움
  • 시계열 데이터의 특성상 시간 순서가 중요한 경우, 선형 보간이 타당

▸ 시각화 (EDA)

  • KDE plot, 시계열 추이, 클러스터링 결과 등 시각화
  • 범례/색상 설명 누락 주의
  • 각 그래프는 무엇을 말하려는지 설명이 꼭 필요

📌 2. 차원 축소 및 이상치 탐지

▸ PCA (주성분 분석)

  • 다변량 센서 데이터를 저차원으로 압축
  • 2~3차원 시각화 가능 → 클러스터링이나 이상치 탐지에 활용
  • 설명 분산 비율(Explained Variance Ratio)도 함께 보여주는 게 좋음

▸ Isolation Forest

  • 비지도 이상치 탐지 알고리즘
  • 특이점(outlier)을 고립시키는 방식으로 탐지
  • 탐지된 이상치가 불량과 관련 있는지 다른 지표와 교차 확인 필요

📌 3. 클러스터링

▸ K-Means

  • PCA 축소된 데이터로 클러스터링 진행
  • 클러스터별 특성 평균 비교 → 특정 군집이 불량과 연관되는지 해석
  • 예시: 클러스터 2는 전류값이 평균보다 높고, 이 그룹은 대부분 불량이다

📌 4. 시계열 이상 탐지 기법 비교

모델설명장점단점
ARIMA전통 시계열 예측안정성 높음다변량/복잡한 패턴에 부적합
LSTMRNN 기반 시계열 모델시간 의존성 학습 가능장기 의존성 학습 어려움, 요즘 덜 사용됨
Auto-Encoder비지도 학습 기반 이상 탐지재구성 오차로 이상치 탐지하이퍼파라미터 튜닝 필요
MTadGANGAN 기반 다변량 시계열 이상 탐지복잡한 패턴 학습 가능학습 불안정, 해석 어려움
MSET변수 간 상관성 기반 탐지수학적으로 명확다변량 고차원 데이터에 불리

📌 5. 데이터 불균형 처리

▸ SMOTE vs GAN

  • SMOTE: 단순 평균 기반 synthetic data 생성 → 품질 낮음 가능성
  • GAN: 원본 분포를 학습한 후 유사 데이터 생성 → 데이터 증강의 질이 우수
    • 생성자(Generator)와 판별자(Discriminator)가 경쟁하며 점점 정교한 데이터 생성

📌 6. 분석 결과 요약 및 의미 해석

  • 이상치 탐지 → 불량 공정 조기 탐지에 활용 가능
  • 클러스터 분석 → 특정 조건에서 불량 발생 가능성 높은 조건 파악 가능
  • 특성 중요도(Feature Importance) 분석:
    • RandomForest, ExtraTrees 등 사용 가능
    • 딥러닝 계열에서는 SHAP, Integrated Gradients 활용 가능

📌 7. 모델 선택 이유와 정당화

  • 각 모델은 왜 선택했는가?

    • MTadGAN: 시계열 + 다변량 + 이상치 탐지 → 최적의 조합
    • Auto-Encoder: 정상 데이터 학습 → 재구성 오차 기반
  • 각 모델의 한계와 보완책도 반드시 언급


📌 8. 결과 시각화 및 대시보드

  • Tableau 또는 Streamlit 사용해 시각화
  • 실시간 데이터 연동도 가능 (파이썬 ↔ Tableau)
  • 분석 결과를 직관적으로 전달하는 구조로 구성
    • 예: 현재 공정상황 → 이상치 발생 시 알람 → 담당자 즉시 조치

📌 9. 기타 고찰

  • 4시그마, 6시그마 의미:
    • 6시그마 = 불량률 0.00034% 이하 달성
  • 딥러닝 기반 이상 탐지 → 조기 경고 시스템 구축 가능
  • 딥러닝으로 원인 유추 가능?
    • 정량적으로 특정 특성이 주요 영향 요소로 판단 가능
    • 하지만 정확한 원인 규명은 어려움 → 도메인 지식과 결합해야

✅ 결론 및 향후 방향

  • EDA 기반 분석 + 클러스터링 + 이상 탐지로 공정 불량 패턴 및 조기 경고 시스템 구축 가능
  • GAN 기반 데이터 증강으로 불균형 문제 완화
  • 시각화 대시보드로 실시간 모니터링 및 경고 가능
  • 단점: 딥러닝 모델 해석성 낮음 → 보완 필요
  • 향후 방향: 특성 중요도 기반 분석 심화, 설명 가능한 AI(XAI) 기법 추가 예정

프로젝트 발표 시 주의사항

  1. 발표자료에서는 정확한 명칭을 사용하여 명확하게 작성한다.
  2. 그래프에는 웬만하면 색상 범례를 사용하도록 한다.
  3. 분석을 진행한 후 그 결과에 대한 의미도 발표 자료에 명시한다.
  4. 데이터 자체에 대한 설명이 반드시 있어야 한다. (어떤 데이터이며, 어떻게 수집되었고, 단위가 어떻게 되며, 컬럼 당 어떤 의미를 가지고 있는지 등)
  5. 파생변수를 생성할 경우 왜 생성했는지 근거가 필요하다.
  6. 머신러닝, 딥러닝의 모델 뿐만 아니라 사용된 기법들이 왜 사용되었는지, 그리고 왜 다른 모델은 사용하지 않았는지에 대해서도 발표 자료에 기재하도록 한다.
  7. 사용된 모델, 기법의 장단점이 어떤 게 있는지 반드시 파악해야 한다. 이 부분은 면접에서도 중요하게 질문할 수 있다.

0개의 댓글