[TIL]_2025.05.26 (1) : 네트워킹 데이 인사이트 정리
네트워킹 데이
선정 도메인 - 제조
배터리 불량 예측 모델 발표 자료
📌 1. 데이터 개요 및 EDA
▸ 데이터 설명의 중요성
- 데이터 출처, 센서 개수, 측정 간격, 총 시간 범위 등을 구체적으로 설명해야 함.
- 시계열 데이터인지, 공정별로 수집된 이산적 데이터인지 명확히 해야 함.
- 각 컬럼(센서)의 의미 설명이 반드시 필요 (예: 전류, 전압, 온도 등)
▸ 결측치 처리
fillna(method='linear') 사용 → 선형 보간법(linear interpolation)으로 결측 구간을 채움
- 예시: 3초간 데이터 비어 있고 앞뒤 값이 10, 16이면, 중간 값은 12, 14로 채움
- 시계열 데이터의 특성상 시간 순서가 중요한 경우, 선형 보간이 타당
▸ 시각화 (EDA)
- KDE plot, 시계열 추이, 클러스터링 결과 등 시각화
- 범례/색상 설명 누락 주의
- 각 그래프는 무엇을 말하려는지 설명이 꼭 필요
📌 2. 차원 축소 및 이상치 탐지
▸ PCA (주성분 분석)
- 다변량 센서 데이터를 저차원으로 압축
- 2~3차원 시각화 가능 → 클러스터링이나 이상치 탐지에 활용
- 설명 분산 비율(Explained Variance Ratio)도 함께 보여주는 게 좋음
▸ Isolation Forest
- 비지도 이상치 탐지 알고리즘
- 특이점(outlier)을 고립시키는 방식으로 탐지
- 탐지된 이상치가 불량과 관련 있는지 다른 지표와 교차 확인 필요
📌 3. 클러스터링
▸ K-Means
- PCA 축소된 데이터로 클러스터링 진행
- 클러스터별 특성 평균 비교 → 특정 군집이 불량과 연관되는지 해석
- 예시: 클러스터 2는 전류값이 평균보다 높고, 이 그룹은 대부분 불량이다
📌 4. 시계열 이상 탐지 기법 비교
| 모델 | 설명 | 장점 | 단점 |
|---|
| ARIMA | 전통 시계열 예측 | 안정성 높음 | 다변량/복잡한 패턴에 부적합 |
| LSTM | RNN 기반 시계열 모델 | 시간 의존성 학습 가능 | 장기 의존성 학습 어려움, 요즘 덜 사용됨 |
| Auto-Encoder | 비지도 학습 기반 이상 탐지 | 재구성 오차로 이상치 탐지 | 하이퍼파라미터 튜닝 필요 |
| MTadGAN | GAN 기반 다변량 시계열 이상 탐지 | 복잡한 패턴 학습 가능 | 학습 불안정, 해석 어려움 |
| MSET | 변수 간 상관성 기반 탐지 | 수학적으로 명확 | 다변량 고차원 데이터에 불리 |
📌 5. 데이터 불균형 처리
▸ SMOTE vs GAN
- SMOTE: 단순 평균 기반 synthetic data 생성 → 품질 낮음 가능성
- GAN: 원본 분포를 학습한 후 유사 데이터 생성 → 데이터 증강의 질이 우수
- 생성자(Generator)와 판별자(Discriminator)가 경쟁하며 점점 정교한 데이터 생성
📌 6. 분석 결과 요약 및 의미 해석
- 이상치 탐지 → 불량 공정 조기 탐지에 활용 가능
- 클러스터 분석 → 특정 조건에서 불량 발생 가능성 높은 조건 파악 가능
- 특성 중요도(Feature Importance) 분석:
- RandomForest, ExtraTrees 등 사용 가능
- 딥러닝 계열에서는 SHAP, Integrated Gradients 활용 가능
📌 7. 모델 선택 이유와 정당화
-
각 모델은 왜 선택했는가?
- MTadGAN: 시계열 + 다변량 + 이상치 탐지 → 최적의 조합
- Auto-Encoder: 정상 데이터 학습 → 재구성 오차 기반
-
각 모델의 한계와 보완책도 반드시 언급
📌 8. 결과 시각화 및 대시보드
- Tableau 또는 Streamlit 사용해 시각화
- 실시간 데이터 연동도 가능 (파이썬 ↔ Tableau)
- 분석 결과를 직관적으로 전달하는 구조로 구성
- 예: 현재 공정상황 → 이상치 발생 시 알람 → 담당자 즉시 조치
📌 9. 기타 고찰
- 4시그마, 6시그마 의미:
- 6시그마 = 불량률 0.00034% 이하 달성
- 딥러닝 기반 이상 탐지 → 조기 경고 시스템 구축 가능
- 딥러닝으로 원인 유추 가능?
- 정량적으로 특정 특성이 주요 영향 요소로 판단 가능
- 하지만 정확한 원인 규명은 어려움 → 도메인 지식과 결합해야
✅ 결론 및 향후 방향
- EDA 기반 분석 + 클러스터링 + 이상 탐지로 공정 불량 패턴 및 조기 경고 시스템 구축 가능
- GAN 기반 데이터 증강으로 불균형 문제 완화
- 시각화 대시보드로 실시간 모니터링 및 경고 가능
- 단점: 딥러닝 모델 해석성 낮음 → 보완 필요
- 향후 방향: 특성 중요도 기반 분석 심화, 설명 가능한 AI(XAI) 기법 추가 예정
프로젝트 발표 시 주의사항
- 발표자료에서는 정확한 명칭을 사용하여 명확하게 작성한다.
- 그래프에는 웬만하면 색상 범례를 사용하도록 한다.
- 분석을 진행한 후 그 결과에 대한 의미도 발표 자료에 명시한다.
- 데이터 자체에 대한 설명이 반드시 있어야 한다. (어떤 데이터이며, 어떻게 수집되었고, 단위가 어떻게 되며, 컬럼 당 어떤 의미를 가지고 있는지 등)
- 파생변수를 생성할 경우 왜 생성했는지 근거가 필요하다.
- 머신러닝, 딥러닝의 모델 뿐만 아니라 사용된 기법들이 왜 사용되었는지, 그리고 왜 다른 모델은 사용하지 않았는지에 대해서도 발표 자료에 기재하도록 한다.
- 사용된 모델, 기법의 장단점이 어떤 게 있는지 반드시 파악해야 한다. 이 부분은 면접에서도 중요하게 질문할 수 있다.