A

์ด์ •ํ›ˆยท2025๋…„ 10์›” 31์ผ

๐Ÿ“Š ๋ฐ์ดํ„ฐ ๋ถ„์„ ๋ฐ ๋จธ์‹ ๋Ÿฌ๋‹


๐Ÿงน 1. ๋ฐ์ดํ„ฐ ์ „์ฒ˜๋ฆฌ (Data Preprocessing)

๐Ÿ”น ํŒ๋‹ค์Šค ๊ธฐ๋ณธ ์ „์ฒ˜๋ฆฌ

๐Ÿ”น ๋ฐ์ดํ„ฐ ๋ถˆ๊ท ํ˜• ์ฒ˜๋ฆฌ

๐Ÿ”น ๊ฒฐ์ธก๊ฐ’ ์ฒ˜๋ฆฌ (IMPUTATION)

๐Ÿ”น ๋ณ€์ˆ˜ ๋ณ€ํ™˜


๐Ÿ” 2. ๋ฐ์ดํ„ฐ ์ถ”์ถœ (Data Extraction)


๐Ÿ“ˆ 3. ํ†ต๊ณ„

3.1 ์  ์ถ”์ •

  • ํ‘œ๋ณธ์˜ ์ •๋ณด๋กœ๋ถ€ํ„ฐ ๋ชจ์ง‘๋‹จ์˜ ๋ชจ์ˆ˜๋ฅผ ํ•˜๋‚˜์˜ ๊ฐ’์œผ๋กœ ์ถ”์ •ํ•˜๋Š” ๊ธฐ๋ฒ•
  • ์ ์ถ”์ • ์กฐ๊ฑด: unbiasedness / efficiency / consistency / sufficiency
  • ์ ์ถ”์ •๋Ÿ‰ ๊ตฌํ•˜๋Š” ๋ฒ•
    • ์ ๋ฅ ๋ฒ•: ํ‘œ๋ณธ์˜ ๊ธฐ๋Œ“๊ฐ’์„ ํ†ตํ•ด ๋ชจ์ˆ˜๋ฅผ ์ถ”์ •
    • ์ตœ๋Œ€ ๊ฐ€๋Šฅ๋„ ์ถ”์ •๋ฒ•: MLE ํ•จ์ˆ˜๋ฅผ ๋ฏธ๋ถ„ํ•ด์„œ ๊ธฐ์šธ๊ธฐ๊ฐ€ 0์ธ ๋ชจ์ˆ˜๋ฅผ ์ถ”์ •
    • ์ตœ์†Œ์ œ๊ณฑ๋ฒ•: ํ•จ์ˆ˜๊ฐ’๊ณผ ์ธก์ •๊ฐ’์˜ ์ฐจ์ด์ธ ์˜ค์ฐจ๋ฅผ ์ œ๊ณฑํ•œ ํ•ฉ์ด ์ตœ์†Œ๊ฐ€ ๋˜๋Š” ํ•จ์ˆ˜๋กœ ์ถ”์ •

3.2 ๊ตฌ๊ฐ„ ์ถ”์ •

๊ตฌ๋ถ„์ถ”์ • ๋Œ€์ƒ (๋ชจ์ˆ˜)๊ธฐํ˜ธ์ฃผ๋กœ ์‚ฌ์šฉํ•˜๋Š” ๋ถ„ํฌ
๋‹จ์ผ ๋ชจ์ง‘๋‹จ๋ชจํ‰๊ท ฮผ\muZZ-๋ถ„ํฌ, tt-๋ถ„ํฌ
๋ชจ๋น„์œจppZZ-๋ถ„ํฌ
๋ชจ๋ถ„์‚ฐฯƒ2\sigma^2์นด์ด์ œ๊ณฑ๋ถ„ํฌ (ฯ‡2\chi^2)
๋‘ ๋ชจ์ง‘๋‹จ๋ชจํ‰๊ท  ์ฐจ์ด (๋…๋ฆฝํ‘œ๋ณธ)ฮผ1โˆ’ฮผ2\mu_1 - \mu_2ZZ-๋ถ„ํฌ, tt-๋ถ„ํฌ
๋ชจํ‰๊ท  ์ฐจ์ด (๋Œ€์‘ํ‘œ๋ณธ)ฮผd\mu_dtt-๋ถ„ํฌ
๋ชจ๋น„์œจ ์ฐจ์ดp1โˆ’p2p_1 - p_2ZZ-๋ถ„ํฌ
๋ชจ๋ถ„์‚ฐ ๋น„ฯƒ12/ฯƒ22\sigma_1^2 / \sigma_2^2FF-๋ถ„ํฌ

3.3 ๊ฐ€์„ค ๊ฒ€์ •

๊ฒ€์ •๋ช…๊ฒ€์ • ๋ชฉ์ ์ •๊ทœ์„ฑ ํ•„์š”๋ถ„์‚ฐ ๊ฐ€์ •ํ‘œ๋ณธ ๊ด€๊ณ„๊ท€๋ฌด๊ฐ€์„ค (H0H_0)๋ถ„ํฌ
Z-๊ฒ€์ •ํ‰๊ท  ๋น„๊ตO (๋˜๋Š” nโ‰ฅ30n \ge 30)๋ชจ๋ถ„์‚ฐ(ฯƒ2\sigma^2) ๊ณต์ง€๋‹จ์ผ ํ‘œ๋ณธฮผ=ฮผ0\mu = \mu_0ZZ
๋‹จ์ผ ํ‘œ๋ณธ ๋น„์œจ Z-๊ฒ€์ •๋น„์œจ ๋น„๊ต๊ทผ์‚ฌ ์ •๊ทœ์ •๊ทœ ๊ทผ์‚ฌ (npโ‰ฅ5np \ge 5)๋‹จ์ผ ํ‘œ๋ณธp=p0p = p_0ZZ
๋…๋ฆฝ ๋น„์œจ Z-๊ฒ€์ •๋น„์œจ ๋น„๊ต๊ทผ์‚ฌ ์ •๊ทœ์ •๊ทœ ๊ทผ์‚ฌ (npโ‰ฅ5np \ge 5)๋…๋ฆฝ ํ‘œ๋ณธp1=p2p_1 = p_2ZZ
๋‹จ์ผ ํ‘œ๋ณธ t-๊ฒ€์ •ํ‰๊ท  ๋น„๊ตO๋ชจ๋ถ„์‚ฐ ๋ชจ๋ฆ„๋‹จ์ผ ํ‘œ๋ณธฮผ=ฮผ0\mu = \mu_0t(nโˆ’1)t(n-1)
๋…๋ฆฝ t-๊ฒ€์ •ํ‰๊ท  ๋น„๊ตO๋“ฑ๋ถ„์‚ฐ๋…๋ฆฝ ํ‘œ๋ณธฮผ1=ฮผ2\mu_1 = \mu_2t(n1+n2โˆ’2)t(n_1+n_2-2)
Welch t-๊ฒ€์ •ํ‰๊ท  ๋น„๊ตO๋น„๋“ฑ๋ถ„์‚ฐ๋…๋ฆฝ ํ‘œ๋ณธฮผ1=ฮผ2\mu_1 = \mu_2t(v)โˆ—t(v)^*
ฯ‡2\chi^2 ๊ฒ€์ •๋ฒ”์ฃผํ˜• ๋นˆ๋„ ๋ถ„์„X (๋ฒ”์ฃผํ˜•)๊ธฐ๋Œ€๋นˆ๋„ โ‰ฅ5\ge 5๋‹จ์ผ/๋…๋ฆฝ ํ‘œ๋ณธ๊ด€์ธก๋นˆ๋„ = ๊ธฐ๋Œ€๋นˆ๋„ฯ‡2(df)\chi^2(df)
ANOVAํ‰๊ท  ๋น„๊ต (3+)O๋“ฑ๋ถ„์‚ฐ๋…๋ฆฝ ํ‘œ๋ณธ (3+)ฮผ1=โ‹ฏ=ฮผk\mu_1 = \dots = \mu_kF(kโˆ’1,Nโˆ’k)F(k-1, N-k)
Mann-Whitneyํ‰๊ท  ๋น„๊ตX (๋น„๋ชจ์ˆ˜)ํ•„์š” ์—†์Œ๋…๋ฆฝ ํ‘œ๋ณธ๋‘ ์ง‘๋‹จ ๋ถ„ํฌ ๋™์ผUU (๋˜๋Š” ZZ)
Paired t-๊ฒ€์ •์ „/ํ›„ ๋น„๊ตO (์ฐจ์ด๊ฐ’)์ฐจ์ด๊ฐ’ ์‚ฌ์šฉ๋Œ€์‘ ํ‘œ๋ณธฮผdiff=0\mu_{diff} = 0t(nโˆ’1)t(n-1)
Wilcoxon์ „/ํ›„ ๋น„๊ตX (๋น„๋ชจ์ˆ˜)ํ•„์š” ์—†์Œ๋Œ€์‘ ํ‘œ๋ณธ์ค‘์•™๊ฐ’ ์ฐจ์ด = 00WW (๋˜๋Š” ZZ)
Shapiroโ€“Wilk์ •๊ทœ์„ฑ ํ™•์ธ--๋‹จ์ผ ํ‘œ๋ณธ๋ฐ์ดํ„ฐ๊ฐ€ ์ •๊ทœ๋ถ„ํฌ๋ฅผ ๋”ฐ๋ฆ„WW
K-S Test๋ถ„ํฌ ์ ํ•ฉ๋„--๋‹จ์ผ/๋‘ ํ‘œ๋ณธํŠน์ • ๋ถ„ํฌ๋ฅผ ๋”ฐ๋ฆ„DD
Bartlett Test๋“ฑ๋ถ„์‚ฐ์„ฑ ํ™•์ธO (๋ฏผ๊ฐ)-๋‘ ์ง‘๋‹จ ์ด์ƒฯƒ12=โ‹ฏ=ฯƒk2\sigma_1^2 = \dots = \sigma_k^2ฯ‡2(kโˆ’1)\chi^2(k-1)
Levene Test๋“ฑ๋ถ„์‚ฐ์„ฑ ํ™•์ธX (๊ฐ•๊ฑด)-๋‘ ์ง‘๋‹จ ์ด์ƒฯƒ12=โ‹ฏ=ฯƒk2\sigma_1^2 = \dots = \sigma_k^2F(kโˆ’1,Nโˆ’k)F(k-1, N-k)
  • ๋‹จ์ผ ํ‘œ๋ณธ: ํ•˜๋‚˜์˜ ํ‘œ๋ณธ (๋ณดํ†ต ๋ชจ์ง‘๋‹จ ๋˜๋Š” ์ „์ฒด ๊ทธ๋ฃน์˜ ๋ชจ์ˆ˜์™€ ๋น„๊ต)
  • ๋…๋ฆฝ ํ‘œ๋ณธ: ๋…๋ฆฝ์ ์ธ ๋‘ ํ‘œ๋ณธ(์ง‘๋‹จ) ์ด์ƒ

3.3 ๋ณ€์ˆ˜ ์กฐํ•ฉ์— ๋”ฐ๋ฅธ ๊ฒ€์ •


๐ŸŽฏ 4. ์ง€๋„ํ•™์Šต (Supervised Learning)

  • XGBoost
  • Multilayer Perceptron (MLP)
  • SVM (Support Vector Machine)
  • Logistic Regression
  • Ensemble โ€“ Voting
  • OLS (Ordinary Least Squares)
  • Ridge / Lasso / ElasticNet โ€” OLS์˜ ๋†’์€ ๋ถ„์‚ฐ์„ ์ œ์–ดํ•˜๊ธฐ ์œ„ํ•ด ๊ณ„์ˆ˜์— ์ˆ˜์ถ•(Shrinkage) ๊ทœ์ œ๋ฅผ ๊ฐ€ํ•˜์—ฌ ์ผ๋ฐ˜ํ™” ์„ฑ๋Šฅ์„ ๋†’์ธ ๋ชจ๋ธ
  • Decision Tree

๐ŸŒ€ 5. ๋น„์ง€๋„ํ•™์Šต (Unsupervised Learning)

  • K-Means Clustering
  • Hierarchical Clustering โ€” K-Means๋ณด๋‹ค ๋ณต์žกํ•˜๊ณ  ์œ ์—ฐํ•œ ๋™์ž‘
  • DBSCAN โ€” LOF์™€ ๋‹ฌ๋ฆฌ Globalํ•œ Density๋กœ, ํ•˜๋‚˜์˜ ๊ธฐ์ค€(ฯต\epsilon)์„ ๋ฐ์ดํ„ฐ ์ „์ฒด์— ๋™์ผํ•˜๊ฒŒ ์ ์šฉ
  • Gaussian Mixture Model (GMM)
  • t-SNE

๐Ÿ•ต๏ธ 6. ์ด์ƒ์น˜ ํƒ์ง€ (Anomaly Detection)

  1. ๋ฐ€๋„ ๊ธฐ๋ฐ˜
  2. ๋ชจ๋ธ ๊ธฐ๋ฐ˜
  3. ์žฌ๊ตฌ์ถ• ์˜ค์ฐจ ๊ธฐ๋ฐ˜ (์ถ”๊ฐ€ ์˜ˆ์ •)
  4. GAN ๊ธฐ๋ฐ˜ (์ถ”๊ฐ€ ์˜ˆ์ •)

โš™๏ธ 7. ๊ธฐ๊ณ„ํ•™์Šต ์•Œ๊ณ ๋ฆฌ์ฆ˜ (ML Algorithms)

  • Grid Search
  • Loss Functions (์†์‹ค ํ•จ์ˆ˜)
  • Gradient Descent
  • Back-Propagation

๐Ÿงช 8. ๋ชจ๋ธ ๊ฒ€์ฆ ๋ฐ ์„ฑ๋Šฅ ์ธก์ • (Validation & Metrics)

  • Stratified K-Fold

๐Ÿ“‰ Regression

๐ŸŽฏ Classification

๐ŸŒ€ Clustering

0๊ฐœ์˜ ๋Œ“๊ธ€