k-fold Cross Validation

tjdxordlsmsa·2026년 1월 18일

k-fold 교차검증이란 데이터를 training set과 test set으로 나눌 때, 어쩌다가 운이 좋아서 훈련성능과 테스트 성능이 모두 높게 나올 수 있는 상황을 방지하기 위한 평가 방식이다. 데이터를 k개의 조각(fold)으로 나눈 뒤, 1개의 데이터 조각은 검증용으로 사용하고 나머지는 학습용으로 사용하여 이 과정을 k번 반복한다. 그 결과로 나온 성능의 평균을 모델의 성능으로 간주하는 검증방식이다.

k-fold 교차검증의 장점은 데이터의 편향이 감소하며, 일반화 성능을 더 안정적으로 추정할 수 있다는 점이다. 데이터 수가 많을수록 어느 특정 test set에서만 성능이 다르게 나올 확률이 줄어들기 때문에 k-fold 교차검증은 데이터 수가 적을수록 효과가 크게 나타난다.

일반적으로 k값은 안정성과 효율성을 고려해 5나 10을 많이 채택하게 된다. k값으로 너무 작으면 계산은 빠르지만 성능평가의 신뢰도가 떨어질 수 있다는 단점이 있다. k값으로 너무 큰 값을 채택하면 분산은 줄어들지만 계산부담이 커진다는 단점이 있다. k-fold 교차검증은 데이터가 적을 때, 혹은 신뢰도를 강조해야 할 필요가 있을 때 사용하면 좋다.

이미지 출처:
https://www.geeksforgeeks.org/machine-learning/k-fold-cross-validation-in-machine-learning

profile

0개의 댓글