객체 탐지(Object Detection) 데이터셋 비교: PASCAL VOC, ImageNet, COCO

유한성·2025년 9월 10일

1. PASCAL VOC

PASCAL VOC (Visual Object Classes)는 2005년부터 2012년까지 진행된 PASCAL VOC Challenge를 통해 구축된 데이터셋으로, 객체 탐지 연구의 기틀을 마련한 선구자입니다. 특히 VOC2007VOC2012가 현재까지도 표준 벤치마크로 널리 사용됩니다.

  • 어노테이션 형식: XML format
    • Class: 객체의 클래스 (총 20개)
    • Bounding box: 객체의 위치를 나타내는 사각형 좌표 (x, y, w, h)
    • Pose, Truncated, Difficult 등 다양한 속성 정보를 포함합니다.
  • 데이터셋 구성:
    • 학습 및 검증용 이미지(JPEG)와 바운딩 박스 정보.
    • Semantic/Instance Segmentation을 위한 픽셀 단위 마스크 이미지도 제공합니다.
  • 데이터셋 크기 (VOC2007+2012 기준):
    • 이미지 수: 약 11,530장의 학습(training) 및 검증(validation) 이미지
    • 클래스 수: 20개 (예: person, car, cat, dog, chair 등)
    • 이미지당 평균 객체 수: 약 2.4개

PASCAL VOC는 COCO가 등장하기 전까지 객체 탐지 모델의 성능을 비교하는 표준 척도였으며, 지금도 비교적 가벼운 데이터셋의 이점을 살려 빠른 모델 프로토타이핑 및 테스트에 활발히 사용됩니다.


2. ImageNet

ImageNet(이미지넷)은 객체 탐지가 아닌 이미지 분류(Image Classification)를 위한 초대규모 데이터셋입니다. ILSVRC(ImageNet Large Scale Visual Recognition Challenge)를 통해 널리 알려졌습니다.

  • 이것이 중요합니다: ImageNet의 핵심 역할은 탐지 모델의 Backbone을 사전학습(Pretraining)시키는 것입니다. 1,000개 클래스에 달하는 120만 장 이상의 이미지를 학습하며, 모델은 객체의 위치 정보 없이 '이미지 안에 무엇이 있는지'만 맞추는 훈련을 합니다. 이 과정에서 모델은 사물의 기본적인 형태, 질감, 색상 등 범용적인 시각 특징을 학습하게 됩니다.
  • 데이터셋 크기 (ILSVRC 2012 기준):
    • 이미지 수: 약 128만 장의 학습 이미지
    • 클래스 수: 1,000개
  • 탐지를 위한 한계: ImageNet 자체는 분류용 데이터셋이므로, 이미지 내 객체가 중앙에 있거나 크기가 큰 경향이 있습니다. 따라서 ImageNet으로 사전학습된 Backbone 위에 탐지를 위한 Neck과 Head를 붙여 PASCAL VOC나 COCO 같은 탐지용 데이터셋으로 추가 학습(Fine-tuning)하는 과정이 필수적입니다.

3. MS COCO

MS COCO (Microsoft Common Objects in Context)는 현대 객체 탐지, 분할(Segmentation) 등 다양한 비전 태스크의 사실상 표준(de facto standard) 데이터셋입니다.

  • 어노테이션 형식: JSON format
    • Class, Bounding box, 그리고 픽셀 단위의 Segmentation 정보를 포함합니다.
  • COCO 데이터셋의 장점:
    • 다양한 크기의 객체: 특히 다른 데이터셋에 비해 작은 객체(small objects)의 비율이 높아 탐지 난이도가 높습니다.
    • 복잡한 환경: 여러 객체가 서로 겹쳐있거나(occlusion), 복잡한 배경 속에 존재하는 등 현실 세계와 유사한 이미지들로 구성됩니다.
    • Non-iconic 이미지: 전형적인 구도의 이미지를 넘어, 다양한 시점과 맥락 속에서 객체를 포착한 '덜 상징적인' 이미지들이 많아 모델의 일반화 성능을 높이는 데 기여합니다.
  • 데이터셋 크기 (COCO 2017 기준):
    • 이미지 수: 약 118,000장의 학습 이미지, 5,000장의 검증 이미지
    • 클래스 수: 80개 (person, car, boat 등)
    • 이미지당 평균 객체 수: 약 7.7개로, VOC보다 훨씬 밀도가 높습니다.

오늘날 발표되는 대부분의 SOTA(State-of-the-art) 탐지 모델들은 COCO 데이터셋으로 성능을 검증받으며, 우리가 사용하는 사전학습된 YOLO 가중치 역시 COCO로 학습된 것입니다.


한눈에 보는 비교: ImageNet vs PASCAL VOC vs MS COCO

구분ImageNetPASCAL VOCMS COCO
주요 목적이미지 분류객체 탐지객체 탐지 & 분할
핵심 역할Backbone 사전학습초기 탐지 벤치마크최신 모델 표준 벤치마크
클래스 수1,000개20개80개
학습 이미지 수약 128만 장약 1만 장 내외약 12만 장
어노테이션이미지 단위 레이블바운딩 박스바운딩 박스, 분할 마스크
이미지 특징객체가 크고 중앙에 위치비교적 단순한 환경작은 객체, 복잡한 환경

References

[1] M. Everingham, L. Van Gool, C. K. I. Williams, J. Winn, and A. Zisserman, "The Pascal Visual Object Classes (VOC) Challenge," International Journal of Computer Vision, vol. 88, no. 2, pp. 303–338, Jun. 2010.

[2] J. Deng, W. Dong, R. Socher, L.-J. Li, K. Li, and L. Fei-Fei, "ImageNet: A large-scale hierarchical image database," in 2009 IEEE Conference on Computer Vision and Pattern Recognition, Miami, FL, USA, 2009, pp. 248–255.

[3] T.-Y. Lin, M. Maire, S. Belongie, J. Hays, P. Perona, D. Ramanan, P. Dollár, and C. L. Zitnick, "Microsoft COCO: Common Objects in Context," in European Conference on Computer Vision, Zurich, Switzerland, 2014, pp. 740–755.

0개의 댓글