PASCAL VOC (Visual Object Classes)는 2005년부터 2012년까지 진행된 PASCAL VOC Challenge를 통해 구축된 데이터셋으로, 객체 탐지 연구의 기틀을 마련한 선구자입니다. 특히 VOC2007과 VOC2012가 현재까지도 표준 벤치마크로 널리 사용됩니다.
Class: 객체의 클래스 (총 20개)Bounding box: 객체의 위치를 나타내는 사각형 좌표 (x, y, w, h)Pose, Truncated, Difficult 등 다양한 속성 정보를 포함합니다.PASCAL VOC는 COCO가 등장하기 전까지 객체 탐지 모델의 성능을 비교하는 표준 척도였으며, 지금도 비교적 가벼운 데이터셋의 이점을 살려 빠른 모델 프로토타이핑 및 테스트에 활발히 사용됩니다.
ImageNet(이미지넷)은 객체 탐지가 아닌 이미지 분류(Image Classification)를 위한 초대규모 데이터셋입니다. ILSVRC(ImageNet Large Scale Visual Recognition Challenge)를 통해 널리 알려졌습니다.
MS COCO (Microsoft Common Objects in Context)는 현대 객체 탐지, 분할(Segmentation) 등 다양한 비전 태스크의 사실상 표준(de facto standard) 데이터셋입니다.
Class, Bounding box, 그리고 픽셀 단위의 Segmentation 정보를 포함합니다.오늘날 발표되는 대부분의 SOTA(State-of-the-art) 탐지 모델들은 COCO 데이터셋으로 성능을 검증받으며, 우리가 사용하는 사전학습된 YOLO 가중치 역시 COCO로 학습된 것입니다.
| 구분 | ImageNet | PASCAL VOC | MS COCO |
|---|---|---|---|
| 주요 목적 | 이미지 분류 | 객체 탐지 | 객체 탐지 & 분할 |
| 핵심 역할 | Backbone 사전학습 | 초기 탐지 벤치마크 | 최신 모델 표준 벤치마크 |
| 클래스 수 | 1,000개 | 20개 | 80개 |
| 학습 이미지 수 | 약 128만 장 | 약 1만 장 내외 | 약 12만 장 |
| 어노테이션 | 이미지 단위 레이블 | 바운딩 박스 | 바운딩 박스, 분할 마스크 |
| 이미지 특징 | 객체가 크고 중앙에 위치 | 비교적 단순한 환경 | 작은 객체, 복잡한 환경 |
[1] M. Everingham, L. Van Gool, C. K. I. Williams, J. Winn, and A. Zisserman, "The Pascal Visual Object Classes (VOC) Challenge," International Journal of Computer Vision, vol. 88, no. 2, pp. 303–338, Jun. 2010.
[2] J. Deng, W. Dong, R. Socher, L.-J. Li, K. Li, and L. Fei-Fei, "ImageNet: A large-scale hierarchical image database," in 2009 IEEE Conference on Computer Vision and Pattern Recognition, Miami, FL, USA, 2009, pp. 248–255.
[3] T.-Y. Lin, M. Maire, S. Belongie, J. Hays, P. Perona, D. Ramanan, P. Dollár, and C. L. Zitnick, "Microsoft COCO: Common Objects in Context," in European Conference on Computer Vision, Zurich, Switzerland, 2014, pp. 740–755.