[Paper Review] DeepLab.v2

msgoยท2026๋…„ 5์›” 25์ผ

๐Ÿ“Œ ๋ณธ ๊ธ€์€ 2023.05 ์— ์ž‘์„ฑํ•œ paper review๋ฅผ ๋‹ค๋“ฌ์–ด ๋ฐœํ–‰ํ•œ ์•„์นด์ด๋ธŒ ๊ธ€์ž…๋‹ˆ๋‹ค.
์ž‘์„ฑ ๋‹น์‹œ ์ปจํ…์ŠคํŠธ: X:AI 4๊ธฐ Basic
์›๋ณธ ๋…ผ๋ฌธ: https://arxiv.org/abs/1606.00915

Liang-Chieh Chen, George Papandreou, Senior Member, IEEE, Iasonas Kokkinos, Member, IEEE,
Kevin Murphy, and Alan L. Yuille, Fellow, IEEE

Abstract

์šฐ๋ฆฌ๋Š” ๋”ฅ๋Ÿฌ๋‹์„ ํ†ตํ•œ semantic segmentation์œผ๋กœ 3๊ฐ€์ง€์˜ ์‹ค์šฉ์ ์ธ ์ด์ ์„ ๋ณด์—ฌ์ค๋‹ˆ๋‹ค. ๋จผ์ € atrous convolution๋Š” ๋”ฅ๋Ÿฌ๋‹์—์„œ ํ•ด์ƒ๋„๋ฅผ ์กฐ์ ˆํ•  ์ˆ˜ ์žˆ๊ฒŒ ํ•ด์ค๋‹ˆ๋‹ค. ๋˜ํ•œ, ๋ณ„๋„์˜ ์ถ”๊ฐ€์ ์ธ ์—ฐ์‚ฐ ์—†์ด ํ•„ํ„ฐ์˜ ํฌ๊ธฐ๋ฅผ ํ‚ค์šธ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค. ๋‘๋ฒˆ์งธ๋กœ ๋‹ค์–‘ํ•œ ํฌ๊ธฐ์˜ ๊ฐ์ฒด์— ๋Œ€ํ•ด ๊ฐ•๊ฑดํ•œ atrous spatial pyramid pooling(ASPP)๋ฅผ ์ œ์‹œํ•ฉ๋‹ˆ๋‹ค. ASPP๋Š” convolution layer์—์„œ ๋‹ค์–‘ํ•œ ํฌ๊ธฐ๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ ๋‹ค์–‘ํ•œ ํฌ๊ธฐ์˜ ์ด๋ฏธ์ง€ ์ •๋ณด๋ฅผ ์žก์•„๋‚ผ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค. ์„ธ๋ฒˆ์งธ๋กœ DCNN๊ณผ ํ™•๋ฅ ์  ๊ทธ๋ž˜ํ”„ ๋ชจ๋ธ์„ ๊ฒฐํ•ฉํ•˜์—ฌ ๋ฌผ์ฒด์˜ ๊ฒฝ๊ณ„ ์œ„์น˜๋ฅผ ๋”์šฑ ๊ฐœ์„ ์‹œํ‚ต๋‹ˆ๋‹ค. ๋Œ€๋ถ€๋ถ„์˜ DCNN์—์„œ์˜ max pooling์€ ๋ถ„๋ฅ˜์—๋Š” ๋†’์€ ์ •ํ™•๋„๋ฅผ ๊ฐ€์ ธ๋‹ค ์ฃผ์ง€๋งŒ ์œ„์น˜์˜ ์ •ํ™•์„ฑ์€ ๋–จ์–ด์ง‘๋‹ˆ๋‹ค. ์šฐ๋ฆฌ๋Š” fully connected Conditional Random Field(CRF)๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ ์ด๋ฅผ ๊ทน๋ณตํ•˜๊ณ ์ž ํ–ˆ์Šต๋‹ˆ๋‹ค. ์šฐ๋ฆฌ๊ฐ€ ์ œ์•ˆํ•˜๋Š” DeepLab์€ PASCAL VOC-2012์—์„œ 79.7%mIOU๋ฅผ ๋‹ฌ์„ฑํ–ˆ์Šต๋‹ˆ๋‹ค.

Introduction

DCNNs๋Š” ๋‹ค์–‘ํ•œ ๊ธฐ๋ณธ์ ์ธ ๋ฌธ์ œ์—์„œ ๋†’์€ ์„ฑ๊ณผ๋ฅผ ๋‚˜ํƒ€๋‚ด๊ณ  ์žˆ๋‹ค. ์ด๋Ÿฌํ•œ ๋†’์€ ์„ฑ๋Šฅ์€ ๋ถˆ๋ณ€์„ฑ์— ์žˆ๋‹ค. ๋ถˆ๋ณ€์„ฑ์€ ๋‹ค๋ฅธ input์ด ๋“ค์–ด๊ฐ”์„ ๋•Œ ๊ฐ™์€ output์„ ๋‚˜ํƒ€๋‚ด๋Š” ๊ฒƒ์ด๋ฉฐ ์ด๋Š” ๋ฐ์ดํ„ฐ์˜ ํ‘œํ˜„์„ ์š”์•ฝํ•˜๊ธฐ ๋•Œ๋ฌธ์— ๋‚˜ํƒ€๋‚˜์ง„๋‹ค. ์ด๋Ÿฌํ•œ ๊ฒƒ์€ ๋ฏธ์„ธํ•œ ํ…Œ์Šคํฌ์ธ semantic segmentation๊ณผ ๊ฐ™์€ ๊ฒฝ์šฐ ์„ฑ๋Šฅ์„ ๋–จ์–ด๋œจ๋ฆฌ๋Š” ์š”์†Œ๊ฐ€ ๋œ๋‹ค.

๊ทธ๋ž˜์„œ ์šฐ๋ฆฌ๋Š” DCNNs์˜ semantic segmentation์—์„œ ๋‹ค์Œ 3๊ฐ€์ง€ ๋ฌธ์ œ๋ฅผ ๋‹ค๋ฃจ๊ณ ์ž ํ•œ๋‹ค.

(1) Reduced feature resolution

(2) Existence of objects at multiple scales

(3) Reduced localization accuracy due to DCNN invariance

(1) Reduced feature resolution

์ฒซ ๋ฒˆ์งธ ๋ฌธ์ œ์˜ ๊ฒฝ์šฐ max-pooling๊ณผ downsampling์— ์˜ํ•ด ๋ฐœ์ƒ๋œ๋‹ค. ์ž์„ธํžˆ ๋งํ•˜์ž๋ฉด max-pooling์ด๋‚˜ conv layer์— ์˜ํ•ด ํ”ผ์ณ๋งต์€ ์ ์  ์ถ•์•ฝ๋˜์–ด์ง€๋ฉฐ ์ž‘์•„์ง€๊ฒŒ ๋˜๋Š”๋ฐ ์ด๋Ÿฌํ•œ ๊ฒฝ์šฐ ์›๋ž˜ ์ด๋ฏธ์ง€์—์„œ์˜ ์ •ํ™•ํ•œ ์ •๋ณด๊ฐ’์„ ์ถ”๋ก ํ•˜๋Š”๋ฐ ์–ด๋ ค์›€์ด ์žˆ์„ ์ˆ˜ ์žˆ๋‹ค. ๊ทธ๋ž˜์„œ DeepLab์—์„œ๋Š” ๊ธฐ์กด์˜ ๋งˆ์ง€๋ง‰ ๋ช‡๋ช‡ ๋ถ€๋ถ„์— max-pooling๊ธฐ๋ฒ•์„ ์ œ๊ฑฐํ•˜์˜€์œผ๋ฉฐ, conv layer๋ฅผ ๋‹ค๋ฅธ upsample filters๋กœ ๊ต์ฒดํ•œ๋‹ค. upsample filter๋Š” ๊ฐ’ ํ•„ํ„ฐ๋“ค ์‚ฌ์ด์— hole์„ ์‚ฝ์ž…ํ•˜์—ฌ ์ง„ํ–‰ํ•œ๋‹ค. ์ด๋Ÿฌํ•œ ๊ธฐ๋ฒ•์€ ์‹ ํ˜ธ์ฒ˜๋ฆฌ์—์„œ ๋งŽ์ด ์‚ฌ์šฉ๋˜์–ด์กŒ์œผ๋ฉฐ ํšจ์œจ์ ์ธ ๊ณ„์‚ฐ ๋ฐฉ์‹์—์„œ ๋ฐœ์ „๋˜์—ˆ๋‹ค.

์šฐ๋ฆฌ๋Š” ์ด๋Ÿฌํ•œ upsample filters๋ฅผ atrous convolution์ด๋ผ ๋ถ€๋ฅธ๋‹ค. atrous convolution์€ ํ”ผ์ณ๋งต์„ ๋” ์ •๋ฐ€ํ•˜๊ฒŒ ๊ณ„์‚ฐํ•˜๋ฉฐ ์›๋ณธ ์ด๋ฏธ์ง€์˜ ํฌ๊ธฐ๋กœ ๋ณ€ํ˜•์‹œ์ผœ์ฃผ๋Š” ๊ฐ„๋‹จํ•œ ๋ณด๊ฐ„์ด ๋”ฐ๋ฅธ๋‹ค. ์ด๋Ÿฌํ•œ ๊ฐ„๋‹จํ•˜๋ฉฐ ํšจ๊ณผ์ ์ธ ๋ฐฉ์‹์œผ๋กœ deconvolutional layer๋ฅผ ๋Œ€์ฒดํ•  ์ˆ˜ ์žˆ๋‹ค. ์ผ๋ฐ˜์ ์ธ ๋ณดํ†ต์˜ conv์™€ ๋น„๊ตํ•˜์—ฌ atrous๋Š” ์ถ”๊ฐ€์ ์ธ ์—ฐ์‚ฐ๋Ÿ‰ ์—†์ด ๋”์šฑ ํฐ ํ•„ํ„ฐ์˜ ๊ด€์ ์„ ๊ฐ€์ง€๊ฒŒ ํ•ด์ค€๋‹ค.

(2) Existence of objects at multiple scales

๋‘ ๋ฒˆ์งธ ๋ฌธ์ œ์˜ ๊ฒฝ์šฐ ๋‹ค์–‘ํ•œ ํฌ๊ธฐ์˜ ๊ฐ์ฒด์˜ ์กด์žฌ์ด๋‹ค. ์ผ๋ฐ˜์ ์œผ๋กœ๋Š” ๊ฐ™์€ ์ด๋ฏธ์ง€์— ๋Œ€ํ•œ DCNN์˜ rescaled version์„ ํ†ตํ•ด ์ด๋ฅผ ํ•ด๊ฒฐํ•œ๋‹ค. ์ด๋Ÿฌํ•œ ๋ฐฉ์‹์€ ์ข‹์€ ์„ฑ๋Šฅ์œผ๋กœ ์œ ๋„๋˜์ง€๋งŒ, ๊ทธ๋งŒํผ ๋งŽ์€ ์ปดํ“จํŒ… ์ž์›์ด ํ•„์š”ํ•˜๋‹ค. ๋Œ€์‹ ์— SPP-net์—์„œ์˜ spatial pyramid pooling์„ ์‚ฌ์šฉํ•˜๋ฉด ์ž‘์€ ์—ฐ์‚ฐ์œผ๋กœ convolution์ด์ „ ๋‹ค์–‘ํ•œ ๊ทœ๋ชจ์—์„œ์˜ ํ”ผ์ณ๋ฅผ ์–ป์„ ์ˆ˜ ์žˆ๋‹ค. ๋‹ค์–‘ํ•œ ํฌ๊ธฐ์˜ ํ•„ํ„ฐ๋ฅผ ํ†ตํ•ด ์ด๋ฏธ์ง€๋ฅผ ํ™•์ธํ•˜๋Š” ๊ฒƒ์€ ๋‹ค์–‘ํ•œ ๊ด€์  ๋ฟ๋งŒ ์•„๋‹ˆ๋ผ ๋‹ค์–‘ํ•œ ํฌ๊ธฐ์—์„œ ํšจ๊ณผ์ ์ด๋‹ค. ์‹ค์ œ๋กœ ํ”ผ์ณ๋ฅผ ๋ฆฌ์ƒ˜ํ”Œ๋งํ•˜๋Š”๊ฒƒ์ด ์•„๋‹Œ ๋‹ค๋ฅธ rate์˜ ๋ณ‘๋ ฌ์ ์ธ atrous convolutional layer๋Š” ํšจ๊ณผ์ ์ด์—ˆ์Šต๋‹ˆ๋‹ค. ์ด๋ฅผ ASPP๋ผ ํ•ฉ๋‹ˆ๋‹ค.

(3) Reduced localization accuracy due to DCNN invariance

505

์„ธ ๋ฒˆ์งธ ๋ฌธ์ œ๋Š” DCNN์˜ ๋ถˆ๋ณ€์„ฑ์— ๋”ฐ๋ฅธ class์— ๋Œ€ํ•œ ์ข‹์€ ์„ฑ๋Šฅ๊ณผ ์œ„์น˜ ์˜ˆ์ธก์˜ ๋ถ€์กฑ๊ณผ ๊ด€๋ จ์žˆ์Šต๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ ๋ฌธ์ œ๋ฅผ ํ•ด๊ฒฐํ•˜๊ธฐ ์œ„ํ•ด ์‚ฌ์šฉํ•˜๋Š” ๋ฐฉ์‹์œผ๋กœ skip connection์ด ์กด์žฌํ•ฉ๋‹ˆ๋‹ค. ์šฐ๋ฆฌ๋Š” ์ž์„ธํ•œ ๋ถ€๋ถ„์— ๋Œ€ํ•œ ์„ฑ๋Šฅ์„ ๋†’์—ฌ์ฃผ๊ธฐ ์œ„ํ•œ fully-connected Conditional Random Field (CRF)๋ฅผ ์‚ฌ์šฉํ•ฉ๋‹ˆ๋‹ค. CRF๋Š” semantic segmentation์—์„œ multi-way classifier๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ class score๋ฅผ ๊ฒฐํ•ฉํ•˜๊ธฐ ์œ„ํ•ด ๊ด‘๋ฒ”์œ„ํ•˜๊ฒŒ ์‚ฌ์šฉ๋˜์–ด์ง‘๋‹ˆ๋‹ค. CRF๋Š” ๋ฏธ์„ธํ•œ ๋ถ€๋ถ„์„ ์ฒ˜๋ฆฌํ•˜๊ธฐ ์œ„ํ•ด ์‚ฌ์šฉ๋˜์–ด์ง€๋ฉฐ ํšจ์œจ์ ์ธ ์—ฐ์‚ฐ๊ณผ ๋ชจ์„œ๋ฆฌ ๋ถ€๋ถ„์„ ์ž˜ ํฌ์ฐฉํ•ด๋ƒ…๋‹ˆ๋‹ค. ๋˜ํ•œ, ๋„“์€ ๋ฒ”์œ„์˜ ์ข…์†์„ฑ์„ ํฌ์ฐฉํ•ฉ๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ CRF๋Š” ์„ฑ๋Šฅ ํ–ฅ์ƒ์— ํฐ ๋„์›€์ด ๋˜์—ˆ์Šต๋‹ˆ๋‹ค.
  • A high-level illustration of the proposed DeepLab v2 model
    ๋จผ์ € ์šฐ๋ฆฌ๋Š” pretrained ๋œ VGG-16 or ResNet-101์„ ์‚ฌ์šฉํ•ฉ๋‹ˆ๋‹ค. ๊ทธ๋ฆฌ๊ณ  fc-layer๋ถ€๋ถ„์„ cv-layer๋กœ ์ „ํ™˜ํ•ฉ๋‹ˆ๋‹ค. atrous cv-layer๋ฅผ ํ†ตํ•ด์„œ ํ•ด์ƒ๋„๋ฅผ ์ฆ๊ฐ€์‹œํ‚ต๋‹ˆ๋‹ค. ์ด๋Š” ์›๋ž˜ ์ด๋ฏธ์ง€์˜ 8ํ”ฝ์…€๋งˆ๋‹ค๊ฐ€ ์•„๋‹Œ 32ํ”ฝ์…€๋งˆ๋‹ค ๋ฐ˜์‘์ด ์ด๋ฃจ์–ด์ง€๋„๋ก ํ•ฉ๋‹ˆ๋‹ค. ๊ทธ๋ฆฌ๊ณ  ๋ณด๊ฐ„ ๊ธฐ๋ฒ•์„ ์—…์ƒ˜ํ”Œ๋ง์„ ์œ„ํ•ด ์ง„ํ–‰ํ•ฉ๋‹ˆ๋‹ค. ๊ทธ ํ›„, CRF์— ์ธํ’‹์œผ๋กœ ์ง‘์–ด๋„ฃ์Šต๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ ์šฐ๋ฆฌ์˜ DeepLab์˜ ์žฅ์ ์€ ํฌ๊ฒŒ ์„ธ๊ฐ€์ง€์ž…๋‹ˆ๋‹ค.

    1. Speed
      atrous-conv์— ์˜ํ•ด ์šฐ๋ฆฌ์˜ DCNN์€ 8FPS๋ฅผ ๋‚˜ํƒ€๋ƒ…๋‹ˆ๋‹ค.

    2. Accuracy
      ์šฐ๋ฆฌ๋Š” ์—ฌ๋Ÿฌ ๋Œ€ํšŒ์—์„œ Sota๋ฅผ ๋‹ฌ์„ฑํ•ฉ๋‹ˆ๋‹ค.

    3. Simplicity
      ์šฐ๋ฆฌ์˜ ๋ชจ๋ธ์€ ๋‘๊ฐœ์˜ ๋ชจ๋“ˆ DCNN๊ณผ CRF์˜ ๊ณ„๋‹จ์‹์œผ๋กœ ๊ตฌ์„ฑ๋˜์–ด์žˆ์Šต๋‹ˆ๋‹ค.

semantic segmentation์€ ์ด์ „์˜ ์ง์ ‘ ํ”ผ์ณ๋ฅผ ๋งŒ๋“œ๋Š” ๋ฐฉ์‹์œผ๋กœ๋ถ€ํ„ฐ ๋ฐœ์ „ํ•ด์™”์Šต๋‹ˆ๋‹ค. ํ•˜์ง€๋งŒ ์ด๋Ÿฌํ•œ ๋ฐฉ์‹์€ ํ”ผ์ณ์˜ ํ‘œํ˜„ ๋ถ€์กฑ์œผ๋กœ ์ธํ•ด ํ•œ๊ณ„์— ๋ถ€๋”ชํ˜”๊ณ , ์ง€๋‚œ ๋ช‡๋…„๊ฐ„ ๋”ฅ๋Ÿฌ๋‹์€ classification๊ณผ segmentation์˜ ๊ฒฐํ•ฉ์ธ semantic segmentation์„ ๋ฐœ์ „์‹œ์ผœ์™”์Šต๋‹ˆ๋‹ค.

์ฒซ ๋ฒˆ์งธ ๋ฐœ์ „ ๋ฐฉ์‹์€ ๋ฐ”ํ…€์—… ๋ฐฉ์‹์ž…๋‹ˆ๋‹ค. ์ด ๋ฐฉ์‹์€ ๊ฐ์ฒด ๋‚ด ์—ฌ๋Ÿฌ๊ฐœ์˜ segmentation์„ ๋‘” ํ›„, ํ•ฉ์ณ๋‚˜๊ฐ€๋Š” ๋ฐฉ์‹์ด๋‹ค. ์ด๋Ÿฌํ•œ ๋ฐฉ์‹์€ ์ •๋ฐ€ํ•œ ๋ฐ”์šด๋”๋ฆฌ๋ฅผ ์˜ˆ์ธกํ•˜์ง€๋งŒ, ์˜ค๋ฅ˜๊ฐ€ ์ƒ๊ธธ ๊ฒฝ์šฐ ๋งŽ์€ ์˜ค์ฐจ๊ฐ€ ๋ฐœ์ƒํ•œ๋‹ค.

๋‘ ๋ฒˆ์งธ ๋ฐฉ์‹์€ ๋ผ๋ฒจ๋ง์„ ์œ„ํ•œ conv๋ฅผ ํ†ตํ•ด ๋‚˜์˜จ ํ”ผ์ณ์™€ ๋…๋ฆฝ์ ์œผ๋กœ ์–ป์€ segmentation ์ •๋ณด๋ฅผ ๊ฒฐํ•ฉํ•˜๋Š” ๋ฐฉ์‹์ž…๋‹ˆ๋‹ค.

์„ธ ๋ฒˆ์งธ ๋ฐฉ์‹์€ DCNN์„ ์ง์ ‘์ ์œผ๋กœ category-level pixel label์— ์ด์šฉํ•˜๋Š” ๊ฒƒ์ž…๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ ๋ฐฉ์‹์˜ ์ ‘๊ทผ์€ DCNN์˜ ๋งˆ์ง€๋ง‰ fc-layer๋ฅผ conv-layer๋กœ ๋ณ€๊ฒฝํ•ฉ๋‹ˆ๋‹ค. cnn์„ ์ด์šฉํ•˜์—ฌ ๊ณต๊ฐ„์˜ ์ •๋ณด๊ฐ€ ๋ณ€๊ฒฝ๋˜๋Š” ๊ฒƒ์€ ์—…์ƒ˜ํ”Œ๋ง๊ณผ skip-connection๋ฐฉ์‹์œผ๋กœ ๋ฐฉ์ง€ํ•ฉ๋‹ˆ๋‹ค. ์ด ๋…ผ๋ฌธ์—์„œ ์ œ์‹œํ•˜๋Š” ๋ฐฉ์‹์€ ์—ฌ๊ธฐ์— ์†ํ•˜๋ฉฐ ์šฐ๋ฆฌ๋Š” ์—ฌ๊ธฐ๋‹ค ํ•ด์ƒ๋„ ์กฐ์ ˆ, multi scale pooling, CRF๋“ฑ์„ ์ถ”๊ฐ€ํ•˜์—ฌ ์ง„ํ–‰ํ•ฉ๋‹ˆ๋‹ค. ์šฐ๋ฆฌ๋Š” ์ด๋Ÿฌํ•œ ๋ฐฉ์‹์ด ๋” ์ข‹์€ ๊ฒฐ๊ณผ๋ฅผ ์ด๋Œ๊ฑฐ๋ผ ํŒ๋‹จํ•ฉ๋‹ˆ๋‹ค. ๋˜ํ•œ CRF๋Š” ์ด์ „์—๋„ ์‚ฌ์šฉ๋˜์–ด์กŒ๋Š”๋ฐ ์ด๋•Œ๋Š” ๊ณ„์‚ฐ ์—๋Ÿฌ์™€ ์žฅ๊ธฐ ์ข…์†์„ฑ์„ ๋ฌด์‹œํ•˜์—ฌ ํ•œ๊ณ„๊ฐ€ ์กด์žฌํ–ˆ์Šต๋‹ˆ๋‹ค. ์šฐ๋ฆฌ์˜ ๋ฐฉ์‹์€ ๋ชจ๋“  ํ”ฝ์…€์„ CRF node๋กœ ์ƒ๊ฐํ•˜์—ฌ ์ง„ํ–‰ํ•ฉ๋‹ˆ๋‹ค.

๊ทธ๋ฆฌ๊ณ  Gaussian CRF๋Š” ์žฅ๊ธฐ ์˜์กด์„ฑ์„ ํฌ์ฐฉํ•˜๋ฉฐ ๋™์‹œ์— ํ•„๋“œ์— ๋Œ€ํ•œ ํ‰๊ท ์„ ๋น ๋ฅด๊ฒŒ ์žก์„ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค. ํ•„๋“œ์— ๋Œ€ํ•œ ํ‰๊ท ์€ ์ด์ „์—๋„ ๋งŽ์ด ๋ฐœ์ „๋˜์—ˆ์ง€๋งŒ ๋‹จ๊ธฐ ์—ฐ๊ฒฐ์˜ ์ œํ•œ์ด ์กด์žฌํ–ˆ์Šต๋‹ˆ๋‹ค.

์šฐ๋ฆฌ๊ฐ€ ์ œ์‹œํ•œ ์ฒซ ๋ฒˆ์งธ ๋ฒ„์ „์€ ๊ณต๊ฐœ๋˜์–ด semantic segmentation์—์„œ์˜ ๋งŽ์€ ๋ฐœ์ „์„ ๊ฑฐ๋‘์—ˆ์Šต๋‹ˆ๋‹ค. ๋Œ€๋ถ€๋ถ„์˜ ์ข‹์€ ์„ฑ๋Šฅ์„ ๋‚ด๋Š” ๋ชจ๋ธ๋“ค์€ Atrous convolution์„ ์ฑ„ํƒํ•˜๊ฑฐ๋‚˜ fully connected CRF๋ฅผ ์ฑ„ํƒํ•˜์˜€์Šต๋‹ˆ๋‹ค.

METHODS

Atrous Convolution for Dense Feature Extraction and Field-of-View Enlargement

semantic segmentation์—์„œ DCNN์ด ๋งŽ์ด ์‚ฌ์šฉ๋˜์–ด์ง€๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค. ๊ทธ๋Ÿฌ๋‚˜ ์ด๋Š” ํ•ด์ƒ๋„๋ฅผ ๋–จ์–ด๋œจ๋ฆฌ๊ฒŒ ๋˜๋ฉฐ ํ•ด๊ฒฐ์ฑ…์œผ๋กœ deconvolution์„ ์‚ฌ์šฉํ•˜์ง€๋งŒ ์ด๋Š” ๋งŽ์€ ๋ฉ”๋ชจ๋ฆฌ์™€ ์‹œ๊ฐ„์„ ์‚ฌ์šฉํ•ฉ๋‹ˆ๋‹ค. ์šฐ๋ฆฌ๋Š” ๋Œ€์‹ ์— atrous convolution์„ ์‚ฌ์šฉํ•  ๊ฒƒ์„ ๊ถŒ๊ณ ํ•ฉ๋‹ˆ๋‹ค. ์ด ์•Œ๊ณ ๋ฆฌ์ฆ˜์€ ํ•ด์ƒ๋„๋ฅผ ์›ํ•˜๋Š”๋Œ€๋กœ ์„ค์ •ํ•˜๊ฒŒ ํ•ด์ค๋‹ˆ๋‹ค.

331

Atrous convolution์˜ ์ˆ˜์‹ : $y[i] = \Sigma_k x[i + r ยท k]w[k]$

r์€ stride(samping rate), k๋Š” kernel, x๋Š” input, y๋Š” output์„ ์˜๋ฏธํ•ฉ๋‹ˆ๋‹ค.

356

์œ„์— ์‚ฌ์ง„์„ ์„ค๋ช…ํ•˜์ž๋ฉด ์œ„์— ํŒŒ๋ž€์ƒ‰ ๋ฐฉํ–ฅ์€ ๋จผ์ € factor of 2๋กœ 2๋ถ„์˜ 1๋กœ ์ค„์ด๋Š” ๋‹ค์šด์ƒ˜ํ”Œ๋ง์„ ์šฐ์„  ์ง„ํ–‰ํ•ฉ๋‹ˆ๋‹ค. ๊ทธ๋ฆฌ๊ณ  convolution์„ ์ง„ํ–‰ํ•ฉ๋‹ˆ๋‹ค. ๊ทธ ํ›„ ์—…์ƒ˜ํ”Œ๋ง์„ ์ง„ํ–‰ํ•˜๊ณ  ํ”ผ์ณ๋งต์„ ์›๋ณธ ์ด๋ฏธ์ง€์— ์ด์‹ํ•˜๋ฉด ์ด๋ฏธ์ง€ ์œ„์น˜์˜ 4๋ถ„์˜ 1์ •๋„์— ํ•ด๋‹นํ•˜๋Š” ์ •๋ณด๋ฅผ ํš๋“ํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค. ๋Œ€์‹  ์šฐ๋ฆฌ์˜ atrous conv๋ฅผ ์‚ฌ์šฉํ•  ๊ฒฝ์šฐ ๋ชจ๋“  ํฌ์ง€์…˜์— ๋Œ€ํ•œ ์ •๋ณด๋ฅผ ์–ป์„ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค. ๋Œ€์‹  ํ•„ํ„ฐ ์‚ฌ์ด์ฆˆ์˜ ํฌ๊ธฐ๊ฐ€ ์ฆ๊ฐ€ํ• ์ง€๋ผ๋„, hole์˜ ๊ฐ’์ด ์กด์žฌํ•˜๊ธฐ ๋•Œ๋ฌธ์— ์—ฐ์‚ฐ๋Ÿ‰์€ ์œ ์ง€๋ฉ๋‹ˆ๋‹ค. ์ด์ฒ˜๋Ÿผ ์ž‘์€ ์—ฐ์‚ฐ๋Ÿ‰์„ ํ†ตํ•ด ๋„“์€ receptive filed๋ฅผ ์ปค๋ฒ„ํ•˜๋ฉฐ, pooling์ด ์กด์žฌํ•˜์ง€ ์•Š์•„ ์ตœ๋Œ€ํ•œ ์›๋ณธ ์ด๋ฏธ์ง€์˜ ํ•ด์ƒ๋„๋ฅผ ์œ ์ง€ํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

DCNN์˜ ๋„คํŠธ์›Œํฌ๋ฅผ ์šฐ๋ฆฌ์˜ ๋ฐฉ์‹์œผ๋กœ ๋ณ€ํ™˜ํ•˜๊ธฐ ์œ„ํ•ด์„œ ํ•ด์ƒ๋„๋ฅผ ๊ฐ์†Œ์‹œํ‚ค๋Š” ๋ ๋ถ€๋ถ„์˜ pooling๊ณผ conv layer๋ฅผ ๋ณ€๊ฒฝ์‹œํ‚ต๋‹ˆ๋‹ค. pooling์€ stride1, conv layer๋Š” atrous conv๋กœ ๋ณ€๊ฒฝํ•ฉ๋‹ˆ๋‹ค. ๋ชจ๋“  layer์— ๋Œ€ํ•ด ๋ณ€๊ฒฝํ•˜๊ณ  ์‹ถ์ง€๋งŒ, ํ•ด์ƒ๋„๊ฐ€ ์•„์˜ˆ ์œ ์ง€๋˜๋Š” ๊ฒƒ์€ ๋น„์šฉ์ด ๋„ˆ๋ฌด ์ปค์ง€๊ธฐ ๋•Œ๋ฌธ์— ์ ์ ˆํ•œ hybrid๋ฐฉ์‹์„ ์„ ํƒํ•ฉ๋‹ˆ๋‹ค. ๊ทธ๋ž˜์„œ ์šฐ๋ฆฌ๋Š” ๊ธฐ์กด DCNN์ด ํ•ด์ƒ๋„๊ฐ€ 32๋ถ„์˜ 1๋กœ ์ค„์–ด๋“œ๋Š” ๊ฒƒ์— ๋น„ํ•ด atrous conv๋ฅผ ํ†ตํ•ด ๊ธฐ์กด๋ณด๋‹ค ํ•ด์ƒ๋„๋ฅผ 4๋ฐฐ ์ฆ๊ฐ€์‹œํ‚ต๋‹ˆ๋‹ค. ๊ทธ๋ฆฌ๊ณ  ์ดํ›„ blinear interpolation์„ ํ†ตํ•ด 8๋ฐฐ๋ฅผ ์ฆ๊ฐ€์‹œ์ผœ ์›๋ณธ ์ด๋ฏธ์ง€์™€ ๋™์ผํ•˜๊ฒŒ ๋งŒ๋“ญ๋‹ˆ๋‹ค. ์—ฌ๊ธฐ์„œ ๊ธฐ์กด์˜ DCNN์—์„œ ์—ฐ์‚ฐ๋Ÿ‰์ด ๋งŽ์ด ๋“œ๋Š” deconv๋Œ€์‹  blinear๋ฅผ ์“ฐ์ง€ ์•Š๋Š” ์ด์œ ๋Š” blinear๋Š” ๋„ˆ๋ฌด ์ž‘์•„์ง„ ์ •๋ณด๋กœ๋ถ€ํ„ฐ ๋ณต๊ตฌํ•˜๋Š”๋ฐ ํ•œ๊ณ„๊ฐ€ ์žˆ๊ธฐ ๋•Œ๋ฌธ! ์ด๋Ÿฌํ•œ ๋ฐฉ์‹์„ ํ†ตํ•ด ์„ฑ๋Šฅ ์ฆ๊ฐ€ ๋ฐ ์—ฐ์‚ฐ๋Ÿ‰ ๊ฐ์†Œ๋ฅผ ์–ป์„ ์ˆ˜ ์žˆ๋‹ค.

๋˜ํ•œ atrous convolution์€ ๋„“์€ ๋ฒ”์œ„์˜ ํ•„ํ„ฐ๋ฅผ ํ†ตํ•ด ํฐ ๋ฌผ์ฒด๋ฅผ ํŒ๋‹จํ•ด๋‚ผ ์ˆ˜ ์žˆ๋‹ค. ์ผ๋ฐ˜์ ์ธ DCNN์—์„œ conv์˜ ํ•„ํ„ฐ๋Š” 3์ธ๋ฐ 3์„ ํ†ตํ•ด ํฐ ๋ฌผ์ฒด๋ฅผ ํŒ๋‹จํ•˜๊ธฐ ์œ„ํ•ด์„œ๋Š” ๋ ˆ์ด์–ด๊ฐ€ ๊นŠ์–ด์ ธ์•ผํ•œ๋‹ค. ํ•˜์ง€๋งŒ atrous convolution์€ rate๊ฐ€ 2๋งŒ ๋˜์–ด๋„ ํ•„ํ„ฐ๊ฐ€ 3์ผ ๋•Œ 7*7์˜ ๋ฌผ์ฒด๋ฅผ ํ™•์ธํ•  ์ˆ˜ ์žˆ๋‹ค.

max pooling X & atrous convolution

max pooling O & convolution

์ด๋ผ๊ณ  ์ƒ๊ฐ์ด ๋“ ๋‹ค.

Atrous convolution layer๋ฅผ ์ ์šฉํ•˜๋Š” ๊ฒƒ์€ ๋‘ ๊ฐ€์ง€ ๋ฐฉ๋ฒ•์ด ์žˆ๋Š”๋ฐ,

  1. filter์—๋‹ค๊ฐ€ ๊ตฌ๋ฉ์„ ๋šซ์–ด ๋†“๊ธฐ
  2. feature map์„ ๊ตฌ์—ญ๋ณ„๋กœ sampling์„ ์ง„ํ–‰ํ•œ ๋‹ค์Œ ๊ฐ ๋ถ€๋ถ„์— ๋Œ€ํ•ด conv๋ฅผ ์ˆ˜ํ–‰ํ•œ๋‹ค.

Multiscale Image Representations using Atrous Spatial Pyramid Pooling

368

์ด๋ฏธ์ง€์—๋Š” ํฐ ๋ฌผ์ฒด๋„ ์žˆ๊ณ  ์ž‘์€ ๋ฌผ์ฒด๋„ ์กด์žฌํ•œ๋‹ค. ์ด๋ฅผ ์œ„ํ•ด ์šฐ๋ฆฌ๋Š” ๋‘๊ฐ€์ง€ ๋ฐฉ์‹์„ ์‚ฌ์šฉํ•˜์˜€๋‹ค. ์ฒซ ๋ฒˆ์งธ๋กœ multiscale processing์„ ์ง„ํ–‰ํ•œ๋‹ค. ๊ทธ ๋‹ค์Œ ๊ฐ๊ธฐ ๋‹ค๋ฅธ ํฌ๊ธฐ์˜ featuremap์„ ๋ณด๊ฐ„์„ ํ†ตํ•ด ํฌ๊ธฐ๋ฅผ ๋งž์ถ˜ ํ›„ ์ด๋ฅผ ๋‹ค ๋” ํ˜ผํ•ฉํ•˜์—ฌ ์ตœ์ข… ๊ฒฐ๊ณผ๋ฌผ์„ ๋‚ธ๋‹ค. ์ด๋•Œ ์„ฑ๋Šฅ์ด ์ข‹์ง€๋งŒ ๋งŽ์€ ์—ฐ์‚ฐ๋Ÿ‰์„ ์š”๊ตฌํ•œ๋‹ค.

๋‘ ๋ฒˆ์งธ๋Š” ์šฐ๋ฆฌ๊ฐ€ ์ œ์•ˆํ•˜๋Š” ASPP๋ฐฉ์‹์ด๋ฉฐ, V1๊ณผ ๋‹ค๋ฅธ ์ ์ด๋‹ค. ASPP๋Š” rate๋ฅผ ๋‹ค์–‘ํ•˜๊ฒŒ ์‚ฌ์šฉํ•˜์—ฌ ์—ฌ๋Ÿฌ ๊ทœ๋ชจ์˜ ํŠน์ง•์„ ํ‘œํ˜„ํ•˜๋ฉฐ ์ด๋ฅผ ๋”ํ•ด ๊ฒฐ๊ณผ๋ฌผ์„ ๋งŒ๋“ค์–ด๋‚ธ๋‹ค.

396

### **Structured Prediction with Fully-Connected Conditional Random Fields for Accurate Boundary Recovery**

DCNN์—์„œ depth์™€ pooling์€ ๋งŽ์€ ์„ฑ๊ณต์„ ๊ฑฐ๋‘์—ˆ๋‹ค. ํŠนํžˆ ๋ถ„๋ฅ˜ ๋ฌธ์ œ์—์„œ๋Š” ๊ฐ์ฒด์˜ ์œ ๋ฌด ์ฆ‰ ๊ฐ์ฒด์˜ ํฐ ํŠน์ง•์„ ํŒŒ์•…ํ•˜๋Š”๊ฒŒ ์ค‘์š”ํ•˜์˜€๊ธฐ ๋•Œ๋ฌธ์ด๋‹ค. ํ•˜์ง€๋งŒ ์ด์— ๋”ฐ๋ผ ๋””ํ…Œ์ผํ•œ ์˜ˆ์ธก์€ ํž˜๋“ค์–ด์ง€๊ฒŒ ๋˜๊ณ  invarianceํ•œ ๊ฒฐ๊ณผ๋ฅผ ๋ณด์ธ๋‹ค.

์šฐ๋ฆฌ๋Š” ์ด์—๋”ฐ๋ผ semantic segmentation์—์„œ boundary๋ถ€๋ถ„์„ ๋””ํ…Œ์ผํ•˜๊ฒŒ ์žก์•„๋‚ด๊ธฐ ์œ„ํ•˜์—ฌ CRF๋ฐฉ์‹์„ ์ด์šฉํ•œ๋‹ค.

376

CRF๋Š” noise๋ฅผ ์Šค๋ฌด์Šคํ•˜๊ฒŒ ๋งŒ๋“ค์–ด์ฃผ๋ฉฐ ๋น„์Šทํ•œ ๋ผ๋ฒจ๊ฐ’๋ผ๋ฆฌ ๊ฐ’์„ ์œ ์‚ฌํ•˜๊ฒŒ ๋งŒ๋“ค์–ด์ฃผ๋ฉฐ ๊ฒฝ๊ณ„์„ ์„ ๋งŒ๋“ค์–ด์ฃผ๋Š” ๋ฐฉ์‹์ด๋‹ค. ์ˆ˜์‹์€ ๋‹ค์Œ๊ณผ ๊ฐ™๋‹ค.
E(x)=ฮฃiฮธi(xi)+ฮฃijฮธij(xi,xj)E(x) = \Sigma _i ฮธ_i(x_i) +\Sigma ij ฮธij (x_i , x_j )

ฮธi(xi) = โˆ’ log P(xi)์—์„œ P(xi)๋Š” ๋ผ๋ฒจ ํ• ๋‹น ํ™•๋ฅ ์„ ๋‚˜ํƒ€๋‚ด๋ฉฐ

407

์˜ค๋ฅธ์ชฝ์˜ ํ•ญ์€ ์œ„์™€ ๊ฐ™๋‹ค. $ยต(x_i , x_j ) = 1 $if$x_i =/= x_j$ ์ด๋ฉฐ ์ด๋Š” ๊ฐ™์€ ๋ถ€๋ถ„์˜ ํ”ฝ์…€์ด ์˜ฌ ๊ฒฝ์šฐ ๊ฑด๋„ˆ ๋›ฐ๋Š” ๊ฒƒ์ด๋‹ค. ฮธij (x_i, x_j )์—์„œ ์™ผ์ชฝํ•ญ์˜ ๊ฒฝ์šฐ ํ”ฝ์…€์˜ ์œ„์น˜์™€ RGB์— ํ•ด๋‹นํ•˜๋Š” ์ฐจ์ด๊ฐ’์— ๋Œ€ํ•œ ํŒจ๋„ํ‹ฐ์ด๋ฉฐ ์œ ์‚ฌํ•œ ์ƒ‰๊น”๊ณผ ์œ„์น˜๋ฅผ ๊ฐ€์ง„ ํ”ฝ์…€์ด ๋น„์Šทํ•œ ๋ผ๋ฒจ์„ ๊ฐ™๋„๋ก ํ•œ๋‹ค. ์˜ค๋ฅธ์ชฝ ํ•ญ์€ ์œ„์น˜ ์ •๋ณด ์ฐจ์ด์— ๋”ฐ๋ฅธ ํŒจ๋„ํ‹ฐ ๊ฐ’์ด๋ฉฐ ์œ ์‚ฌํ•œ ์œ„์น˜๋ฅผ ๊ฐ€์ง„ ํ”ฝ์…€์ด ๋น„์Šทํ•œ ๋ผ๋ฒจ์„ ๊ฐ–๋„๋ก ํ•œ๋‹ค. ์ด๋ฅผ ํ†ตํ•ด ํ•™์Šต์„ ํ• ์ˆ˜๋ก ํ”ผ์ณ๋งต์˜ ๋…ธ์ด์ฆˆ๊ฐ€ ์ œ๊ฑฐ ๋˜๋ฉฐ detatiedํ•œ ์ •๋ณด๋ฅผ ํ‘œํ˜„ํ•  ์ˆ˜ ์žˆ๊ฒŒ ๋œ๋‹ค.

EXPERIMENTIAL RESULTS

์šฐ๋ฆฌ์˜ ๋ชจ๋ธ์€ ์ด๋ฏธ์ง€ ๋„ท์œผ๋กœ ํ•™์Šตํ•œ VGG-16๊ณผ RESNET-101์„ ์‚ฌ์šฉํ•˜์˜€๋‹ค. ๊ทธ๋ฆฌ๊ณ  ๊ธฐ๋ณธ์ ์ธ ๋กœ์Šค๋Š” ํ”ฝ์…€๋งˆ๋‹ค์˜ cross-entropy๋ฅผ ์‚ฌ์šฉํ•˜๋ฉฐ ๋ชจ๋“  ํฌ์ง€์…˜๊ณผ ๋ผ๋ฒจ์€ ๋™๋“ฑํ•œ ๊ฐ€์ค‘์น˜๊ฐ’์„ ๊ฐ€์ง„๋‹ค. (๋ฐฐ๊ฒฝ์„ ์ œ์™ธํ•œ) ๋˜ํ•œ ํ•™์Šต์€ DCNN๊ณผ CRF๋ฅผ ๋”ฐ๋กœ ๊ตฌ๋ถ„ํ•˜์—ฌ ์ง„ํ–‰ํ•œ๋‹ค.

์šฐ๋ฆฌ๋Š” PASCAL VOC 2012, PASCAL-Context, PASCALPerson-Part, and Cityscapes ๋ฐ์ดํ„ฐ์…‹์— ๋Œ€ํ•ด ์‹คํ—˜์„ ์ง„ํ–‰ํ•˜์˜€๋‹ค.

403

fc6 layer์—์„œ atrous conv์˜ rate์™€ kernel์„ ๋ฐ”๊ฟ”๊ฐ€๋ฉฐ ์‹คํ–‰ํ•œ ๊ฒฐ๊ณผ์ด๋‹ค. kernel์€ 3์ด๊ณ  r=12์ผ ๋•Œ ๊ฐ€์žฅ ์ข‹์€ ์„ฑ๋Šฅ์„ ๋ณด์ธ๋‹ค.

408

๋ฐฐ์น˜์™€ ํ•™์Šต๋Ÿ‰์„ ๋ฐ”๊ฟ”๊ฐ€๋ฉฐ ์‹คํ—˜ํ•œ ๊ฒฐ๊ณผ poly ๋ฐฉ์‹์˜ step์€ ์•„๋ž˜์™€ ๊ฐ™๋‹ค.

231

282

Sota๋ฅผ ๋‹ฌ์„ฑ!

385

ํ•œ๊ณ„์ 

432

PASCAL VOC 2-12 val set์—์„œ ์˜ˆ์ธก์„ ์ž˜ ๋ชปํ•˜๋Š” ๊ฒฝ์šฐ๊ฐ€ ์žˆ์—ˆ๋‹ค. CRF ์ดํ›„ ๋””ํ…Œ์ผํ•œ ๋ถ€๋ถ„์„ ์ž˜ ์‚ด๋ ค๋‚ด์ง€ ๋ชปํ•˜์˜€๋‹ค. ์šฐ๋ฆฌ๋Š” encoder-decoer๊ตฌ์กฐ๋ฅผ ์‚ฌ์šฉํ•œ๋‹ค๋ฉด ์ด๋Ÿฌํ•œ ๋ฌธ์ œ๋ฅผ ์™„ํ™”์‹œํ‚ฌ ์ˆ˜ ์žˆ์„๊ฑฐ๋ผ ์ƒ๊ฐํ•ฉ๋‹ˆ๋‹ค.

CONCLUSION

์šฐ๋ฆฌ๊ฐ€ ์ œ์‹œํ•œ โ€œDeepLabโ€์‹œ์Šคํ…œ์€ Atrous convolution์„ ์ด์šฉํ•˜์—ฌ ๋„คํŠธ์›Œํฌ๋ฅผ ์žฌ๊ตฌ์ถ•ํ•ด๋ƒˆ์Šต๋‹ˆ๋‹ค. ๋˜ํ•œ CRF๋ฅผ ์ ์šฉํ•˜์—ฌ boundary์— ๋Œ€ํ•ด ๋”์šฑ ์ž์„ธํžˆ ์˜ˆ์ธกํ•œ ๊ฒฐ๊ณผ๋ฅผ ๋‚ด๋ณด์ž…๋‹ˆ๋‹ค.


๐Ÿ”— ๊ด€๋ จ ๊ธ€

0๊ฐœ์˜ ๋Œ“๊ธ€