[Paper Review] DCN

msgoยท2026๋…„ 5์›” 25์ผ

๐Ÿ“Œ ๋ณธ ๊ธ€์€ 2023.03 ์— ์ž‘์„ฑํ•œ paper review๋ฅผ ๋‹ค๋“ฌ์–ด ๋ฐœํ–‰ํ•œ ์•„์นด์ด๋ธŒ ๊ธ€์ž…๋‹ˆ๋‹ค.
์ž‘์„ฑ ๋‹น์‹œ ์ปจํ…์ŠคํŠธ: X:AI 4๊ธฐ Basic
์›๋ณธ ๋…ผ๋ฌธ: https://arxiv.org/abs/1703.06211

Abstract

CNN์€ ๊ณ ์ •๋œ ๋ชจ๋“ˆ์˜ ๊ตฌ์กฐ๋กœ ์ธํ•˜์—ฌ ๊ธฐํ•˜ํ•˜์  ๋ชจ์–‘์— ์ œํ•œ์ด ์žˆ์Šต๋‹ˆ๋‹ค. ์ด ๋…ผ๋ฌธ์—์„œ ์šฐ๋ฆฌ๋Š” CNN์˜ ๋ชจ๋ธ ์ˆ˜์šฉ์„ฑ์„ ํ™•์žฅ์‹œ์ผœ์ค„ ๋‘๊ฐœ์˜ ์ƒˆ๋กœ์šด ๋ชจ๋ธ์ธ deformable convolution๊ณผ deformable ROI pooling์„ ์ œ์•ˆํ•ฉ๋‹ˆ๋‹ค. ๋‘˜ ๋‹ค offset์„ ์ด์šฉํ•˜์—ฌ ์œ„์น˜ ์ƒ˜ํ”Œ๋ง์„ ๋ณด๊ฐ•ํ•˜๋Š” ๊ธฐ๋ฒ•์„ ๋ฒ ์ด์Šค๋กœ ํ•ฉ๋‹ˆ๋‹ค. ์ƒˆ๋กœ์šด ๋ชจ๋“ˆ์€ ์‰ฝ๊ฒŒ ์กด์žฌํ•˜๋Š” CNN์„ ๋Œ€์ฒดํ•  ์ˆ˜ ์žˆ์œผ๋ฉฐ ์‰ฝ๊ฒŒ end-to-end๋กœ ํ•™์Šต์ด ๊ฐ€๋Šฅํ•ฉ๋‹ˆ๋‹ค. ๋งŽ์€ ์‹คํ—˜์€ ์šฐ๋ฆฌ์˜ ์ ‘๊ทผ์˜ ์„ฑ๋Šฅ์„ ๊ฒ€์ฆํ•ฉ๋‹ˆ๋‹ค. ์ฒ˜์Œ์œผ๋กœ ์šฐ๋ฆฌ๋Š” ๊ณต๊ฐ„ ๋ณ€ํ˜•์„ CNN์—์„œ ํ•™์Šตํ•˜๋Š” ๊ฒƒ์ด object detection๊ณผ semantic segmentation์—์„œ ํšจ๊ณผ์ ์ธ ๊ฒƒ์„ ๋ณด์—ฌ์ค๋‹ˆ๋‹ค.

Introduction

์‹œ๊ฐ์ธ์‹์—์„œ ์ค‘์š”ํ•œ ๋ฌธ์ œ๋Š” ์–ด๋–ป๊ฒŒ ๊ธฐํ•˜ํ•™์  ๋‹ค์–‘์„ฑ๊ณผ ๋ชจ๋ธ์˜ ํฌ๊ธฐ, ํฌ์ฆˆ, ๊ด€์  ๊ทธ๋ฆฌ๊ณ  ์ผ๋ถ€๋ถ„์„ ์ˆ˜์šฉํ•˜๋Š”๊ฐ€ ์ž…๋‹ˆ๋‹ค. ๋Œ€๊ฒŒ ๋‘๊ฐœ์˜ ๋ฐฉ๋ฒ•์ด ์žˆ์Šต๋‹ˆ๋‹ค. ์ฒซ๋ฒˆ์งธ๋Š” ์ถฉ๋ถ„ํžˆ ๋‹ค์–‘ํ•œ ํ•™์Šต ๋ฐ์ดํ„ฐ์…‹ ์ค€๋น„์ž…๋‹ˆ๋‹ค. ์ด๋Š” ์กด์žฌํ•˜๋Š” ๋ฐ์ดํ„ฐ๋ฅผ ๋‹ค์–‘ํ•œ ๋ฐ์ดํ„ฐ ์ฆ๊ฐ• ๊ธฐ๋ฒ•์„ ํ†ตํ•ด ํ•ด๊ฒฐํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค. ๋ฐ์ดํ„ฐ๋ฅผ ํ†ตํ•ด ์ž˜ ํ•™์Šตํ•  ์ˆ˜ ์žˆ์ง€๋งŒ ์ด๋Š” ๋งŽ์€ ํ•™์Šต๊ณผ ๋ณต์žกํ•œ ๋ชจ๋ธ์„ ํ•„์š”๋กœ ํ•ฉ๋‹ˆ๋‹ค.

๋‘๋ฒˆ์งธ ๋ฐฉ์‹์€ transformation-invariant ํ”ผ์ณ์™€ ์•Œ๊ณ ๋ฆฌ์ฆ˜์„ ์‚ฌ์šฉํ•˜๋Š” ๊ฒƒ์ด ์žˆ์Šต๋‹ˆ๋‹ค. ๋Œ€ํ‘œ์ ์œผ๋กœ SIFT, sliding window๊ฐ€ ์žˆ์Šต๋‹ˆ๋‹ค. ์—ฌ๊ธฐ์—๋Š” ๋‘๊ฐ€์ง€ ๋ฌธ์ œ๊ฐ€ ์žˆ๋Š”๋ฐ, ๊ธฐํ•˜ํ•˜์  ๋ชจํ˜•์ด ์•Œ๋ ค์ง€๊ฑฐ๋‚˜ ๊ณ ์ •๋˜์–ด์•ผํ•ฉ๋‹ˆ๋‹ค. ์‚ฌ์ „ ์ง€์‹์€ ๋ฐ์ดํ„ฐ๋ฅผ ์ฆ๊ฐ•ํ•˜๋Š”๋ฐ, features์™€ ์•Œ๊ณ ๋ฆฌ์ฆ˜์„ ๋””์ž์ธํ•˜๋Š”๋ฐ ์‚ฌ์šฉ๋ฉ๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ ๊ฐ€์ •์€ ์ƒˆ๋กœ์šด ํ…Œ์Šคํฌ(์•Œ๋ ค์ง€์ง€ ์•Š์€ ๋ชจํ˜•)์— ์ผ๋ฐ˜ํ™”๋ฅผ ํ•  ์ˆ˜ ์—†์Šต๋‹ˆ๋‹ค. ๊ทธ๋ฆฌ๊ณ  ์‚ฌ์ „ ์ง€์‹์ด ์žˆ๋”๋ผ๋„ ๋ณต์žกํ•œ ๋ชจํ˜•์˜ ๊ฒฝ์šฐ feature์™€ ์•Œ๊ณ ๋ฆฌ์ฆ˜์„ ์ œ์ž‘ํ•˜๋Š” ๊ฒƒ์€ ๋ถˆ๊ฐ€๋Šฅํ•ฉ๋‹ˆ๋‹ค.

์ตœ๊ทผ CNN์€ ์‹œ๊ฐ ์ธ์‹ ํ…Œ์Šคํฌ์—์„œ ๋งŽ์€ ์„ฑ๊ณต์„ ๊ฑฐ๋‘์—ˆ์Šต๋‹ˆ๋‹ค. ๊ทธ๋Ÿฌ๋‚˜ ๊ธฐํ•˜ํ•™์  ๋‹ค์–‘์„ฑ์„ ํ•ด๊ฒฐํ•˜๊ธฐ ์œ„ํ•ด์„œ๋Š” ์–ด๋ ค์›€์ด ์žˆ๊ณ , ํ•ด๊ฒฐํ•˜๊ธฐ ์œ„ํ•ด์„œ๋ผ๋„ ํฐ ๋ชจ๋ธ์„ ์‚ฌ์šฉํ•ด์•ผ ํ•œ๋‹ค๋Š” ๊ฒƒ๊ณผ ์•Œ๋ ค์ง€์ง€ ์•Š์€ ๋ชจํ˜•์— ๋Œ€ํ•œ ์–ด๋ ค์›€์ด ์žˆ์Šต๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ ํ•œ๊ณ„๋Š” CNN์˜ ๊ณ ์ •๋œ ๋ชจ๋“ˆ ๊ตฌ์กฐ์—์„œ ์žˆ์Šต๋‹ˆ๋‹ค. Convolution์€ ๊ณ ์ •๋œ ์œ„์น˜์—์„œ sample์„ ์ถ”์ถœํ•˜๊ฒŒ ๋ฉ๋‹ˆ๋‹ค. pooling layer๋Š” ๊ณ ์ •๋œ ๋น„์œจ๋กœ ํ•ด์ƒ๋„๋ฅผ ๊ฐ์†Œ์‹œํ‚ต๋‹ˆ๋‹ค. ์ด๋“ค์€ ๊ธฐํ•˜ํ•˜์  ๋ชจ์–‘์„ ๋‹ค๋ฃจ๋Š”๋ฐ ๊ฒฐํ•จ์ด ์กด์žฌํ•ฉ๋‹ˆ๋‹ค.

์˜ˆ๋ฅผ ๋“ค์–ด, ์ดˆ๊ธฐ CNN layers๋Š” ๊ณต๊ฐ„์  ์œ„์น˜์— ๋Œ€ํ•ด ์„ค๋ช…์„ ํ•˜๊ฒŒ ๋˜๋Š”๋ฐ, ๊ณ ์ •์ ์ธ ์œ„์น˜์˜ Convolution๊ณผ pooling layer๋Š” ๊ธฐํ•˜ํ•˜์  ๋‹ค์–‘์„ฑ์œผ๋กœ ์ธํ•ด ๋‹ค๋ฅธ ์œ„์น˜๊ฐ€ ๋ฌผ์ฒด์™€ ์—ฐ๊ด€์ง€์–ด์งˆ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

395

(a) ๊ธฐ์กด์˜ standard convolution sampling

(b), (c), (d) deformable convolution offset sampling ( object์— ๋”ฐ๋ผ์„œ ๋‹ค์–‘ํ•œ ๋ชจ์Šต์œผ๋กœ ๋ณ€ํ™”ํ•œ๋‹ค. )

์•„๋ž˜์˜ ๋‘ ๋ชจ๋“ˆ์€ offset learning์„ ์œ„ํ•ด ์ ์€ ํŒŒ๋ผ๋ฏธํ„ฐ๋ฅผ ์ถ”๊ฐ€ํ•œ๋‹ค. ๋˜ํ•œ, ์ด์ „์˜ CNN์„ ๋Œ€์ฒดํ•˜๋ฉฐ end-to-end ํ•™์Šต์ด ๊ฐ€๋Šฅํ•˜๋‹ค.

Deformable convolution

323

deformable convolution์€ 2D offset์„ ๊ธฐ์กด CNN์˜ grid sampling์—๋‹ค๊ฐ€ ๋”ํ•œ ๊ฒƒ์ด๋‹ค. ์ด๋Š” ๊ธฐ์กด์˜ sampling ํ˜•์‹์—์„œ ์ž์œ ๋กญ๊ฒŒ ํ•ด์ค€๋‹ค. offset์€ ์ด์ „์˜ ํ”ผ์ณ๋งต์œผ๋กœ๋ถ€ํ„ฐ ์ถ”๊ฐ€์ ์ธ convolution layer๋ฅผ ํ†ตํ•ด ํ•™์Šต์ด ์ง„ํ–‰๋œ๋‹ค. ๊ทธ๋ž˜์„œ deformable convolution์€ ์ž…๋ ฅ๋œ ํ”ผ์ณ์— ๋”ฐ๋ผ ํ•™์Šต์ด ์ง„ํ–‰๋ฉ๋‹ˆ๋‹ค.

ex) R=(โˆ’1,โˆ’1),(โˆ’1,0),(โˆ’1,1),โ€ฆ,(0,1),(1,1)R = {(-1, -1), (-1,0), (-1, 1), โ€ฆ, (0,1), (1,1)} 3*3kernel , dilation = 1์ด๋ผ ํ•  ๋•Œ

Standard CNN | y(p0)=y(p0) = โˆ‘\sum w(pn)โˆ—x(p0+pn)(pnw(pn) * x(p0+pn) ( pn โˆˆ\in$ R$ ))

Deformable CNN | y(p0)=y(p0) = โˆ‘\sum w(pn)โˆ—x(p0+pn+โ–ณpn)(pnw(pn) * x(p0+pn+\bigtriangleup pn) ( pn โˆˆ\in$ R$ ))

offset์€ convolution layer์— ์˜ํ•ด ํ•™์Šต์ด ์ง„ํ–‰๋œ๋‹ค. ์ด ๋•Œ convolution layer๋ฅผ ์ง€๋‚˜๋ฉด resolution์ด ๊ฐ™์œผ๋ฉฐ ์ฑ„๋„์ด 2๋ฐฐ๊ฐ€ ๋˜๋Š” ํ”ผ์ณ๋งต์„ ์ƒ์„ฑํ•˜๋Š”๋ฐ, ์ด๋Š” offset์˜ ์ƒํ•˜, ์ขŒ์šฐ๋ฅผ ์˜๋ฏธํ•œ๋‹ค.

์—ฌ๊ธฐ์„œ ์‚ฌ์šฉํ•˜๋Š” convolution layer๋Š” 3kernel 1padding์„ ์‚ฌ์šฉํ•˜์—ฌ input๊ณผ output์ด ๋™์ผํ•œ ํ”ผ์ณ๋งต์ด ์ƒ์„ฑ๋œ๋‹ค.

์ด๋ ‡๊ฒŒ ์ƒ์„ฑ๋œ offset์€ ์œ„์˜ Deformable CNN ๊ณต์‹์˜ โ–ณpn\bigtriangleup pn์ด ๋œ๋‹ค. โ–ณpn\bigtriangleup pn์˜ ๊ฒฝ์šฐ ์ •์ˆ˜๊ฐ€ ์•„๋‹Œ ๊ฒฝ์šฐ๊ฐ€ ๋งŽ์€๋ฐ, ์ด๋Š” blinear interpolation์œผ๋กœ ๋„์ถœํ•œ๋‹ค.

Deformable RoI pooling

325

RoI pooling์€ ์˜ค๋ธŒ์ ํŠธ ๋””ํ…์…˜์—์„œ region proposal์„ ๊ณ ์ •๋œ ๋ฒกํ„ฐ์˜ ํฌ๊ธฐ๋กœ ๋ณ€ํ™˜์‹œ์ผœ์ฃผ๊ธฐ ์œ„ํ•ด ์‚ฌ์šฉํ•œ๋‹ค. ์œ„์˜ Deformable convolution๊ณผ ๋น„์Šทํ•œ ์–‘์‹์„ ๋”ฐ๋ฅด๋ฉฐ, ๋‹ค๋ฅธ์ ์ด ์žˆ๋‹ค๋ฉด offset์„ ํ•™์Šตํ•  ๋•Œ fully connected layer๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ ์ง„ํ–‰ํ•œ๋‹ค๋Š” ๊ฒƒ์ด๋‹ค.

deformable roi pooling์€ offset์„ ๊ฐ๊ฐ์˜ bin position์— ๋”ํ•ด์ฃผ๋Š” ๊ฒƒ์ด๋‹ค. ๋น„์Šทํ•˜๊ฒŒ offset์€ ์ด์ „ feature map๊ณผ RoIs๋ฅผ ์ง„ํ–‰ํ•จ์— ๋”ฐ๋ผ ๊ฐ์ฒด์— ๋งˆ๋‹ค ๋‹ค๋ฅธ ๋ชจ์–‘์œผ๋กœ ํ•™์Šต๋œ๋‹ค.

Deformable ConvNets

์œ„ ๋‘๊ฐ€์ง€ ๊ธฐ๋ฒ•์€ ๊ธฐ๋ณธ ๋ฒ„์ ผ์—์„œ๋Š” ๊ฐ™์€ ์ธํ’‹๊ณผ ์•„์›ƒํ’‹์˜ ์‚ฌ์ด์ฆˆ๋ฅผ ๊ฐ€์ง„๋‹ค. ๊ทธ๋ž˜์„œ ๊ธฐ์กด CNN์„ ์‰ฝ๊ฒŒ ๋Œ€์ฒดํ•  ์ˆ˜ ์žˆ๋‹ค. ํ•™์Šต์‹œ์—๋Š”, offset vector๋Š” 0์˜ ๊ฐ’์„ ์‹œ์ž‘์œผ๋กœ ํ•™์Šต์ด ์ง„ํ–‰๋œ๋‹ค.

์šฐ๋ฆฌ๋Š” deformable convnet์„ ๊ธฐ์กด์˜ state-of-the-art model์— ํ†ตํ•ฉ์‹œํ‚ค๊ธฐ ์œ„ํ•ด ๋‘ ๊ฐ€์ง€ ๋ฐฉ์‹์„ ๋”ฐ๋ž๋‹ค. ๋จผ์ € ์ „์ฒด ์ด๋ฏธ์ง€๋ฅผ deep filly convolution layer์— ๋„ฃ์—ˆ๋‹ค. ๋‘๋ฒˆ์งธ๋กœ ๊ฐ„๋‹จํ•œ task ํŠน์ • ๋„คํŠธ์›Œํฌ๋กœ ๊ฒฐ๊ณผ๋ฅผ ์ƒ์„ฑํ•œ๋‹ค.

Deformable convolution for Feature Extraction

Feature extraction์„ ์œ„ํ•ด์„œ sota ๋ชจ๋ธ์ธ ImageNet ๋ฐ์ดํ„ฐ์…‹์œผ๋กœ ํ•™์Šต๋œ ResNet-101๊ณผ Inception-ResNet์„ ์‚ฌ์šฉํ•œ๋‹ค. average pooling๊ณผ fc layer๋ฅผ ์‚ญ์ œํ•˜์˜€๋‹ค. ๊ทธ๋ฆฌ๊ณ  ์ฑ„๋„์„ ๋ณ€๊ฒฝํ•˜๊ธฐ ์œ„ํ•ด 1*1 convolution layer๋ฅผ ์ถ”๊ฐ€ํ•˜์˜€๊ณ , ๋ช‡๋ช‡ ํŒŒ๋ผ๋ฏธํ„ฐ๋ฅผ ๋ณ€๊ฒฝํ•˜์˜€๋‹ค. ๊ทธ๋ฆฌ๊ณ  model์— ๋งˆ์ง€๋ง‰ ๋ ˆ์ด์–ด ๋ถ€๊ทผ์— deformable convolution layer๋กœ ์ˆ˜์ •ํ•˜์˜€์œผ๋ฉฐ ๋งˆ์ง€๋ง‰์—์„œ 1, 2, 3, 6๊ฐœ๋ฅผ ๋ฐ”๊ฟ”๊ฐ€๋ฉฐ ์„ฑ๋Šฅ์„ ํ™•์ธํ•˜์˜€๊ณ , 3๊ฐœ, 6๊ฐœ ๋ฅผ ์‚ฌ์šฉํ–ˆ์„ ๋•Œ ๊ฐ€์žฅ ์ข‹์€ ์„ฑ๋Šฅ์„ ๋ณด์˜€๋‹ค.

522

## Understanding Deformable ConvNets

347

Deformable convolution์ด ์Œ“์ด๊ฒŒ ๋˜๋ฉด ๊ทธ ํšจ๊ณผ๋ฅผ ์œ„์˜ ์‚ฌ์ง„์—์„œ ํ™•์ธํ•  ์ˆ˜ ์žˆ๋‹ค. ์™ผ์ชฝ๊ณผ ๋‹ค๋ฅด๊ฒŒ ์˜ค๋ฅธ์ชฝ์˜ object๋ฅผ ํ‘œํ˜„ํ•˜๋Š”๋ฐ ์‚ฌ์šฉ๋œ ์ด๋ฏธ์ง€์˜ ์ •๋ณด๋Š” offset์„ ํ•™์Šตํ•˜๋ฉด์„œ ์ข€ ๋” ๊ฐ์ฒด์˜ ๋ชจ์–‘์— ์•Œ๋งž๊ฒŒ ๋“ค์–ด๊ฐ„ ๊ฒƒ์„ ํ™•์ธํ•  ์ˆ˜ ์žˆ๋‹ค.

537

์ถ”๊ฐ€์ ์œผ๋กœ RoI pooling์—์„œ๋„ ์œ„์™€ ๊ฐ™์€ ํšจ๊ณผ๋ฅผ ํ™•์ธํ•  ์ˆ˜ ์žˆ๋‹ค. ์•„๋ž˜ ์‚ฌ์ง„์„ ๋ณด๋ฉด grid structure๊ฐ€ ๋” ์ด์ƒ ๊ณ ์ •๋˜์–ด ์žˆ์ง€ ์•Š์œผ๋ฉฐ, ๊ฐ์ฒด๊ฐ€ ์•„๋‹Œ ๋ถ€๋ถ„์— ๋Œ€ํ•ด ํƒ์ง€ ๋˜์ง€ ์•Š๋Š”๋‹ค.

538

*In Context of Related Works*

Spatial Transform Networks (STN)

๋”ฅ๋Ÿฌ๋‹ ํ”„๋ ˆ์ž„์›Œํฌ์—์„œ ์ฒ˜์Œ์œผ๋กœ ๋ฐ์ดํ„ฐ์—์„œ ๋ชจ์–‘ ๋ณ€๊ฒฝ์„ ํ•˜์—ฌ ์ง„ํ–‰ํ•œ ๋„คํŠธ์›Œํฌ์ด๋‹ค. spatial transformation ๊ธฐ๋ฒ•์„ ์ ์šฉํ•˜์—ฌ ์›ํ•˜๋Š” ๋ถ€๋ถ„์„ ์ž˜๋ผ๋‚ด ๊ฐ์ฒด ๋ถ€๋ถ„์— ํ•ด๋‹นํ•˜์—ฌ ํ•™์Šต์„ ์ง‘์ค‘์ ์œผ๋กœ ํ•œ๋‹ค.

410

## Expriments

Conclusion

์ด ๋…ผ๋ฌธ์—์„œ๋Š” ๊ฐ„๋‹จํ•˜๊ณ  ํšจ์œจ์ ์ด๋ฉฐ ๊นŠ๊ณ  ene-to-end deformable Convnets์„ ์ œ์‹œํ•œ๋‹ค. ์šฐ๋ฆฌ๋Š” ์ฒ˜์Œ์œผ๋กœ CNN์—์„œ ๊ณต๊ฐ„ ๋ณ€ํ˜•์ด ๊ฐ€๋Šฅํ•˜๋ฉฐ ํšจ๊ณผ์ ์ธ ๊ฒƒ์„ ์ฆ๋ช…ํ–ˆ๋‹ค.


๐Ÿ”— ๊ด€๋ จ ๊ธ€

0๊ฐœ์˜ ๋Œ“๊ธ€