๐ ๋ณธ ๊ธ์ 2023.03 ์ ์์ฑํ paper review๋ฅผ ๋ค๋ฌ์ด ๋ฐํํ ์์นด์ด๋ธ ๊ธ์ ๋๋ค.
์์ฑ ๋น์ ์ปจํ ์คํธ: X:AI 4๊ธฐ Basic
์๋ณธ ๋ ผ๋ฌธ: https://arxiv.org/abs/1703.06211
CNN์ ๊ณ ์ ๋ ๋ชจ๋์ ๊ตฌ์กฐ๋ก ์ธํ์ฌ ๊ธฐํํ์ ๋ชจ์์ ์ ํ์ด ์์ต๋๋ค. ์ด ๋ ผ๋ฌธ์์ ์ฐ๋ฆฌ๋ CNN์ ๋ชจ๋ธ ์์ฉ์ฑ์ ํ์ฅ์์ผ์ค ๋๊ฐ์ ์๋ก์ด ๋ชจ๋ธ์ธ deformable convolution๊ณผ deformable ROI pooling์ ์ ์ํฉ๋๋ค. ๋ ๋ค offset์ ์ด์ฉํ์ฌ ์์น ์ํ๋ง์ ๋ณด๊ฐํ๋ ๊ธฐ๋ฒ์ ๋ฒ ์ด์ค๋ก ํฉ๋๋ค. ์๋ก์ด ๋ชจ๋์ ์ฝ๊ฒ ์กด์ฌํ๋ CNN์ ๋์ฒดํ ์ ์์ผ๋ฉฐ ์ฝ๊ฒ end-to-end๋ก ํ์ต์ด ๊ฐ๋ฅํฉ๋๋ค. ๋ง์ ์คํ์ ์ฐ๋ฆฌ์ ์ ๊ทผ์ ์ฑ๋ฅ์ ๊ฒ์ฆํฉ๋๋ค. ์ฒ์์ผ๋ก ์ฐ๋ฆฌ๋ ๊ณต๊ฐ ๋ณํ์ CNN์์ ํ์ตํ๋ ๊ฒ์ด object detection๊ณผ semantic segmentation์์ ํจ๊ณผ์ ์ธ ๊ฒ์ ๋ณด์ฌ์ค๋๋ค.
์๊ฐ์ธ์์์ ์ค์ํ ๋ฌธ์ ๋ ์ด๋ป๊ฒ ๊ธฐํํ์ ๋ค์์ฑ๊ณผ ๋ชจ๋ธ์ ํฌ๊ธฐ, ํฌ์ฆ, ๊ด์ ๊ทธ๋ฆฌ๊ณ ์ผ๋ถ๋ถ์ ์์ฉํ๋๊ฐ ์ ๋๋ค. ๋๊ฒ ๋๊ฐ์ ๋ฐฉ๋ฒ์ด ์์ต๋๋ค. ์ฒซ๋ฒ์งธ๋ ์ถฉ๋ถํ ๋ค์ํ ํ์ต ๋ฐ์ดํฐ์ ์ค๋น์ ๋๋ค. ์ด๋ ์กด์ฌํ๋ ๋ฐ์ดํฐ๋ฅผ ๋ค์ํ ๋ฐ์ดํฐ ์ฆ๊ฐ ๊ธฐ๋ฒ์ ํตํด ํด๊ฒฐํ ์ ์์ต๋๋ค. ๋ฐ์ดํฐ๋ฅผ ํตํด ์ ํ์ตํ ์ ์์ง๋ง ์ด๋ ๋ง์ ํ์ต๊ณผ ๋ณต์กํ ๋ชจ๋ธ์ ํ์๋ก ํฉ๋๋ค.
๋๋ฒ์งธ ๋ฐฉ์์ transformation-invariant ํผ์ณ์ ์๊ณ ๋ฆฌ์ฆ์ ์ฌ์ฉํ๋ ๊ฒ์ด ์์ต๋๋ค. ๋ํ์ ์ผ๋ก SIFT, sliding window๊ฐ ์์ต๋๋ค. ์ฌ๊ธฐ์๋ ๋๊ฐ์ง ๋ฌธ์ ๊ฐ ์๋๋ฐ, ๊ธฐํํ์ ๋ชจํ์ด ์๋ ค์ง๊ฑฐ๋ ๊ณ ์ ๋์ด์ผํฉ๋๋ค. ์ฌ์ ์ง์์ ๋ฐ์ดํฐ๋ฅผ ์ฆ๊ฐํ๋๋ฐ, features์ ์๊ณ ๋ฆฌ์ฆ์ ๋์์ธํ๋๋ฐ ์ฌ์ฉ๋ฉ๋๋ค. ์ด๋ฌํ ๊ฐ์ ์ ์๋ก์ด ํ ์คํฌ(์๋ ค์ง์ง ์์ ๋ชจํ)์ ์ผ๋ฐํ๋ฅผ ํ ์ ์์ต๋๋ค. ๊ทธ๋ฆฌ๊ณ ์ฌ์ ์ง์์ด ์๋๋ผ๋ ๋ณต์กํ ๋ชจํ์ ๊ฒฝ์ฐ feature์ ์๊ณ ๋ฆฌ์ฆ์ ์ ์ํ๋ ๊ฒ์ ๋ถ๊ฐ๋ฅํฉ๋๋ค.
์ต๊ทผ CNN์ ์๊ฐ ์ธ์ ํ ์คํฌ์์ ๋ง์ ์ฑ๊ณต์ ๊ฑฐ๋์์ต๋๋ค. ๊ทธ๋ฌ๋ ๊ธฐํํ์ ๋ค์์ฑ์ ํด๊ฒฐํ๊ธฐ ์ํด์๋ ์ด๋ ค์์ด ์๊ณ , ํด๊ฒฐํ๊ธฐ ์ํด์๋ผ๋ ํฐ ๋ชจ๋ธ์ ์ฌ์ฉํด์ผ ํ๋ค๋ ๊ฒ๊ณผ ์๋ ค์ง์ง ์์ ๋ชจํ์ ๋ํ ์ด๋ ค์์ด ์์ต๋๋ค. ์ด๋ฌํ ํ๊ณ๋ CNN์ ๊ณ ์ ๋ ๋ชจ๋ ๊ตฌ์กฐ์์ ์์ต๋๋ค. Convolution์ ๊ณ ์ ๋ ์์น์์ sample์ ์ถ์ถํ๊ฒ ๋ฉ๋๋ค. pooling layer๋ ๊ณ ์ ๋ ๋น์จ๋ก ํด์๋๋ฅผ ๊ฐ์์ํต๋๋ค. ์ด๋ค์ ๊ธฐํํ์ ๋ชจ์์ ๋ค๋ฃจ๋๋ฐ ๊ฒฐํจ์ด ์กด์ฌํฉ๋๋ค.
์๋ฅผ ๋ค์ด, ์ด๊ธฐ CNN layers๋ ๊ณต๊ฐ์ ์์น์ ๋ํด ์ค๋ช ์ ํ๊ฒ ๋๋๋ฐ, ๊ณ ์ ์ ์ธ ์์น์ Convolution๊ณผ pooling layer๋ ๊ธฐํํ์ ๋ค์์ฑ์ผ๋ก ์ธํด ๋ค๋ฅธ ์์น๊ฐ ๋ฌผ์ฒด์ ์ฐ๊ด์ง์ด์ง ์ ์์ต๋๋ค.

(b), (c), (d) deformable convolution offset sampling ( object์ ๋ฐ๋ผ์ ๋ค์ํ ๋ชจ์ต์ผ๋ก ๋ณํํ๋ค. )
์๋์ ๋ ๋ชจ๋์ offset learning์ ์ํด ์ ์ ํ๋ผ๋ฏธํฐ๋ฅผ ์ถ๊ฐํ๋ค. ๋ํ, ์ด์ ์ CNN์ ๋์ฒดํ๋ฉฐ end-to-end ํ์ต์ด ๊ฐ๋ฅํ๋ค.

ex) 3*3kernel , dilation = 1์ด๋ผ ํ ๋
Standard CNN | $ R$
Deformable CNN | $ R$
offset์ convolution layer์ ์ํด ํ์ต์ด ์งํ๋๋ค. ์ด ๋ convolution layer๋ฅผ ์ง๋๋ฉด resolution์ด ๊ฐ์ผ๋ฉฐ ์ฑ๋์ด 2๋ฐฐ๊ฐ ๋๋ ํผ์ณ๋งต์ ์์ฑํ๋๋ฐ, ์ด๋ offset์ ์ํ, ์ข์ฐ๋ฅผ ์๋ฏธํ๋ค.
์ฌ๊ธฐ์ ์ฌ์ฉํ๋ convolution layer๋ 3kernel 1padding์ ์ฌ์ฉํ์ฌ input๊ณผ output์ด ๋์ผํ ํผ์ณ๋งต์ด ์์ฑ๋๋ค.
์ด๋ ๊ฒ ์์ฑ๋ offset์ ์์ Deformable CNN ๊ณต์์ ์ด ๋๋ค. ์ ๊ฒฝ์ฐ ์ ์๊ฐ ์๋ ๊ฒฝ์ฐ๊ฐ ๋ง์๋ฐ, ์ด๋ blinear interpolation์ผ๋ก ๋์ถํ๋ค.

deformable roi pooling์ offset์ ๊ฐ๊ฐ์ bin position์ ๋ํด์ฃผ๋ ๊ฒ์ด๋ค. ๋น์ทํ๊ฒ offset์ ์ด์ feature map๊ณผ RoIs๋ฅผ ์งํํจ์ ๋ฐ๋ผ ๊ฐ์ฒด์ ๋ง๋ค ๋ค๋ฅธ ๋ชจ์์ผ๋ก ํ์ต๋๋ค.
์ ๋๊ฐ์ง ๊ธฐ๋ฒ์ ๊ธฐ๋ณธ ๋ฒ์ ผ์์๋ ๊ฐ์ ์ธํ๊ณผ ์์ํ์ ์ฌ์ด์ฆ๋ฅผ ๊ฐ์ง๋ค. ๊ทธ๋์ ๊ธฐ์กด CNN์ ์ฝ๊ฒ ๋์ฒดํ ์ ์๋ค. ํ์ต์์๋, offset vector๋ 0์ ๊ฐ์ ์์์ผ๋ก ํ์ต์ด ์งํ๋๋ค.
์ฐ๋ฆฌ๋ deformable convnet์ ๊ธฐ์กด์ state-of-the-art model์ ํตํฉ์ํค๊ธฐ ์ํด ๋ ๊ฐ์ง ๋ฐฉ์์ ๋ฐ๋๋ค. ๋จผ์ ์ ์ฒด ์ด๋ฏธ์ง๋ฅผ deep filly convolution layer์ ๋ฃ์๋ค. ๋๋ฒ์งธ๋ก ๊ฐ๋จํ task ํน์ ๋คํธ์ํฌ๋ก ๊ฒฐ๊ณผ๋ฅผ ์์ฑํ๋ค.
Deformable convolution for Feature Extraction
Feature extraction์ ์ํด์ sota ๋ชจ๋ธ์ธ ImageNet ๋ฐ์ดํฐ์ ์ผ๋ก ํ์ต๋ ResNet-101๊ณผ Inception-ResNet์ ์ฌ์ฉํ๋ค. average pooling๊ณผ fc layer๋ฅผ ์ญ์ ํ์๋ค. ๊ทธ๋ฆฌ๊ณ ์ฑ๋์ ๋ณ๊ฒฝํ๊ธฐ ์ํด 1*1 convolution layer๋ฅผ ์ถ๊ฐํ์๊ณ , ๋ช๋ช ํ๋ผ๋ฏธํฐ๋ฅผ ๋ณ๊ฒฝํ์๋ค. ๊ทธ๋ฆฌ๊ณ model์ ๋ง์ง๋ง ๋ ์ด์ด ๋ถ๊ทผ์ deformable convolution layer๋ก ์์ ํ์์ผ๋ฉฐ ๋ง์ง๋ง์์ 1, 2, 3, 6๊ฐ๋ฅผ ๋ฐ๊ฟ๊ฐ๋ฉฐ ์ฑ๋ฅ์ ํ์ธํ์๊ณ , 3๊ฐ, 6๊ฐ ๋ฅผ ์ฌ์ฉํ์ ๋ ๊ฐ์ฅ ์ข์ ์ฑ๋ฅ์ ๋ณด์๋ค.




Spatial Transform Networks (STN)
๋ฅ๋ฌ๋ ํ๋ ์์ํฌ์์ ์ฒ์์ผ๋ก ๋ฐ์ดํฐ์์ ๋ชจ์ ๋ณ๊ฒฝ์ ํ์ฌ ์งํํ ๋คํธ์ํฌ์ด๋ค. spatial transformation ๊ธฐ๋ฒ์ ์ ์ฉํ์ฌ ์ํ๋ ๋ถ๋ถ์ ์๋ผ๋ด ๊ฐ์ฒด ๋ถ๋ถ์ ํด๋นํ์ฌ ํ์ต์ ์ง์ค์ ์ผ๋ก ํ๋ค.


์ด ๋ ผ๋ฌธ์์๋ ๊ฐ๋จํ๊ณ ํจ์จ์ ์ด๋ฉฐ ๊น๊ณ ene-to-end deformable Convnets์ ์ ์ํ๋ค. ์ฐ๋ฆฌ๋ ์ฒ์์ผ๋ก CNN์์ ๊ณต๊ฐ ๋ณํ์ด ๊ฐ๋ฅํ๋ฉฐ ํจ๊ณผ์ ์ธ ๊ฒ์ ์ฆ๋ช ํ๋ค.
๐ ๊ด๋ จ ๊ธ