[Paper Review] Taskonomy

msgoΒ·2026λ…„ 5μ›” 25일

πŸ“Œ λ³Έ 글은 2023.07 에 μž‘μ„±ν•œ paper reviewλ₯Ό 닀듬어 λ°œν–‰ν•œ μ•„μΉ΄μ΄λΈŒ κΈ€μž…λ‹ˆλ‹€.
μž‘μ„± λ‹Ήμ‹œ μ»¨ν…μŠ€νŠΈ: X:AI 4κΈ° Adv
원본 λ…Όλ¬Έ: https://arxiv.org/abs/1804.08328

ABSTRACT

컴퓨터 λΉ„μ Ό ν…ŒμŠ€ν¬λŠ” μ„œλ‘œ 관련이 μžˆμ„κΉŒ? 예λ₯Ό λ“€μ–΄ surface normal taskλŠ” depth image와 관련이 μžˆμ„κΉŒμš”? μ§κ΄€μ μœΌλ‘œ 관련이 μžˆμ„ κ²ƒμœΌλ‘œ λ³΄μž…λ‹ˆλ‹€. 그리고 μ΄λŠ” λΉ„μ Ό ν…ŒμŠ€ν¬κ°„ κ΅¬μ‘°μ—μ„œ 관련이 μžˆμ„ 것 κ°™μŠ΅λ‹ˆλ‹€. μ΄λŸ¬ν•œ 관련은 전이 ν•™μŠ΅μ—μ„œ μƒλ‹Ήν•œ κ°€μΉ˜κ°€ μžˆμŠ΅λ‹ˆλ‹€. 관련이 μžˆλ‹€λ©΄ ν•™μŠ΅ν•œ 것을 μž¬μ‚¬μš©ν•˜λ©° λ³΅μž‘μ„±μ„ 쀄일 수 μžˆμŠ΅λ‹ˆλ‹€.

μš°λ¦¬λŠ” λΉ„μ Ό ν…ŒμŠ€ν¬μ—μ„œμ˜ 관계 ꡬ쑰λ₯Ό λ³΄μ—¬μ£Όκ³ μž ν•©λ‹ˆλ‹€. μ΄λŠ” 전이 ν•™μŠ΅μ—μ„œ 이루어지며 2D, 2.5D, 3D그리고 semantic segmentationκ³Ό 같은 26κ°€μ§€μ˜ ν…ŒμŠ€ν¬λ₯Ό μ‚΄νŽ΄λ΄…λ‹ˆλ‹€. ν…ŒμŠ€ν¬κ°„ 관계λ₯Ό νŒŒμ•…ν•œλ‹€λ©΄ ν•™μŠ΅μ— ν•„μš”ν•œ 라벨값을 ν™•κΈ°μ μœΌλ‘œ 쀄일 수 μžˆμ„ κ²ƒμž…λ‹ˆλ‹€. μš°λ¦¬λŠ” 10개의 ν…ŒμŠ€ν¬μ— λŒ€ν•΄μ„œ 전이 ν•™μŠ΅μ΄ 이전 단독 ν•™μŠ΅λ³΄λ‹€ 3λΆ„μ˜ 2μ •λ„μ˜ 데이터가 ν•„μš”ν•œ 것을 증λͺ…ν–ˆμŠ΅λ‹ˆλ‹€. μš°λ¦¬λŠ” ν…ŒμŠ€ν¬ κ΄€ 관계λ₯Ό λ³Ό 수 μžˆλŠ” 방식과 μœ μ €λ“€μ΄ ν•™μŠ΅ν•˜λŠ”λ° κ³ λ €ν•˜λŠ”λ° λ³Όλ²•ν•œ taxonomical ꡬ쑰λ₯Ό μ œμ‹œν•©λ‹ˆλ‹€.

Introduction

객체 인식, 깊이 μΆ”μ •, κ°€μž₯자리 탐지, 포즈 μΆ”μ • λ“± μ—¬λŸ¬ λΉ„μ Ό ν…ŒμŠ€ν¬λŠ” μœ μš©ν•©λ‹ˆλ‹€. 이듀 쀑 λͺ‡λͺ‡μ€ ν™•μ‹€ν•œ 관계λ₯Ό κ°€μ§€κ³  μžˆμŠ΅λ‹ˆλ‹€. μš°λ¦¬λŠ” surface normal와 깊이 좔정은 관련이 있고 vanising pointλŠ” λ°©ν–₯ 탐지에 μœ μš©ν•˜λ‹€κ³  μƒκ°ν•©λ‹ˆλ‹€. λ‹€λ₯Έ λΉ„μ Ό ν…ŒμŠ€ν¬μ—μ„œλ„ λΉ„μŠ·ν•œ 관련이 μžˆλ‹€κ³  μ—¬κ²¨μ§‘λ‹ˆλ‹€.

컴퓨터 λΉ„μ Ό λΆ„μ•Όμ—μ„œλŠ” μ΄λŸ¬ν•œ 관계에 λŒ€ν•΄μ„œ λͺ…μ‹œμ μœΌλ‘œ 증λͺ…ν•˜μ§€λŠ” μ•Šμ•˜μŠ΅λ‹ˆλ‹€. μš°λ¦¬λŠ” 기계 ν•™μŠ΅ λΆ„μ•Όμ—μ„œ λ§Žμ€ 진전을 μ΄λ£¨μ—ˆκ³  νŠΈλ ˆμ΄λ‹ 데이터λ₯Ό ν•™μŠ΅ν•˜μ—¬ λ³΅μž‘ν•œ 맀핑을 μ°Ύμ•„λ‚΄μ–΄ μ˜ˆμΈ‘μ„ μ§„ν–‰ν•©λ‹ˆλ‹€. μ΄λŠ” supervised-learning 지도 ν•™μŠ΅μ΄λΌ ν•˜λ©° ν•œ ν…ŒμŠ€ν¬μ— λŒ€ν•΄μ„œλ§Œ μ§„ν–‰λ˜κΈ°λ„ ν•©λ‹ˆλ‹€. μ΄λŸ°ν•œ 단독 ν•™μŠ΅μ€ μƒˆλ‘œμš΄ ν…ŒμŠ€ν¬μ— λŒ€ν•΄ μ²˜μŒλΆ€ν„° λ‹€μ‹œ ν•™μŠ΅ μ‹œμΌœμ•Ό ν•œλ‹€λŠ” 단점이 μ‘΄μž¬ν•˜λ©° ν…ŒμŠ€ν¬ λ§ˆλ‹€μ˜ λ§Žμ€ 데이터λ₯Ό μš”κ΅¬ν•˜κ²Œ λ©λ‹ˆλ‹€.

ν…ŒμŠ€ν¬μ—μ„œμ˜ 관계λ₯Ό μ΄μš©ν•œλ‹€λ©΄ λͺ¨λΈμ€ 적은 라벨과 적은 μ—°μ‚°λŸ‰μ„ μš”κ΅¬ν•˜λ©° 쒋은 λ°©ν–₯으둜 ν•™μŠ΅ν•˜κ²Œ λ©λ‹ˆλ‹€. 톡합 λͺ¨λΈμ€ λ‹€μ–‘ν•œ ν…ŒμŠ€ν¬λ₯Ό ν•΄κ²°ν•  수 μžˆλŠ” 효율적이고 μ „λ°˜μ μΈ λͺ¨λΈμž…λ‹ˆλ‹€. κ·ΈλŸ¬λ‚˜ ν…ŒμŠ€ν¬μ— λŒ€ν•œ μ΄ν•΄λŠ” 아직 잘 λͺ¨λ¦…λ‹ˆλ‹€. ν…ŒμŠ€ν¬ 관계증λͺ…은 μ€‘μš”ν•˜λ©° ν•™μŠ΅ 및 μ΅œμ ν™”λ₯Ό ν†΅ν•˜μ—¬ 이λ₯Ό μ°Ύμ•„λ‚΄λŠ” 것은 λ³΅μž‘ν•©λ‹ˆλ‹€.

257

**이 λ…Όλ¬Έμ—μ„œ μš°λ¦¬λŠ” ν…ŒμŠ€ν¬κ°„ 관계λ₯Ό μ°Ύμ•„λ‚΄λŠ” λͺ¨λΈμ„ μ œμ‹œν•˜λ©° λΉ„μ Ό ν…ŒμŠ€ν¬κ°„ 관계 맀핑을 μ œκ³΅ν•©λ‹ˆλ‹€.** μ΄λŸ¬ν•œ λͺ¨λΈμ€ 인곡 신경망을 ν†΅ν•΄μ„œ λ°ν˜€λƒ…λ‹ˆλ‹€. 순방ν–₯ λ„€νŠΈμ›Œν¬μ—μ„œ 각각의 λ ˆμ΄μ–΄λŠ” 인풋 데이터λ₯Ό ν†΅ν•˜μ—¬ 좔상적인 ν‘œν˜„μ„ μ œκ³΅ν•˜λ©° μ΄λŠ” λ‹€μ‹œ μ•„μ›ƒν’‹μœΌλ‘œ λ„μΆœλ©λ‹ˆλ‹€. κ·ΈλŸ¬λ‚˜ μ΄λŸ¬ν•œ representation은 λ‹€λ₯Έ ν…ŒμŠ€ν¬λ₯Ό ν•΄κ²°ν•˜λŠ”λ°λ„ μœ μš©ν•  수 μžˆμŠ΅λ‹ˆλ‹€.

μš°λ¦¬λŠ” ν•˜λ‚˜μ˜ ν…ŒμŠ€ν¬λ₯Ό ν•™μŠ΅ν•œλ° 쓰인 representation이 λ‹€λ₯Έ ν…ŒμŠ€ν¬μ˜ 결과물을 λ„μΆœν•˜λŠ”λ° μ–Όλ§ˆλ‚˜ μœ μš©ν•œμ§€μ— λŒ€ν•΄ 행렬을 κ³„μ‚°ν•©λ‹ˆλ‹€. μ΄λŸ¬ν•œ 방식은 단독 ν•™μŠ΅λ³΄λ‹€ λ‹€λ₯Έ ν…ŒμŠ€ν¬μ—μ„œ ν•™μŠ΅ν•œ 것을 기반으둜 ν•˜κΈ° λ•Œλ¬Έμ— ν•΄λ‹Ή ν…ŒμŠ€ν¬μ—μ„œ 데이터λ₯Ό 덜 μš”κ΅¬ν•  수 있게 λ©λ‹ˆλ‹€.

representation-based와 fully-computationalκΈ°λ°˜μ΄λ―€λ‘œ 가정을 ν”Όν•  수 μžˆμŠ΅λ‹ˆλ‹€. 가정이 μ—†λŠ” 것은 μ‚¬λžŒμ˜ μ˜κ²¬μ΄λ‚˜ 뢄석적인 지식이 λ“€μ–΄κ°€μ§€ μ•ŠκΈ° λ•Œλ¬Έμ— μ€‘μš”ν•œ μ μž…λ‹ˆλ‹€. 예λ₯Ό λ“€μ–΄ μš°λ¦¬λŠ” 깊이 좔정이 ν‘œλ©΄ μΆ”μΆœκ³Ό 같은 곳에 도움이 될 것이라 μ—¬κΈΈ 수 μžˆμ„μ§€λΌλ„ 사전 가정이 μ—†μœΌλ©΄ 컴퓨터적 계산에 μ˜ν•΄ λ”μš± 쒋은 λ°©ν–₯을 μ°Ύμ•„λƒ…λ‹ˆλ‹€.

μš”μ¦˜ μ‚¬μš©ν•˜λŠ” κΈ°μˆ μ€ 튜링이 μ£Όμž₯ν–ˆλ˜ ν•™μŠ΅λ°©μ‹μΈ 이전 μŠ€ν…Œμ΄μ§€μ—μ„œ 결과물을 ν† λŒ€λ‘œ ν•™μŠ΅ν•΄μ„œ λ‚˜μ•„κ°€λŠ” 방식이 λ°œμ „λ˜μ–΄ μ™”μŠ΅λ‹ˆλ‹€. μš°λ¦¬λŠ” μ΄λŸ¬ν•œ ꡬ쑰λ₯Ό 찾고자 ν–ˆμŠ΅λ‹ˆλ‹€. μš°λ¦¬κ°€ ν•˜κ³ μž ν•˜λŠ” 것은 λ‹€μ–‘ν•œ 뢄야와 관련이 μžˆμŠ΅λ‹ˆλ‹€.

Self-supervised learning

자기 지도 ν•™μŠ΅μ€ μƒλŒ€μ μœΌλ‘œ μ‹Ό ν…ŒμŠ€ν¬λ₯Ό 톡해 ν•™μŠ΅ν•œ 정보λ₯Ό μ΄μš©ν•˜μ—¬ 관련이 μžˆλŠ” 보닀 λΉ„μ‹Ό ν…ŒμŠ€ν¬λ₯Ό ν•™μŠ΅ν•˜λŠ” λ°©μ‹μž…λ‹ˆλ‹€. μ΄λŠ” source taskλ₯Ό μˆ˜λ™μ μœΌλ‘œ λ„£μ–΄μ£Όμ–΄μ•Ό ν•˜λŠ” 단점이 μ‘΄μž¬ν•©λ‹ˆλ‹€.

Unsupervised learning

비지도 ν•™μŠ΅μ€ ν…ŒμŠ€ν¬μ— λŒ€ν•΄ 라벨이 μ£Όμ–΄μ§€μ§€ μ•Šμ€ ν™˜κ²½μ—μ„œ μΈν’‹μ—μ„œμ˜ μœ μ‚¬ν•œ 점을 μ°Ύμ•„ κ°„κ²°ν•œ representation을 ν‘œν˜„ν•˜λŠ”λ° λͺ©ν‘œλ₯Ό λ‘‘λ‹ˆλ‹€.

Meta-learning

메타 λŸ¬λ‹μ€ 전톡적인 ν•™μŠ΅ 단계 보닀 μœ„μ—μ„œ ν•™μŠ΅μ„ ν•˜λŠ”λ° μ΄ˆμ μ„ 두고 μžˆμŠ΅λ‹ˆλ‹€. ν•™μŠ΅ 데이터셋 상관없이 보편적인 방법을 μ°ΎλŠ”λ° μ‚¬μš©λ©λ‹ˆλ‹€. 예λ₯Ό λ“€μ–΄ κ°•ν™”ν•™μŠ΅, μ΅œμ ν™” λ“±μ—μ„œ μ‚¬μš©λ©λ‹ˆλ‹€.

Multi-task learning

λ©€ν‹° ν…ŒμŠ€ν¬ λŸ¬λ‹μ€ ν•˜λ‚˜μ˜ 인풋을 κ°€μ§€κ³  μ—¬λŸ¬ ν…ŒμŠ€ν¬μ—μ„œ μ‚¬μš©ν•  수 μžˆλ„λ‘ λ‹€μ–‘ν•œ 아웃풋을 ν•™μŠ΅ν•˜λŠ” λ°©μ‹μž…λ‹ˆλ‹€.

Domain adaption

도메인 μ μš©μ€ 같은 ν…ŒμŠ€ν¬μ—μ„œ νŠΉμ • λ„λ©”μΈμ—μ„œ λ‹€λ₯Έ λ„λ©”μΈμœΌλ‘œμ˜ μ μš©μ„ μœ„ν•΄μ„œ ν•™μŠ΅ν•˜λŠ” λ°©μ‹μž…λ‹ˆλ‹€. 이도 전이 ν•™μŠ΅μ΄λΌ ν•  수 μžˆμ§€λ§Œ, μš°λ¦¬λŠ” ν…ŒμŠ€ν¬μ—μ„œ λ‹€λ₯Έ ν…ŒμŠ€ν¬λ₯Ό 닀루고 μžˆμŠ΅λ‹ˆλ‹€.

Learning Theoretic

이 접근은 μœ„μ—μ„œμ˜ λͺ¨λ“  방식을 μ•½κ°„μ”© μ‚¬μš©ν•œ μ ‘κ·Όμž…λ‹ˆλ‹€. μΌλ°˜ν™”ν•  수 μžˆλŠ” μ„±λŠ₯을 보μž₯ν•˜λŠ”λ° μ΄ˆμ μ„ 두고 μžˆμŠ΅λ‹ˆλ‹€. μ΄λŠ” λͺ¨λΈκ³Ό ν…ŒμŠ€ν¬μ— λŒ€ν•΄μ„œ μ œν•œμ„ 두어 닀루기 νž˜λ“  계산을 ν”Όν–ˆμŠ΅λ‹ˆλ‹€. μš°λ¦¬λŠ” μ΄λŸ¬ν•œ 것과 μœ μ‚¬ν•˜λ˜ 보닀 μ‹€μš©μ μΈ 접근을 ν•˜κ³ μž ν•©λ‹ˆλ‹€.

METHOD

μš°λ¦¬λŠ” 문제λ₯Ό λ‹€μŒκ³Ό 같이 μ •μ˜ν•©λ‹ˆλ‹€. μš°λ¦¬λŠ” RR μ΄λΌλŠ” 라벨 μ œν•œμ„ 두고 (데이터 μ…‹ μ–‘μ˜ μ œν•œμ„ 두고) T=[t1,...,tn]T = [t_1, ... , t_n] ν…ŒμŠ€ν¬μ— λŒ€ν•΄ 전체적은 μ„±λŠ₯을 μ΅œλŒ€ν™”ν•˜λŠ”λ° λͺ©μ μ„ λ‘‘λ‹ˆλ‹€. RRμ΄λΌλŠ” 데이터 μ…‹ 양은 μ‚¬μš© ν…ŒμŠ€ν¬μ— 따라 μ΅œλŒ€ 양이 μ •ν•΄μ§ˆ 수 μžˆμŠ΅λ‹ˆλ‹€. V= S⋃\bigcupT 이며 TλŠ” μš°λ¦¬κ°€ ν’€κ³ μž ν•˜λŠ” ν…ŒμŠ€ν¬μ΄κ³  SλŠ” ν•™μŠ΅ν•  수 μžˆλŠ” Sourceμž…λ‹ˆλ‹€. κ·ΈλŸ¬λ―€λ‘œ T - T β‹‚\bigcapSλŠ” μš°λ¦¬κ°€ ν•™μŠ΅ν•  수 μ—†λŠ” νƒ€μΌ“λ§Œμ΄ μ‘΄μž¬ν•˜λ©° S-Tβ‹‚\bigcapSλŠ” μ†ŒμŠ€λ§Œμ΄ μ‘΄μž¬ν•©λ‹ˆλ‹€. μ΄λŠ” μ§μ ‘μ μœΌλ‘œ ν•΄λ‹Ή ν…ŒμŠ€ν¬λ₯Ό ν•΄κ²°ν•  μˆ˜λŠ” μ—†μ§€λ§Œ, T의 μ„±λŠ₯을 올리기 μœ„ν•΄μ„œ μ‚¬μš©κ°€λŠ₯ν•©λ‹ˆλ‹€.

task taxonomy(ν…ŒμŠ€ν¬ λΆ„λ₯˜, taskonomy)λŠ” κ³„μ‚°μ μœΌλ‘œ ν…ŒμŠ€ν¬ 전이성을 ν¬μ°©ν•˜μ—¬ κ·Έλž˜ν”„λ‘œ ν‘œν˜„ν•©λ‹ˆλ‹€. μ†ŒμŠ€ ν…ŒμŠ€ν¬μ™€ νƒ€κ²Ÿ ν…ŒμŠ€ν¬μ˜ 사이 μ—£μ§€λŠ” 관련성을 λ‚˜νƒ€λ‚΄λ©° μ΄κ²ƒμ˜ κ°€μ€‘μΉ˜λŠ” ν•΄λ‹Ή μž‘μ—…μ˜ μ˜ˆμΈ‘μž…λ‹ˆλ‹€. μš°λ¦¬λŠ” μ΄λŸ¬ν•œ μ—£μ§€λ₯Ό 전체적인 선택적 전이λ₯Ό μΈ‘μ •ν•˜κΈ° μœ„ν•΄ μ‚¬μš©ν•©λ‹ˆλ‹€. λΆ„λ₯˜λŠ” μ§€λ„ν•™μŠ΅ μ–‘, task 선택, μ „μ΄μˆœμ„œ, 전이 ν•¨μˆ˜μ˜ ν‘œν˜„μ— 따라 κ·Έλž˜ν”„μ™€ νŒŒλΌλ―Έν„°λ₯Ό ν‘œν˜„ν•©λ‹ˆλ‹€.

511

TaxonomyλŠ” 4κ°€μ§€ 단계λ₯Ό 톡해 λ§Œλ“€μ–΄μ§‘λ‹ˆλ‹€.

  1. 각각의 μ†ŒμŠ€ ν…ŒμŠ€ν¬μ—μ„œ networkλ₯Ό ν•™μŠ΅ν•©λ‹ˆλ‹€.
  2. κ°€λŠ₯ν•œ λͺ¨λ“  μ†ŒμŠ€μ™€ νƒ€κ²Ÿ ν…ŒμŠ€ν¬ κ°„ 전이 ν•™μŠ΅μ„ μ§„ν–‰ν•©λ‹ˆλ‹€. 이 λ•Œ 인풋 μ†ŒμŠ€λ‘œ μ—¬λŸ¬κ°€μ§€λ₯Ό μˆœμ„œμ— 따라 μ‚¬μš©ν•˜μ—¬ μ§„ν–‰ν•©λ‹ˆλ‹€.
  3. 전이 ν•™μŠ΅μœΌλ‘œ λΆ€ν„° μ–»μ–΄μ§„ ν…ŒμŠ€ν¬ μ„ ν˜Έ 값은 μ •κ·œν™”λ©λ‹ˆλ‹€.
  4. 전이 ν•™μŠ΅μœΌλ‘œ 졜고둜 μ΅œμ ν™”ν•  수 μžˆλŠ” κ·Έλž˜ν”„λ₯Ό μƒμ„±ν•΄λƒ…λ‹ˆλ‹€.

Task Dictionary

우리의 ν…ŒμŠ€ν¬ 맡핑은 26개의 ν…ŒμŠ€ν¬λ‘œ λΆ€ν„° μƒμ„±λ˜μ–΄μ§‘λ‹ˆλ‹€. μ΄λŠ” ν…ŒμŠ€ν¬μ— λŒ€ν•œ ν‘œν˜„ 곡간을 μ˜λ―Έν•©λ‹ˆλ‹€. μš°λ¦¬λŠ” ν…ŒμŠ€ν¬μ—μ„œ λ‹€μ–‘ν•œ ν‘œν˜„ 값을 μ–»κ²Œ λ©λ‹ˆλ‹€. μš°λ¦¬λŠ” μ΄λŸ¬ν•œ ν‘œν˜„ 값이 전체 곡간이 μ•„λ‹Œ μ‹œκ°μ μΈ λ°€μ§‘λœ κ³΅κ°„μ—μ„œ μƒ˜ν”Œλ§λœ κ°’μ΄λΌλŠ” 것을 μ•Œμ•„μ•Ό ν•©λ‹ˆλ‹€. μ΄λŸ¬ν•œ λ°€μ§‘λœ κ³΅κ°„μ—μ„œ μΆœλ°œν•œ ν•™μŠ΅μ€ 보닀 μœ λ¦¬ν•  수 μžˆλ‹€λŠ” κ°€μ •μž…λ‹ˆλ‹€. 더 쒋은 μƒ˜ν”Œλ§μΌ 수둝 더 쒋은 μΌλ°˜ν™”λ₯Ό κ°€μ§‘λ‹ˆλ‹€.

Dataset

μš°λ¦¬λŠ” μ΄λ―Έμ§€μ—μ„œ λͺ¨λ“  ν…ŒμŠ€ν¬μ— λŒ€ν•œ 라벨 값이 μžˆλŠ” 데이터 셋을 μ‚¬μš©ν•©λ‹ˆλ‹€. 같은 데이터 셋을 ν•  경우 μ—¬λŸ¬ κ°€μ§€ κ³ μ •λœ ν™˜κ²½μ—μ„œ μ‹€ν—˜μ„ ν•  수 μžˆκΈ°μ— ν…ŒμŠ€ν¬ κ°„ 전이 ν•™μŠ΅μ— λŒ€ν•œ κ²°κ³Όλ₯Ό μ •ν™•νžˆ μ•Œ 수 μžˆμŠ΅λ‹ˆλ‹€. μ§€κΈˆκΉŒμ§€ μ΄λŸ¬ν•œ 데이터 μ„ΈνŠΈλŠ” μ—†μ—ˆκΈ° λ•Œλ¬Έμ— μš°λ¦¬λŠ” 600개의 건물에 λŒ€ν•΄μ„œ 4백만μž₯의 이미지λ₯Ό μƒμ„±ν–ˆμŠ΅λ‹ˆλ‹€. 라벨 값을 μ£ΌκΈ° μœ„ν•΄ μ—¬λŸ¬ νˆ΄μ„ μ‚¬μš©μ„ ν–ˆκ³ , μ΄λŠ” μ‚¬λžŒμ΄ 라벨링 ν•œ κ²ƒμ—μ„œ 7%미만의 였λ₯˜λ₯Ό λ³΄μ˜€μŠ΅λ‹ˆλ‹€.

Task-speciifc Modeling

μš°λ¦¬λŠ” 각각의 ν…ŒμŠ€ν¬μ— λŒ€ν•΄ 지도 ν•™μŠ΅μ„ μ§„ν–‰ν•©λ‹ˆλ‹€. ν…ŒμŠ€ν¬ νŠΉμ • λ„€νŠΈμ›Œν¬λŠ” 인코더와 디코더 ꡬ쑰λ₯Ό κ°€μ§‘λ‹ˆλ‹€. μΈμ½”λ”λŠ” μΆ©λΆ„νžˆ κ°•λ ₯ν•œ representation을 μΆ”μΆœν•˜κ³  λ””μ½”λ”λŠ” μΈμ½”λ”λ³΄λ‹€λŠ” μž‘μ§€λ§Œ 쒋은 μ„±λŠ₯을 λ‚΄κΈ° μœ„ν•΄ μΆ©λΆ„ν•©λ‹ˆλ‹€.

Transfer Modeling

321

μ£Όμ–΄μ§„ sourceλ‘œλΆ€ν„° ν•™μŠ΅ν•œ representation을 ν†΅ν•˜μ—¬ target에 ν•΄λ‹Ήν•˜λŠ” taskλ₯Ό μ˜ˆμΈ‘ν•˜κΈ° μœ„ν•΄ ν•™μŠ΅μ„ μ§„ν–‰ν•©λ‹ˆλ‹€. 이 λ•Œ target에 ν•΄λ‹Ήν•˜λŠ” taskλ₯Ό μ˜ˆμΈ‘ν•˜κΈ° μ–΄λ ΅λ‹€λ©΄ source와 target task의 관련성은 적닀고 λ³Ό 수 μžˆμŠ΅λ‹ˆλ‹€. μš°λ¦¬λŠ” 이처럼 λͺ¨λ“  source와 target 쑰합을 μ΄μš©ν•˜μ—¬ 전이 ν•™μŠ΅μ„ μ§„ν–‰ν•©λ‹ˆλ‹€.

322

- Accessibility : 전이 ν•™μŠ΅μ„ μ„±κ³΅μ‹œν‚€κΈ° μœ„ν•΄ μΈμ½”λ”λŠ” 이미지λ₯Ό μΆ©λΆ„νžˆ ν‘œν˜„ν•œ representation을 λ‚˜νƒ€λ‚΄μ•Ό ν•©λ‹ˆλ‹€. 그리고 ν•™μŠ΅λœ ν‘œν˜„μ΄ 라벨값에 맞좰 잘 κ°€λŠ”μ§€ μΈ‘μ •ν•˜κΈ° μœ„ν•΄ λ””μ½”λ”λŠ” μž‘μ€ ꡬ쑰λ₯Ό 채택해야 ν•˜λ©° ν•™μŠ΅ν•˜λŠ”λ° 적은 데이터λ₯Ό μ‚¬μš©ν•΄μ•Ό ν•˜λŠ” μ΄μœ μž…λ‹ˆλ‹€. - Higher-Order Transfoers : source tasksκ°€ μ—¬λŸ¬κ°œλ₯Ό μ‚¬μš©ν•˜μ—¬ target taskλ₯Ό ν•΄κ²°ν•  수 μžˆμŠ΅λ‹ˆλ‹€. μš°λ¦¬λŠ” κ³ μ°¨μ›μ˜ 전이 ν•™μŠ΅μ„ μ‚¬μš©ν•˜κ²Œ λ©λ‹ˆλ‹€. κ³ μ°¨μ›μ˜ 전이 ν•™μŠ΅ μ‹œ μ‘°ν•©μ˜ μˆ˜λŠ” 정말 λ§ŽμŠ΅λ‹ˆλ‹€. Taskκ°€ 25개 그리고 2κ°œμ”©μ˜ μ‘°ν•©λ§Œμ„ μ„ νƒν•œλ‹€ ν•˜μ—¬λ„ 25C2 = 300개 이며 target에 λŒ€ν•œ task 22개일 μ‹œ 총 6600개의 쑰합을 μ‹œλ„ν•΄μ•Ό ν•©λ‹ˆλ‹€. λ¬Όλ‘  전체 쑰합을 κ³ λ €ν•˜λŠ” 것이 쒋은 κ²°κ³Όλ₯Ό λ‚΄κ² μ§€λ§Œ μ΄λŠ” λ„ˆλ¬΄λ‚˜ λ§Žμ€ 연산을 μ†Œλͺ¨ν•˜κ²Œ λ©λ‹ˆλ‹€. μš°λ¦¬λŠ” beam searchλ₯Ό μ‚¬μš©ν•©λ‹ˆλ‹€. beam search의 orderλ₯Ό k<5둜 μ„€μ •ν•  경우 μš°λ¦¬λŠ” μ €μ°¨μ›μ˜ 전이 ν•™μŠ΅μ„ μ‚¬μš©ν–ˆμ„ λ•Œ κ°€μž₯ μ„±λŠ₯이 쒋은 5개λ₯Ό μ„ μ •ν•˜μ—¬ 이 5개의 λŒ€ν•œ μˆœμ„œ 쑰합을 ν†΅ν•œ μ‹€ν—˜μ„ μ§„ν–‰ν•©λ‹ˆλ‹€. 예λ₯Ό λ“€μ–΄ AλΌλŠ” νƒ€κ²Ÿ ν…ŒμŠ€ν¬κ°€ 있고, A에 λŒ€ν•΄μ„œ S, X, K, L, G ν…ŒμŠ€ν¬κ°€ μ„±λŠ₯이 μ’‹μ•˜μ„ λ•Œ 이 5κ°€μ§€μ˜ μˆœμ„œλ₯Ό μ‘°ν•©ν•˜μ—¬ μ§„ν–‰ν•©λ‹ˆλ‹€. 그리고 S β†’ A 보닀 Kβ†’Sβ†’Aκ°€ μ„±λŠ₯이 쒋을 μˆ˜λ„ 있기 λ•Œλ¬Έμ— μˆœμ„œλ₯Ό κ³ λ €ν•˜λ©° 쑰합을 ν•˜λŠ” μ‹€ν—˜μ„ μ§„ν–‰ν•©λ‹ˆλ‹€.

Ordinal Normalization using Analytic Hierarchy Process (AHP)

각각의 ν…ŒμŠ€ν¬ 간에 전이에 λŒ€ν•œ κ΄€λ ¨μ„± 행렬을 μ–»κ³ μž ν•©λ‹ˆλ‹€. ν…ŒμŠ€ν¬μ— λŒ€ν•˜μ—¬ Lossλ₯Ό ν†΅ν•˜μ—¬ 이λ₯Ό μ‚°μ •ν•˜λŠ” 것은 ν…ŒμŠ€ν¬ κ°„ 곡간에 λ”°λ₯Έ νŠΉμ΄μ„±μ΄ μ‘΄μž¬ν•˜κΈ° λ•Œλ¬Έμ— ν…ŒμŠ€ν¬ κ°„ 비ꡐ할 μ‹œ μ ν•©ν•˜μ§€ μ•ŠμŠ΅λ‹ˆλ‹€. κ·Έλž˜μ„œ μ μ ˆν•œ μ •κ·œν™”κ°€ ν•„μš”ν•©λ‹ˆλ‹€. κ°„λ‹¨ν•œ 방식은 μŠ€μΌ€μΌμ„ [0,1]의 λ‹¨μœ„λ‘œ λ³€κ²½ν•˜λŠ” κ²ƒμž…λ‹ˆλ‹€. κ·ΈλŸ¬λ‚˜ 이 접근은 μ‹€μ œ 좜λ ₯물의 κ²°κ³Όκ°€ λ‘œμŠ€μ™€λŠ” λ‹€λ₯Έ κ°œμ„  속도가 있기 λ•Œλ¬Έμ— μ‹€νŒ¨ν•˜μ˜€μŠ΅λ‹ˆλ‹€. λ‘œμŠ€μ™€ 퀄리티에 λŒ€ν•œ κ΄€κ³„λŠ” μ•Œ 수 μ—†κΈ° λ•Œλ¬Έμ— μ΄λŸ¬ν•œ μ •κ·œν™”λŠ” νš¨κ³Όκ°€ μ—†μ—ˆμŠ΅λ‹ˆλ‹€.

329

λŒ€μ‹ , μš°λ¦¬λŠ” 각각의 source i, j둜 λΆ€ν„° ν•™μŠ΅μ„ μ§„ν–‰ν•œ 결과값에 λŒ€ν•˜μ—¬ 데이터 λ§ˆλ‹€ μ–΄λŠ 것이 μ„±λŠ₯이 더 μ’‹μ•˜λŠ”μ§€μ— λŒ€ν•΄ λΉ„μœ¨μ„ μ‚°μ •ν•˜μ—¬ μ–΄λ–€ sourceκ°€ 더 쒋은지 μΈ‘μ •ν•©λ‹ˆλ‹€. μ΅œμ’…μ μΈ taskκ°„ affine 행렬은 μ•„λž˜μ™€ 같이 μ •μ˜λ©λ‹ˆλ‹€.

467

각각의 μ†ŒμŠ€ taskλ₯Ό νƒ€κ²Ÿ task와 연산을 ν•˜κ³  λͺ¨λ“  μ†ŒμŠ€μ— λŒ€ν•΄μ„œ 계산을 ν•˜κ³  이λ₯Ό 행을 μŒ“μ•„ 올리면 μœ„μ™€ 같은 ν–‰λ ¬ 값이 λ‚˜μ˜€κ²Œ λ©λ‹ˆλ‹€. μ΄λŠ” κ²½μ˜κ³Όν•™μ—μ„œ ν”νžˆ μ‚¬μš©λ˜λŠ” Analytic Hierarchy Process(AHP)μ—μ„œ μ°©μ•ˆν–ˆλ‹€κ³  ν•©λ‹ˆλ‹€. μœ„ μ‚¬μ§„μ˜ 였λ₯Έμͺ½μ΄ AHPλ₯Ό μ μš©ν•œ ν–‰λ ¬κ°’μž…λ‹ˆλ‹€. μœ„μ—μ„œμ˜ 그림은 저차원에 λŒ€ν•΄μ„œλ§Œ μˆ˜ν–‰μ„ ν•œ 것이고

538

μ΄λŠ” μ—¬λŸ¬κ°œμ˜ μˆœμ„œ 쌍 쑰합을 ν†΅ν•˜μ—¬ λ‚˜νƒ€λ‚Έ ν–‰λ ¬ κ°’μž…λ‹ˆλ‹€.

Computing the Global Taxonomy

μœ„μ—μ„œμ˜ μ£Όμ–΄μ§„ 행렬을 μ΄μš©ν•˜μ—¬ μš°λ¦¬λŠ” ν…ŒμŠ€ν¬μ— λŒ€ν•΄μ„œ μ „μ²΄μ μœΌλ‘œ μ„±λŠ₯을 κ·ΉλŒ€ν™”ν•˜λ©° 지도 ν•™μŠ΅μ„ μ΅œμ†Œν™”ν•˜κΈ° μœ„ν•΄μ„œ 전이 ν•™μŠ΅ λ„μ•ˆμ„ κ³ μ•ˆν•΄μ•Όν•©λ‹ˆλ‹€. 이 λ¬Έμ œλŠ” λ…Έλ“œμ™€ μ—£μ§€λ₯Ό 톡해 κ·Έλž˜ν”„λ‘œ ν‘œν˜„ κ°€λŠ₯ν•©λ‹ˆλ‹€. μš°λ¦¬λŠ” 이것을 톡해 νŠΉμ • νƒ€κ²Ÿ ν…ŒμŠ€ν¬μ˜ μ„±λŠ₯을 높이기 μœ„ν•΄ 졜적의 전이 ν•™μŠ΅ 방식을 찾을 수 μžˆμŠ΅λ‹ˆλ‹€. μš°λ¦¬λŠ” 이것을 Boolean Integer Programming(BIP)을 μ‚¬μš©ν•©λ‹ˆλ‹€. κ°€μž₯ μ„±λŠ₯이 쒋은 μˆœμ„œλ₯Ό μ΄μš©ν•˜μ—¬ λ…Έλ“œκ°„μ˜ 연결을 ν‚€κ³  λ‚˜λ¨Έμ§€λŠ” λ„λŠ” 방식을 톡해 κ·Έλž˜ν”„λ₯Ό μ œμž‘ν•©λ‹ˆλ‹€.

EXPERIMENTS

26개의 ν…ŒμŠ€ν¬ (4κ°œλŠ” source둜만 μ‚¬μš©), 26개의 νŠΉμ • ν…ŒμŠ€ν¬ λ„€νŠΈμ›Œν¬μ™€ 2225 전이 ν•™μŠ΅ λ„€νŠΈμ›Œν¬ 그리고 2225Ck의 고차원 전이 ν•™μŠ΅μ„ ν†΅ν•˜μ—¬ μƒμ„±ν–ˆμŠ΅λ‹ˆλ‹€. 전이 ν•™μŠ΅ 방식은 3000개 μ•ˆμͺ½μœΌλ‘œ λ˜μ—ˆμœΌλ©° 총 47,886 GPU μ‹œκ°„μ„ μΌμŠ΅λ‹ˆλ‹€. (μ•½ 2000일)

인코더 κ΅¬μ‘°λŠ” 풀링 없이 ResNet-50을 κΈ°λ°˜μž…λ‹ˆλ‹€. λͺ¨λ“  전이 ν•™μŠ΅ κ΅¬μ‘°λŠ” 얇은 2개의 convolution layers둜 μ§„ν–‰λ©λ‹ˆλ‹€. λ””μ½”λ”μ˜ κ΅¬μ‘°λŠ” taskλ§ˆλ‹€ μƒμ΄ν•œν…Œ ν”½μ…€λ§ˆλ‹€ 예츑이 ν•„μš”ν•œ κ²½μš°λŠ” 15개의 conv layerλ₯Ό μ‚¬μš©ν•©λ‹ˆλ‹€. μ €μ°¨μ›μ˜ taskλŠ” 2~3개의 FC layerλ₯Ό μ‚¬μš©ν•©λ‹ˆλ‹€. 각각의 μ§€λ„ν•™μŠ΅λœ λ„€νŠΈμ›Œν¬κ°€ μ–Όλ§ˆλ‚˜ 잘 representation을 λ§Œλ“€μ—ˆλŠ”μ§€ ν™•μΈν•˜κΈ° μœ„ν•˜μ—¬ 각각 λ„€νŠΈμ›Œν¬μ˜ μ„±λŠ₯은 μ•„λž˜μ™€ κ°™μŠ΅λ‹ˆλ‹€.

480

### Evaluation of Computed Taxonomies

313

κ·Έλž˜ν”„μ˜ λ‚˜μ˜€λŠ” μ‹œκ°ν™”μ— λ”°λΌμ„œ 전이 ν•™μŠ΅ μˆœμ„œλ₯Ό λ§€μΉ­ν•˜μ—¬ ν•™μŠ΅ν•œλ‹€λ©΄ 졜고의 κ²°κ³Όλ₯Ό μ‚°μΆœν•΄λ‚Ό 수 있게 λœλ‹€.

246

GAIN : νŠΉμ • ν…ŒμŠ€ν¬ 지도 ν•™μŠ΅ 결과에 λŒ€ν•΄μ„œ 이긴 λΉ„μœ¨ ( 데이터 μ…‹ 1.6만 )

QUALITY : νŠΉμ • ν…ŒμŠ€ν¬ 지도 ν•™μŠ΅ 결과에 λŒ€ν•΄μ„œ 이긴 λΉ„μœ¨ ( 데이터 μ…‹ 12만 )

λ‘˜ λ‹€ 0.5μ΄μƒμ˜ 수치λ₯Ό 기둝할 경우 전이 ν•™μŠ΅μ΄ μ™„μ „ 지도 ν•™μŠ΅λ³΄λ‹€ μ„±λŠ₯이 쒋은 것을 λ‚˜νƒ€λ‚Έλ‹€. λ˜ν•œ Source와 order의 μˆ˜μΉ˜κ°€ 증가할 수둝 μ„±λŠ₯이 λ†’μ•„μ§€λŠ” κ²½ν–₯이 μžˆλŠ”λ° μ΄λŠ” 전이 ν•™μŠ΅μ„ 많이 ν• μˆ˜λ‘ 쒋은 κ²°κ³Όλ₯Ό λ‚˜νƒ€λƒ„μ„ 보인닀. 그리고 Qualityμ—μ„œλŠ” 지도 ν•™μŠ΅μ˜ μ„±λŠ₯이 더 쒋은 κ²½μš°κ°€ λ§Žμ€λ° μ΄λŠ” 데이터 μ…‹μ˜ ν•™μŠ΅λŸ‰μ΄ λ§Žμ•„μ„œ 이기 λ•Œλ¬Έμ΄λ‹€.

Significance Test of the Structure

341

Taskonomyμ—μ„œ μ œμ‹œν•˜λŠ” 전이 ν•™μŠ΅ 방식을 λ”°λ₯Έ 것이 μ΄ˆλ‘μƒ‰ μ„  랜덀으둜 전이 ν•™μŠ΅μ„ μ§„ν–‰ν•œ 것이 μ•„λž˜ μžˆλŠ” νšŒμƒ‰μ„ μ΄λ‹€. μ΄λŠ”, taskonomyμ—μ„œ μ œμ‹œν•˜λŠ” μˆœμ„œκ°€ 더 μ’‹μŒμ„ μž…μ¦ν•˜λ©° ν…ŒμŠ€ν¬κ΄€ 관계성이 μžˆλ‹€λŠ” 것을 보여쀀닀.

μš°λ¦¬λŠ” μ—¬λŸ¬κ°€μ§€ 방식을 고정해놓고 μ‹€ν—˜μ„ μ§„ν–‰ν–ˆλ‹€. κ·ΈλŸ¬λ‚˜ μ΄λŸ¬ν•œ λ°©μ‹μ—μ„œλ§Œ Taskonomy의 방법둠이 ν†΅ν•˜λŠ”μ§€ ν™•μΈν•˜κΈ° μœ„ν•˜μ—¬ μ•„λž˜μ™€ 같은 것듀을 λ°”κΎΈμ—ˆμœΌλ‚˜ μš°λ¦¬κ°€ 보여쀀 결과와 μœ μ‚¬ν•˜κ²Œ λ‚˜μ™”λ‹€.

I. architecture of task-specific networks

II. architecture of transfer function networks

III. amount of data available for training transfer networks

IV. datasets

V. data splits

VI. choice of dictionary

330

κ·Έλž˜ν”„κ°€ μ•„λ‹Œ λ‚˜λ¬΄κΈ°λ°˜ λͺ¨ν˜•μœΌλ‘œ ν‘œν˜„μ„ ν•˜μ˜€κ³  μ΄λŠ” μš°λ¦¬κ°€ λ³Έ 결과와 μœ μ‚¬ν•©λ‹ˆλ‹€.

Limitations and Discussion

Model Dependence

μš°λ¦¬λŠ” κ³ μ •λœ λͺ¨λΈκ³Ό κ³ μ •λœ 데이터 셋에 ν•œμ •μ„ μ§€μ–΄ μ‹€ν—˜μ„ μˆ˜ν–‰ν•˜μ˜€κΈ° λ•Œλ¬Έμ—, μ΄λŠ” λ‹€λ₯Έ 쑰건 μƒν™©μ—μ„œλ„ μœ μ‚¬ν•œ 결둠이 λ‚˜μ˜¬μ§€ 확인해야 ν•©λ‹ˆλ‹€.

Compositionality

μš°λ¦¬κ°€ μˆ˜ν–‰ν•œ ν…ŒμŠ€ν¬λŠ” μ‚¬λžŒμ΄ μ •μ˜ν•œ ν…ŒμŠ€ν¬μ— ν•œμ •λ˜μ–΄ μžˆμŠ΅λ‹ˆλ‹€. μƒˆλ‘œμš΄ μ„œλΈŒ ν…ŒμŠ€ν¬μ—μ„œλ„ 톡할지 확인해야 ν•©λ‹ˆλ‹€. λ˜ν•œ, ν…ŒμŠ€ν¬ κ°„μ˜ κ²°ν•©μœΌλ‘œ μƒˆλ‘œμš΄ ν…ŒμŠ€ν¬κ°€ λ‚˜μ˜¬ μˆ˜λ„ μžˆμŠ΅λ‹ˆλ‹€.

Space Regularity

μš°λ¦¬λŠ” ν…ŒμŠ€ν¬λ₯Ό μƒ˜ν”Œλ§ν•˜μ—¬ 결과에 μ΄μš©ν–ˆλŠ”λ°, 더 넓은 κ³΅κ°„μ—μ„œμ˜ μƒ˜ν”Œλ§μ„ ν–ˆμ„ λ•Œλ„ κ²°κ³Όκ°€ κ·ΈλŒ€λ‘œ λ‚˜μ˜¬μ§€ 확인해야 ν•©λ‹ˆλ‹€.

Transferring to Non-visual and Robotic Tasks

λͺ¨λ“  μ‹€ν—˜μ€ μ΄λ―Έμ§€μ—μ„œλ§Œ μ΄λ£¨μ–΄μ‘Œκ³  λ‹€λ₯Έ μ‹œκ°μ μ΄μ§€ μ•Šμ€ λΆ„μ•Όμ—μ„œλ„ 톡할지 확인해야 ν•©λ‹ˆλ‹€.

Lifelong Learning

κ³„μ†ν•΄μ„œ λ°œμ „ν•΄λ‚˜κ°€κ³  μžˆλŠ” μƒν™©μ—μ„œ Taskonomyκ°€ μ–Έμ œκΉŒμ§€ 톡할지 생각해야 ν•©λ‹ˆλ‹€.


πŸ”— κ΄€λ ¨ κΈ€

0개의 λŒ“κΈ€