π λ³Έ κΈμ 2023.07 μ μμ±ν paper reviewλ₯Ό λ€λ¬μ΄ λ°νν μμΉ΄μ΄λΈ κΈμ λλ€.
μμ± λΉμ 컨ν μ€νΈ: X:AI 4κΈ° Adv
μλ³Έ λ Όλ¬Έ: https://arxiv.org/abs/1804.08328
μ»΄ν¨ν° λΉμ Ό ν μ€ν¬λ μλ‘ κ΄λ ¨μ΄ μμκΉ? μλ₯Ό λ€μ΄ surface normal taskλ depth imageμ κ΄λ ¨μ΄ μμκΉμ? μ§κ΄μ μΌλ‘ κ΄λ ¨μ΄ μμ κ²μΌλ‘ 보μ λλ€. κ·Έλ¦¬κ³ μ΄λ λΉμ Ό ν μ€ν¬κ° ꡬ쑰μμ κ΄λ ¨μ΄ μμ κ² κ°μ΅λλ€. μ΄λ¬ν κ΄λ ¨μ μ μ΄ νμ΅μμ μλΉν κ°μΉκ° μμ΅λλ€. κ΄λ ¨μ΄ μλ€λ©΄ νμ΅ν κ²μ μ¬μ¬μ©νλ©° 볡μ‘μ±μ μ€μΌ μ μμ΅λλ€.
μ°λ¦¬λ λΉμ Ό ν μ€ν¬μμμ κ΄κ³ ꡬ쑰λ₯Ό 보μ¬μ£Όκ³ μ ν©λλ€. μ΄λ μ μ΄ νμ΅μμ μ΄λ£¨μ΄μ§λ©° 2D, 2.5D, 3Dκ·Έλ¦¬κ³ semantic segmentationκ³Ό κ°μ 26κ°μ§μ ν μ€ν¬λ₯Ό μ΄ν΄λ΄ λλ€. ν μ€ν¬κ° κ΄κ³λ₯Ό νμ νλ€λ©΄ νμ΅μ νμν λΌλ²¨κ°μ νκΈ°μ μΌλ‘ μ€μΌ μ μμ κ²μ λλ€. μ°λ¦¬λ 10κ°μ ν μ€ν¬μ λν΄μ μ μ΄ νμ΅μ΄ μ΄μ λ¨λ νμ΅λ³΄λ€ 3λΆμ 2μ λμ λ°μ΄ν°κ° νμν κ²μ μ¦λͺ νμ΅λλ€. μ°λ¦¬λ ν μ€ν¬ κ΄ κ΄κ³λ₯Ό λ³Ό μ μλ λ°©μκ³Ό μ μ λ€μ΄ νμ΅νλλ° κ³ λ €νλλ° λ³Όλ²ν taxonomical ꡬ쑰λ₯Ό μ μν©λλ€.
κ°μ²΄ μΈμ, κΉμ΄ μΆμ , κ°μ₯μ리 νμ§, ν¬μ¦ μΆμ λ± μ¬λ¬ λΉμ Ό ν μ€ν¬λ μ μ©ν©λλ€. μ΄λ€ μ€ λͺλͺμ νμ€ν κ΄κ³λ₯Ό κ°μ§κ³ μμ΅λλ€. μ°λ¦¬λ surface normalμ κΉμ΄ μΆμ μ κ΄λ ¨μ΄ μκ³ vanising pointλ λ°©ν₯ νμ§μ μ μ©νλ€κ³ μκ°ν©λλ€. λ€λ₯Έ λΉμ Ό ν μ€ν¬μμλ λΉμ·ν κ΄λ ¨μ΄ μλ€κ³ μ¬κ²¨μ§λλ€.
μ»΄ν¨ν° λΉμ Ό λΆμΌμμλ μ΄λ¬ν κ΄κ³μ λν΄μ λͺ μμ μΌλ‘ μ¦λͺ νμ§λ μμμ΅λλ€. μ°λ¦¬λ κΈ°κ³ νμ΅ λΆμΌμμ λ§μ μ§μ μ μ΄λ£¨μκ³ νΈλ μ΄λ λ°μ΄ν°λ₯Ό νμ΅νμ¬ λ³΅μ‘ν λ§€νμ μ°Ύμλ΄μ΄ μμΈ‘μ μ§νν©λλ€. μ΄λ supervised-learning μ§λ νμ΅μ΄λΌ νλ©° ν ν μ€ν¬μ λν΄μλ§ μ§νλκΈ°λ ν©λλ€. μ΄λ°ν λ¨λ νμ΅μ μλ‘μ΄ ν μ€ν¬μ λν΄ μ²μλΆν° λ€μ νμ΅ μμΌμΌ νλ€λ λ¨μ μ΄ μ‘΄μ¬νλ©° ν μ€ν¬ λ§λ€μ λ§μ λ°μ΄ν°λ₯Ό μꡬνκ² λ©λλ€.
ν μ€ν¬μμμ κ΄κ³λ₯Ό μ΄μ©νλ€λ©΄ λͺ¨λΈμ μ μ λΌλ²¨κ³Ό μ μ μ°μ°λμ μꡬνλ©° μ’μ λ°©ν₯μΌλ‘ νμ΅νκ² λ©λλ€. ν΅ν© λͺ¨λΈμ λ€μν ν μ€ν¬λ₯Ό ν΄κ²°ν μ μλ ν¨μ¨μ μ΄κ³ μ λ°μ μΈ λͺ¨λΈμ λλ€. κ·Έλ¬λ ν μ€ν¬μ λν μ΄ν΄λ μμ§ μ λͺ¨λ¦ λλ€. ν μ€ν¬ κ΄κ³μ¦λͺ μ μ€μνλ©° νμ΅ λ° μ΅μ νλ₯Ό ν΅νμ¬ μ΄λ₯Ό μ°Ύμλ΄λ κ²μ 볡μ‘ν©λλ€.

μ°λ¦¬λ νλμ ν μ€ν¬λ₯Ό νμ΅νλ° μ°μΈ representationμ΄ λ€λ₯Έ ν μ€ν¬μ κ²°κ³Όλ¬Όμ λμΆνλλ° μΌλ§λ μ μ©νμ§μ λν΄ νλ ¬μ κ³μ°ν©λλ€. μ΄λ¬ν λ°©μμ λ¨λ νμ΅λ³΄λ€ λ€λ₯Έ ν μ€ν¬μμ νμ΅ν κ²μ κΈ°λ°μΌλ‘ νκΈ° λλ¬Έμ ν΄λΉ ν μ€ν¬μμ λ°μ΄ν°λ₯Ό λ μꡬν μ μκ² λ©λλ€.
representation-basedμ fully-computationalκΈ°λ°μ΄λ―λ‘ κ°μ μ νΌν μ μμ΅λλ€. κ°μ μ΄ μλ κ²μ μ¬λμ μ견μ΄λ λΆμμ μΈ μ§μμ΄ λ€μ΄κ°μ§ μκΈ° λλ¬Έμ μ€μν μ μ λλ€. μλ₯Ό λ€μ΄ μ°λ¦¬λ κΉμ΄ μΆμ μ΄ νλ©΄ μΆμΆκ³Ό κ°μ κ³³μ λμμ΄ λ κ²μ΄λΌ μ¬κΈΈ μ μμμ§λΌλ μ¬μ κ°μ μ΄ μμΌλ©΄ μ»΄ν¨ν°μ κ³μ°μ μν΄ λμ± μ’μ λ°©ν₯μ μ°Ύμλ λλ€.
μμ¦ μ¬μ©νλ κΈ°μ μ νλ§μ΄ μ£Όμ₯νλ νμ΅λ°©μμΈ μ΄μ μ€ν μ΄μ§μμ κ²°κ³Όλ¬Όμ ν λλ‘ νμ΅ν΄μ λμκ°λ λ°©μμ΄ λ°μ λμ΄ μμ΅λλ€. μ°λ¦¬λ μ΄λ¬ν ꡬ쑰λ₯Ό μ°Ύκ³ μ νμ΅λλ€. μ°λ¦¬κ° νκ³ μ νλ κ²μ λ€μν λΆμΌμ κ΄λ ¨μ΄ μμ΅λλ€.
Self-supervised learning
μκΈ° μ§λ νμ΅μ μλμ μΌλ‘ μΌ ν μ€ν¬λ₯Ό ν΅ν΄ νμ΅ν μ 보λ₯Ό μ΄μ©νμ¬ κ΄λ ¨μ΄ μλ λ³΄λ€ λΉμΌ ν μ€ν¬λ₯Ό νμ΅νλ λ°©μμ λλ€. μ΄λ source taskλ₯Ό μλμ μΌλ‘ λ£μ΄μ£Όμ΄μΌ νλ λ¨μ μ΄ μ‘΄μ¬ν©λλ€.
Unsupervised learning
λΉμ§λ νμ΅μ ν μ€ν¬μ λν΄ λΌλ²¨μ΄ μ£Όμ΄μ§μ§ μμ νκ²½μμ μΈνμμμ μ μ¬ν μ μ μ°Ύμ κ°κ²°ν representationμ νννλλ° λͺ©νλ₯Ό λ‘λλ€.
Meta-learning
λ©ν λ¬λμ μ ν΅μ μΈ νμ΅ λ¨κ³ λ³΄λ€ μμμ νμ΅μ νλλ° μ΄μ μ λκ³ μμ΅λλ€. νμ΅ λ°μ΄ν°μ μκ΄μμ΄ λ³΄νΈμ μΈ λ°©λ²μ μ°Ύλλ° μ¬μ©λ©λλ€. μλ₯Ό λ€μ΄ κ°ννμ΅, μ΅μ ν λ±μμ μ¬μ©λ©λλ€.
Multi-task learning
λ©ν° ν μ€ν¬ λ¬λμ νλμ μΈνμ κ°μ§κ³ μ¬λ¬ ν μ€ν¬μμ μ¬μ©ν μ μλλ‘ λ€μν μμνμ νμ΅νλ λ°©μμ λλ€.
Domain adaption
λλ©μΈ μ μ©μ κ°μ ν μ€ν¬μμ νΉμ λλ©μΈμμ λ€λ₯Έ λλ©μΈμΌλ‘μ μ μ©μ μν΄μ νμ΅νλ λ°©μμ λλ€. μ΄λ μ μ΄ νμ΅μ΄λΌ ν μ μμ§λ§, μ°λ¦¬λ ν μ€ν¬μμ λ€λ₯Έ ν μ€ν¬λ₯Ό λ€λ£¨κ³ μμ΅λλ€.
Learning Theoretic
μ΄ μ κ·Όμ μμμμ λͺ¨λ λ°©μμ μ½κ°μ© μ¬μ©ν μ κ·Όμ λλ€. μΌλ°νν μ μλ μ±λ₯μ 보μ₯νλλ° μ΄μ μ λκ³ μμ΅λλ€. μ΄λ λͺ¨λΈκ³Ό ν μ€ν¬μ λν΄μ μ νμ λμ΄ λ€λ£¨κΈ° νλ κ³μ°μ νΌνμ΅λλ€. μ°λ¦¬λ μ΄λ¬ν κ²κ³Ό μ μ¬νλ λ³΄λ€ μ€μ©μ μΈ μ κ·Όμ νκ³ μ ν©λλ€.
μ°λ¦¬λ λ¬Έμ λ₯Ό λ€μκ³Ό κ°μ΄ μ μν©λλ€. μ°λ¦¬λ μ΄λΌλ λΌλ²¨ μ νμ λκ³ (λ°μ΄ν° μ μμ μ νμ λκ³ ) ν μ€ν¬μ λν΄ μ 체μ μ μ±λ₯μ μ΅λννλλ° λͺ©μ μ λ‘λλ€. μ΄λΌλ λ°μ΄ν° μ μμ μ¬μ© ν μ€ν¬μ λ°λΌ μ΅λ μμ΄ μ ν΄μ§ μ μμ΅λλ€. V= ST μ΄λ©° Tλ μ°λ¦¬κ° νκ³ μ νλ ν μ€ν¬μ΄κ³ Sλ νμ΅ν μ μλ Sourceμ λλ€. κ·Έλ¬λ―λ‘ T - T Sλ μ°λ¦¬κ° νμ΅ν μ μλ νμΌλ§μ΄ μ‘΄μ¬νλ©° S-TSλ μμ€λ§μ΄ μ‘΄μ¬ν©λλ€. μ΄λ μ§μ μ μΌλ‘ ν΄λΉ ν μ€ν¬λ₯Ό ν΄κ²°ν μλ μμ§λ§, Tμ μ±λ₯μ μ¬λ¦¬κΈ° μν΄μ μ¬μ©κ°λ₯ν©λλ€.
task taxonomy(ν μ€ν¬ λΆλ₯, taskonomy)λ κ³μ°μ μΌλ‘ ν μ€ν¬ μ μ΄μ±μ ν¬μ°©νμ¬ κ·Έλνλ‘ ννν©λλ€. μμ€ ν μ€ν¬μ νκ² ν μ€ν¬μ μ¬μ΄ μ£μ§λ κ΄λ ¨μ±μ λνλ΄λ©° μ΄κ²μ κ°μ€μΉλ ν΄λΉ μμ μ μμΈ‘μ λλ€. μ°λ¦¬λ μ΄λ¬ν μ£μ§λ₯Ό μ 체μ μΈ μ νμ μ μ΄λ₯Ό μΈ‘μ νκΈ° μν΄ μ¬μ©ν©λλ€. λΆλ₯λ μ§λνμ΅ μ, task μ ν, μ μ΄μμ, μ μ΄ ν¨μμ ννμ λ°λΌ κ·Έλνμ νλΌλ―Έν°λ₯Ό ννν©λλ€.

Taxonomyλ 4κ°μ§ λ¨κ³λ₯Ό ν΅ν΄ λ§λ€μ΄μ§λλ€.
Task Dictionary
μ°λ¦¬μ ν μ€ν¬ λ§΅νμ 26κ°μ ν μ€ν¬λ‘ λΆν° μμ±λμ΄μ§λλ€. μ΄λ ν μ€ν¬μ λν νν 곡κ°μ μλ―Έν©λλ€. μ°λ¦¬λ ν μ€ν¬μμ λ€μν νν κ°μ μ»κ² λ©λλ€. μ°λ¦¬λ μ΄λ¬ν νν κ°μ΄ μ 체 곡κ°μ΄ μλ μκ°μ μΈ λ°μ§λ 곡κ°μμ μνλ§λ κ°μ΄λΌλ κ²μ μμμΌ ν©λλ€. μ΄λ¬ν λ°μ§λ 곡κ°μμ μΆλ°ν νμ΅μ λ³΄λ€ μ 리ν μ μλ€λ κ°μ μ λλ€. λ μ’μ μνλ§μΌ μλ‘ λ μ’μ μΌλ°νλ₯Ό κ°μ§λλ€.
Dataset
μ°λ¦¬λ μ΄λ―Έμ§μμ λͺ¨λ ν μ€ν¬μ λν λΌλ²¨ κ°μ΄ μλ λ°μ΄ν° μ μ μ¬μ©ν©λλ€. κ°μ λ°μ΄ν° μ μ ν κ²½μ° μ¬λ¬ κ°μ§ κ³ μ λ νκ²½μμ μ€νμ ν μ μκΈ°μ ν μ€ν¬ κ° μ μ΄ νμ΅μ λν κ²°κ³Όλ₯Ό μ νν μ μ μμ΅λλ€. μ§κΈκΉμ§ μ΄λ¬ν λ°μ΄ν° μΈνΈλ μμκΈ° λλ¬Έμ μ°λ¦¬λ 600κ°μ 건물μ λν΄μ 4λ°±λ§μ₯μ μ΄λ―Έμ§λ₯Ό μμ±νμ΅λλ€. λΌλ²¨ κ°μ μ£ΌκΈ° μν΄ μ¬λ¬ ν΄μ μ¬μ©μ νκ³ , μ΄λ μ¬λμ΄ λΌλ²¨λ§ ν κ²μμ 7%λ―Έλ§μ μ€λ₯λ₯Ό 보μμ΅λλ€.
μ°λ¦¬λ κ°κ°μ ν μ€ν¬μ λν΄ μ§λ νμ΅μ μ§νν©λλ€. ν μ€ν¬ νΉμ λ€νΈμν¬λ μΈμ½λμ λμ½λ ꡬ쑰λ₯Ό κ°μ§λλ€. μΈμ½λλ μΆ©λΆν κ°λ ₯ν representationμ μΆμΆνκ³ λμ½λλ μΈμ½λ보λ€λ μμ§λ§ μ’μ μ±λ₯μ λ΄κΈ° μν΄ μΆ©λΆν©λλ€.


κ°κ°μ ν μ€ν¬ κ°μ μ μ΄μ λν κ΄λ ¨μ± νλ ¬μ μ»κ³ μ ν©λλ€. ν μ€ν¬μ λνμ¬ Lossλ₯Ό ν΅νμ¬ μ΄λ₯Ό μ°μ νλ κ²μ ν μ€ν¬ κ° κ³΅κ°μ λ°λ₯Έ νΉμ΄μ±μ΄ μ‘΄μ¬νκΈ° λλ¬Έμ ν μ€ν¬ κ° λΉκ΅ν μ μ ν©νμ§ μμ΅λλ€. κ·Έλμ μ μ ν μ κ·νκ° νμν©λλ€. κ°λ¨ν λ°©μμ μ€μΌμΌμ [0,1]μ λ¨μλ‘ λ³κ²½νλ κ²μ λλ€. κ·Έλ¬λ μ΄ μ κ·Όμ μ€μ μΆλ ₯λ¬Όμ κ²°κ³Όκ° λ‘μ€μλ λ€λ₯Έ κ°μ μλκ° μκΈ° λλ¬Έμ μ€ν¨νμμ΅λλ€. λ‘μ€μ ν리ν°μ λν κ΄κ³λ μ μ μκΈ° λλ¬Έμ μ΄λ¬ν μ κ·νλ ν¨κ³Όκ° μμμ΅λλ€.



μμμμ μ£Όμ΄μ§ νλ ¬μ μ΄μ©νμ¬ μ°λ¦¬λ ν μ€ν¬μ λν΄μ μ 체μ μΌλ‘ μ±λ₯μ κ·Ήλννλ©° μ§λ νμ΅μ μ΅μννκΈ° μν΄μ μ μ΄ νμ΅ λμμ κ³ μν΄μΌν©λλ€. μ΄ λ¬Έμ λ λ Έλμ μ£μ§λ₯Ό ν΅ν΄ κ·Έλνλ‘ νν κ°λ₯ν©λλ€. μ°λ¦¬λ μ΄κ²μ ν΅ν΄ νΉμ νκ² ν μ€ν¬μ μ±λ₯μ λμ΄κΈ° μν΄ μ΅μ μ μ μ΄ νμ΅ λ°©μμ μ°Ύμ μ μμ΅λλ€. μ°λ¦¬λ μ΄κ²μ Boolean Integer Programming(BIP)μ μ¬μ©ν©λλ€. κ°μ₯ μ±λ₯μ΄ μ’μ μμλ₯Ό μ΄μ©νμ¬ λ Έλκ°μ μ°κ²°μ ν€κ³ λλ¨Έμ§λ λλ λ°©μμ ν΅ν΄ κ·Έλνλ₯Ό μ μν©λλ€.
26κ°μ ν μ€ν¬ (4κ°λ sourceλ‘λ§ μ¬μ©), 26κ°μ νΉμ ν μ€ν¬ λ€νΈμν¬μ 2225 μ μ΄ νμ΅ λ€νΈμν¬ κ·Έλ¦¬κ³ 2225Ckμ κ³ μ°¨μ μ μ΄ νμ΅μ ν΅νμ¬ μμ±νμ΅λλ€. μ μ΄ νμ΅ λ°©μμ 3000κ° μμͺ½μΌλ‘ λμμΌλ©° μ΄ 47,886 GPU μκ°μ μΌμ΅λλ€. (μ½ 2000μΌ)
μΈμ½λ ꡬ쑰λ νλ§ μμ΄ ResNet-50μ κΈ°λ°μ λλ€. λͺ¨λ μ μ΄ νμ΅ κ΅¬μ‘°λ μμ 2κ°μ convolution layersλ‘ μ§νλ©λλ€. λμ½λμ ꡬ쑰λ taskλ§λ€ μμ΄νν ν½μ λ§λ€ μμΈ‘μ΄ νμν κ²½μ°λ 15κ°μ conv layerλ₯Ό μ¬μ©ν©λλ€. μ μ°¨μμ taskλ 2~3κ°μ FC layerλ₯Ό μ¬μ©ν©λλ€. κ°κ°μ μ§λνμ΅λ λ€νΈμν¬κ° μΌλ§λ μ representationμ λ§λ€μλμ§ νμΈνκΈ° μνμ¬ κ°κ° λ€νΈμν¬μ μ±λ₯μ μλμ κ°μ΅λλ€.



QUALITY : νΉμ ν μ€ν¬ μ§λ νμ΅ κ²°κ³Όμ λν΄μ μ΄κΈ΄ λΉμ¨ ( λ°μ΄ν° μ 12λ§ )
λ λ€ 0.5μ΄μμ μμΉλ₯Ό κΈ°λ‘ν κ²½μ° μ μ΄ νμ΅μ΄ μμ μ§λ νμ΅λ³΄λ€ μ±λ₯μ΄ μ’μ κ²μ λνλΈλ€. λν Sourceμ orderμ μμΉκ° μ¦κ°ν μλ‘ μ±λ₯μ΄ λμμ§λ κ²½ν₯μ΄ μλλ° μ΄λ μ μ΄ νμ΅μ λ§μ΄ ν μλ‘ μ’μ κ²°κ³Όλ₯Ό λνλμ 보μΈλ€. κ·Έλ¦¬κ³ Qualityμμλ μ§λ νμ΅μ μ±λ₯μ΄ λ μ’μ κ²½μ°κ° λ§μλ° μ΄λ λ°μ΄ν° μ μ νμ΅λμ΄ λ§μμ μ΄κΈ° λλ¬Έμ΄λ€.

μ°λ¦¬λ μ¬λ¬κ°μ§ λ°©μμ κ³ μ ν΄λκ³ μ€νμ μ§ννλ€. κ·Έλ¬λ μ΄λ¬ν λ°©μμμλ§ Taskonomyμ λ°©λ²λ‘ μ΄ ν΅νλμ§ νμΈνκΈ° μνμ¬ μλμ κ°μ κ²λ€μ λ°κΎΈμμΌλ μ°λ¦¬κ° 보μ¬μ€ κ²°κ³Όμ μ μ¬νκ² λμλ€.
I. architecture of task-specific networks
II. architecture of transfer function networks
III. amount of data available for training transfer networks
IV. datasets
V. data splits
VI. choice of dictionary

Model Dependence
μ°λ¦¬λ κ³ μ λ λͺ¨λΈκ³Ό κ³ μ λ λ°μ΄ν° μ μ νμ μ μ§μ΄ μ€νμ μννμκΈ° λλ¬Έμ, μ΄λ λ€λ₯Έ 쑰건 μν©μμλ μ μ¬ν κ²°λ‘ μ΄ λμ¬μ§ νμΈν΄μΌ ν©λλ€.
Compositionality
μ°λ¦¬κ° μνν ν μ€ν¬λ μ¬λμ΄ μ μν ν μ€ν¬μ νμ λμ΄ μμ΅λλ€. μλ‘μ΄ μλΈ ν μ€ν¬μμλ ν΅ν μ§ νμΈν΄μΌ ν©λλ€. λν, ν μ€ν¬ κ°μ κ²°ν©μΌλ‘ μλ‘μ΄ ν μ€ν¬κ° λμ¬ μλ μμ΅λλ€.
Space Regularity
μ°λ¦¬λ ν μ€ν¬λ₯Ό μνλ§νμ¬ κ²°κ³Όμ μ΄μ©νλλ°, λ λμ 곡κ°μμμ μνλ§μ νμ λλ κ²°κ³Όκ° κ·Έλλ‘ λμ¬μ§ νμΈν΄μΌ ν©λλ€.
Transferring to Non-visual and Robotic Tasks
λͺ¨λ μ€νμ μ΄λ―Έμ§μμλ§ μ΄λ£¨μ΄μ‘κ³ λ€λ₯Έ μκ°μ μ΄μ§ μμ λΆμΌμμλ ν΅ν μ§ νμΈν΄μΌ ν©λλ€.
Lifelong Learning
κ³μν΄μ λ°μ ν΄λκ°κ³ μλ μν©μμ Taskonomyκ° μΈμ κΉμ§ ν΅ν μ§ μκ°ν΄μΌ ν©λλ€.
π κ΄λ ¨ κΈ