[졸업연구] 논문 분석 - Multimodal Machine Learning: A Survey and Taxonomy

2한나·2025년 3월 30일

졸업연구

목록 보기
5/13

멀티모달에 대해 공부하기위해 Multimodal Machine Learning: A Survey and Taxonomy 논문을 읽어보고자 한다.

Introduction

모달리티는 어떤 일이 발생하거나 경험되는 방식, 이러한 모달리티를 둘 이상 포함할 경우 멀티모달로 분류된다.
멀티모달 머신러닝은 다양한 모달리티의 정보를 처리하고 연관지을 수 있는 모델을 구축하는 것을 목표로 한다.

해당 논문은 멀티모달 머신러닝의 발전들을 종합적으로 살펴보고, 이를 공통된 분류체계로 제시한다.

멀티모달 머신러닝의 5가지 핵심 기술 과제

1. Reprsentation(표현)

멀티모달 데이터를 요약하고 표현하는 방법을 학습하는 문제
ex) 언어는 Symbolic인 반면, 오디오 및 비주얼 모달리티는 Sinal로 표현됨. 이러한 멀티모달 데이터의 이질성은 표현을 구성하는데 어려움을 준다.

2. Translation(번역)

한 모달리티의 데이터를 다른 모달리티로 매핑하는 문제
데이터가 이질적일 뿐만 아니라, 모달리티 간의 관계는 종종 open ended(개방적)이거나 subjective(주관적)이다.
ex) 하나의 이미지를 설명하는 여러가지 방법이 존재할 수 있으며, 하나의 완벽한 Translation은 조재하지 않을 수도 있다.

3. Alignment(정렬)

두 개 이상의 다른 모달리티에서 요소들 간의 직접적인 관계를 식별하는 문제
ex) 요리 방법을 요리 동영상과 정렬하고자 할 수 있다. 이를 해결하기 위해서는 다양한 모달리티간의 유사성을 측정하고, long-range dependencies(장거리 의존성) 및 ambiguities(모호성)을 다룰 수 있어야 한다.

4. Fusion(융합)

두 개 이상의 모달리티로부터 정보를 결합하여 예측을 수행하는 문제
ex) 오디오-비주얼 음성 인식에서는 입술 움직임에 대한 시각적 설명을 음성 신호화 결합하여 발화된 단어를 예측한다. 하지만 이렇게 다양한 모달리티로부터 오는 정보는 predictive power(예측력)이나 noise tepology(잡음의 구조)가 다를 수 있으며, missing data가 일어날 수도 있다.

5. Co-learning(공동학습)

모달리티 간의 지식, 표현, 예측 모델을 transfer(전이)하는 문제
이는 co-training, conceptual grounding, zero shot learning 알고리즘들에 의해 구체화된다.
한 모달리티로부터 학습된 지식이 다른 모달리티에 대해 학습된 모델에 도움이 되는지를 탐구한다.


2장 - 멀티모달 머신러닝의 주요 응용 사례

멀티모달 머신러닝이 직면한 다섯가지 핵심 도전 과제들에 대한 최근 발전
3장 - Representation
4장 - Translation
5장 - Alignment
6장 - Fusion
7장 - Co-learning

8장 - 전체적인 논의


3. Multimodal Representation

Good Representation은 머신러닝 모델 성능에 있어 매우 중요하다.

Bengio에서 제시한 좋은 표현의 특성

  • Smoothness(매끄러움)
  • Tempral and spatial coherence(시간적, 공간적 일관성)
  • Sparsity(희소성)
  • Natural Clustering(자연스러운 클러스터링)

Srivastava와 Salakhutdinov에서 제시한 멀티모달 표현의 바람직한 특성

  • 표현공간에서의 유사도는 대응되는 개념간의 유사도를 반영해야한다.
  • 일부 모달리티가 없더라도 표현을 얻는 것이 쉬워야 한다.
  • 관측된 모달리티로부터 누락된 모달리티를 복원할 수 있어야 한다.

멀티모달의 표현방법

1. Joint Representations
서로 다른 모달리티의 정보를 하나의 통합 표현 공간으로 합친다. 즉, 모든 모달리티의 데이터를 함께 입력받아 하나의 표현을 생성한다.

수식으로 표현하면 다음과 같다.

  • xm: 멀티모달 표현
  • f: 입력 모달리티 x1,...,xn을 통합하는 함수
  • ex) Deep Neural Network(DNN), restricted Boltzmann machine(RBM), recurrent neural network(RNN)

2. Coordinated Representations
각 모달리티를 별도로 처리하지만, 일정한 유사성 제약 조건을 적용하여 결과적으로 같은 의미 공간에 있게끔 조정한다. 이러한 공간을 Coordinated Space라고 부른다.

수식으로 표현하면 다음과 같다.

  • 각 모달리티는 별도의 투영함수 f, g를 통해 표현공간으로 매핑괴며, 두 표현은 유사성 제약조건을 만족해야 한다.
  • ex) minimizing cosine distance, maximizing correlation, enforcing a partial order

3.1 Joint Representation

unimodal representation (단일 모달리티 표현)을 함께 하나의 멀티모달 공간으로 projection(사영)하는 방식이다.
일반적으로 training과 inference 단계 모두에서 멀티모달 데이터가 사용되는 작업에 활용된다.

신경망 기반 결합 Representation

신경망은 단일 모달리티 데이터를 표현하는데 널리 사용되는 방법이며, 멀티모달 영역에서도 점차 많이 활용되고 있다.

신경망은 일반적으로 inner project(내적)과 그 뒤를 잇는 non-linear
activation functions으로 구성된 block들로 이루어진다. Deep Neural Network는 층이 깊어질수록 데이터를 점점 더 추상적인 방식으로 표현한다고 가정한다. 이에 마지막층이나 그 직전층을 데이터 Representation으로 자주 사용한다.

  • Multimodal Representation을 만들기 위해서 각 모달리티를 각각의 Neural Layer에서 개별적으로 처리한 후, 이 개별 처리된 결과들을 하나의 hidden layer를 사용하여 Joint Space로 모은다.
  • 이렇게 얻은 Joint Representation은 추가적인 Neural Layer을 더 지나 예측에 사용되거나 바로 예측에 사용된다.

해당 구조 덕분에 멀티모달 표현을 학습하는 과정과 여러 모달리티를 융합하는 과정이 신경망안에서 동시에 일어날 수 있게 한다.
-> 멀티모달 Representation training과 fusion은 신경망을 사용할 때 서로 밀접하게 연관된다.

오토인코더 기반 사전학습
신경망은 많은 양의 label 데이터를 필요로하기 때문에 오토인코더를 사용해 비지도학습으로 사전training 하는 것이 일반적이다.

  • Ngiam은 이러한 오토인코더 개념을 멀티모달 도메인으로 확장했다.
    stacked denoising 오토인코더를 이용하여 각 모달리티를 따로 representation한 후, 또 다른 오토인코더 layer를 통해 결합 멀티모달 representation을 생성했다.

  • Silberer와 Lapata는 semantic concept grounding(의미 개념 정착)과제에서 멀티모달 오토인코더를 사용했다.
    이들은 표현을 학습할 때 reconstruction loss(재구성 손실)에 더해 객체 레이블을 예측하는 term(손실항)을 추가했다.

오토인코더로 생성된 representation은 특정 과업에 대해 fine-tuning(미세조정)하는 것이 일반적이다. 오토인코더 representation은 generic이며, 특정 작업에 최적화되어 있지 않을 수 있기 떄문이다.

신경망 기반 Joint Representation 장단점
장점

  • 성능이 뛰어난 경우가 많음
  • 비지도 학습을 통한 사전 학습 가능

단점

  • 훈련 데이터가 많아야 성능 확보 가능
  • 모달리티 누락을 자연스럽게 처리하기 어려움
  • Deep Network 학습 난이도가 높음

그래픽 모델 기반 Representation

probabilistic graphical models (확률적 그래픽 모델)을 사용하는 방식이다.
이는 latent random variables(잠재 변수)를 통해 Representation을 구성한다.

Deep Boltzmann Machines(DBM)
가장 대표적인 방식으로, restricted Boltzmann machines을 여러 block으로 쌓아 구성한다.
신경망과 마찬가지로 각 층은 점점 더 추상적인 표현을 학습하고 지도학습 없이도 학습 가능하다는 장점이 있다.

멀티모달 DMB
두 개 이상의 비지도 그래프를 공통의 binary hidden layer로 연결하여 Joint Representation를 학습한다. 모델이 undirected graph로 구성되어 있기 때문에 학습이 끝난 이후에도 각 모달리티의 저수준 representation들이 서로 영향을 미칠 수 있다.

장점: generative model(생성 모델)

  • 모달리티가 일부 또는 전부 누락되었을 때도 자연스럽게 결측치 처리 가능
  • 한 모달리티가 주어졌을 때 다른 모달리티의 샘플을 생성하거나, 두 모달리티 모두를 생성 가능

단점: 훈련이 어려움

  • 높은 계산 비용 필요, 근사적인 variational training 기법을 사용해야 함

ex) 멀티뷰 데이터로부터 사람의 자세 추정, PET + MRI 데이터 기반 알츠하이머 분류 등에 사용됨


3.2 Coordinated Representations

joint representation의 대안으로 coordinated representation를 고려할 수 있다.
joint representation은 모든 모달리티를 하나의 공간으로 project하는 것이라면, coordinated representation는 각 모달리티에 대해 개별 representation을 학습하되, 일정한 제약 조건을 통해 그 표현들 간의 관계를 맞추는 방식이다.

Similarity-based coordinated representations

해당 모델은 조정된 표현 공간에서 모달리티 간의 거리를 최소화한다.
ex) 단어 dog와 강아지 사진의 표현 간 거리가, 단어 dog와 자동차 사진 간 거리보다 작도록 유도한다.

Structured coordinated representations

해당 모델은 모달리티 표현 간에 추가적인 structural constraints(구조적 제약)을 가한다.
이러한 구조는 응용 분야에 따라 달라지며 해상, 크로스모달 검색, 이미지 캡셔닝 등에 각각 다른 제약이 사용된다.

Cross-modal Hashing
고차원 데이터를 압축된 binary code로 변환하여 서로 유사한 객체는 유사한 hash code를 갖게 하는 방식이다.

Cross-modal Hashin의 목표는 모달리티가 다른 객체들 간에도 유사한 코드를 만들 수 있도록 학습하는 것이다.

해당 방식은 아래와 같은 제약을 표현 공간에 강제한다.
1. 표현 공간을 n차원 hamming space 이어야 한다. (고정된 길이의 이진 표현)
2. 같은 객체라도 모달리티가 다르면 유사한 해시 코드를 가져야 한다.
3. 공간 자체는 유사성을 보존해야 한다.

Order-embeddings (순서기반 조정 표현)
이미지와 텍스트 간 순서를 반영한 방식이다.

Vendrov et al은 비대칭 거리 측정 방식과 부분순서 개념을 도입하여 표현 공간에 계층적 구조를 부여했다.

Canonical Correlation Analysis (CCA, 정준 상관 분석)
두 확률 변수간의 상관관계를 극대화하는 선영 사영을 계산하며, 새로운 표현공간에서의 직교성도 강제한다.
CCA 모델은 크로스모달 검색, 오디어-비주얼 신호 분석에 폭넓게 사용되어 왔다.


3.3 Discussion

멀티모달 representation의 두가지 주요 유형

joint representations

멀티모달 데이터를 하나의 공통 표현 공간으로 사영하는 방식이다. 이 방식은 모든 모달리티가 inference time에 모두 존재할 경우에 가장 적합하다.
이는 오디오-비주얼 음성인식, 감정인식, 멀티모달 제스처인식 등에서 광범위하게 사용되어 왔다.

coordinated representations

각 모달리티를 별도의 표현 공간으로 사영하되, 그 표현 공간들 간의 정렬을 통해 조화를 이룬다.
이 방식은 다음과 같은 한가지 모달리티만 주어지는 테스트 상황에 적합하다.

  • multimodal retrieval(멀티모달 검색) 및 translation
  • grounding
  • zero-shot learning


5. Alignment

Multimodal Alignment: 두 개 이상의 모달리티에서 각 인스턴스의 하위 구성 요소들간의 관계와 대응을 찾는 것

  • ex1) 이미지와 캡션이 주어졌을 때 캡션의 단어나 구절에 해당하는 이미지 영역을 찾는 문제
  • ex2) 영화가 주어졌을 때, 그에 대응하는 대본이나 원작 소설의 챕터와 정렬하는 문제

멀티모달 정렬은 두 가지 유형으로 분류된다.

  • explicit(명시적) 정렬: 모달리티 간 하위 구성 요소들을 명시적으로 정렬하는 데 초점을 맞춘 경우
    ex) 요리법의 단계와 이를 보여주는 요리 영상 간의 정렬
  • implicit(암시적) 정렬: 정렬 자체가 목적이 아니라, 다른 task의 중간 단계로 사용되는 경우
    ex) 텍스트 설명을 기반으로 이미지를 검색할 때, 단어와 이미지 영역 간의 정렬

5.1 Explicit Alignment (명시적 정렬)

유사도 측정(similarity metric): 명시적 정렬의 가장 중요한 구성요소
대부분의 접근 방식은 모달리티 간 하위 요소들 사이의 유사도를 측정하는 것을 기본 구성 요소로 사용한다. 이러한 유사도는 수작업으로 정의될 수도 있고, 데이터로부터 학습될 수도 있다.

명시적 정렬을 위한 두가지 알고리즘 유형
1. 비지도 정렬: 서로 다른 모달리티 간 인스턴스에 대해 직접적인 정렬 label없이 작동
2. (약한)지도 정렬: 정렬된 쌍에 대한 일부 label이 존재하고, 이를 모델 학습에 활용

Unsupervised Alignment(비지도 정렬)

label없이 모달리티를 정렬하는 방식이며, 작업을 간소화하기 위해 temporal ordering of sequence나 모달리티간 유사도 정의 등의 가정을 둔다.

Dynamic Time Warping (DTW, 동적 시간 왜곡)

  • DTW는 multi-view time series(다중 시계열 데이터) 정렬에 널리 사용된 동적 프로그래밍 알고리즘이다.
  • 두 시퀀스 간의 유사도를 측정하고 time warping(시간 왜곡)을 통해 최적의 정렬을 찾아낸다.
  • 두 시퀀스가 비교 가능한 시간 단위를 갖고 있어야 하며, 유사도 측정 함수가 필요하다.
  • 유사도 정의 예시
    • 음소와 음절 간 유사도를 수작업으로 정의
    • TV 드라마 장면과 줄거리 설명 간 유사도를 등장 인물의 일치를 기반으로 정의

DTW + CCA

  • DTW는 원래 사전에 정의된 유사도가 필요하지만 이를 확장해 CCA( canonical correlation analysis)를 활용하면 모달리티들을 coordinated space(공동 표현 공간)에 매핑할 수 있다.
  • 장점: DTW로 정렬하는 동시에 CCA로 표현 매핑학습 가능
  • 단점: 선형 변환만 가능, 비선형 관계는 학습 불가

그래픽 모델 기반 접근

  • Yu & Ballard: 이미지 내 시각 객체와 음성 단어 간 정렬을 위한 생성 그래픽 모델
  • Cour et al.: 영화 장면을 스크립트와 정렬
  • Malmaud et al.: 요리법과 요리 영상 정렬에 분해형 HMM 사용
  • Noulas et al.: 발화자와 비디오 정렬을 위한 동적 베이지안 네트워크(DBN) 사용
  • Naim et al.: 문장과 영상 프레임을 정렬하는 계층적 HMM + IBM 모델 조합

Supervised Alignment(지도 정렬)

지도 정렬은 정렬된 인스턴스에 대한 label을 모달리티 간 유사도를 측정하는 모델을 학습하는데 사용한다.

많은 지도 정렬 기법은 비지도 방식에서 영감을 받아 발전했다.

  • Bojanowski et al.: Canonical Time Warping 기반 방법 → (약한) 지도 정렬 방식을 추가해 학습
  • Plummer et al.: 이미지 영역 ↔ 문구(phrase) 정렬을 위해 CCA 사용
  • Gebru et al.: 오디오 발화자 ↔ 비디오 위치 정렬을 위해 GMM + 비지도 그래픽 모델 혼합 사용
  • Kong et al.: 3D 장면 객체 ↔ 텍스트 명사/대명사 정렬을 위해 마르코프 랜덤 필드(MRF) 사용

딥러닝 기반 명시적 정렬

최근 language and vision communities 데이터셋의 등장으로 정렬과 유사도 측정에 인기있는 방법이 되었다.

  • Zhu et al.: 영화 장면 ↔ 책/스크립트 정렬을 위해 CNN 사용
  • Mao et al.: LSTM 언어 모델 + CNN 비주얼 모델을 활용하여, 지칭 표현(referring expression)과 이미지 객체 간의 일치 평가
  • Yu et al.: 위 모델에 상대적 외형 및 문맥 정보를 추가하여 유사 객체 간 구분 성능 향상
  • Hu et al.: LSTM 기반 스코어링 함수로 이미지 영역과 설명 간 유사도 측정

5.2 Implicit Alignment (암시적 정렬)

명시적 정렬과 달리 암시적 정렬은 다른 작업을 위한 중간 단계로 사용된다.
이러한 접근 방식은 아래와 같은 여러 잡업에서 성능 향상을 가능하게 한다.

  • 음성 인식
  • 기계 번역
  • 미디어 설명
  • 시각적 질의응답 등

암시적 정렬 모델의 두가지 유형

  • 초기의 그래칙 모델 기반 접급
  • 최근의 신경망 기반 방법

그래픽 모델 기반 정렬

그래픽 모델은 기계 번역을 위한 언어 간 정렬, phoneme와 transcription 간의 정렬 등에 사용되었다.
그러나 이 방식은 모달리티 간 매핑을 수작업으로 구성해야 해 이러한 모델을 구성하려면 훈련 데이터나 전문가의 지식이 필요하다.

Neural Network 기반 정렬

  • Neural Network 기반 Translation은 Alignment가 잠재적인 중간 단계로 수행될 때 성능이 향상되는 대표적인 모델링 과제이다.
  • Neural Network는 이러한 Translation 문제를 해결하기위해 주로 인코더-디코더 모델 또는 cross-modal retrieval(검색) 방식을 사용한다. 하지만 만약 암시적 정렬 없이 Translation을 수행하게 되면 인코더 모듈이 전체 이미지, 문장, 비디오를 하나의 벡터 표현으로 정확하게 요약해야하므로 인코더에 과도한 부담이 주어지게 된다.

Attention: 위 문제를 해결하기 위해 가장 많이 쓰이는 방법

  • 디코더가 source 인스턴스의 특정 부분에 focus할 수 있게 해줌으로써, 모든 정보를 한 벡터에 압축했던 기존 인코더-디코더와 달리 부분적으로 참조하며 Translation을 수행한다.
  • ex1) 이미지 캡셔닝: CNN으로 이미지 전체를 인코딩하는 대신, 단어를 생성할 때마다 이미지의 특정 부분에 집중
  • ex2) 질의응답: 질문의 단어와 정보 소스의 구성 요소간 정렬을 학습함으로써 성능 향상, 모델 해석 가능성도 개선됨

5.3 Discussion

멀티모달 정렬의 어려움

  • 정렬이 명시적으로 annotated(주석)된 데이터셋이 거의 없음
  • 모달리티 간 유사도 측정 방식을 설계하는 것이 어려움
  • 정렬 방식이 여러개 존재할 수 있으며, 한 모달리티의 모든 요소가 다른 모달리티에 대응되는 요소를 가지지 않을 수 있음

초기 멀티모달 정렬 연구는 그래픽 모델과 동적 프로그래밍 기법을 이용하여 비지도 방식으로 시퀀스를 정렬하는데 집중하였다. 이러한 방법들은 모달리티 간의 유사도를 수작업으로 정의하거나 비지도 학습 방식으로 학습했다.

하지만 최근에는 레이블이 있는 학습 데이터의 등장으로 모달리티 간 유사도를 지도학습하는 것이 가능해졌다.

0개의 댓글