[졸업연구] 멀티 모달이란?

2한나·2025년 3월 7일

졸업연구

목록 보기
1/13

졸업연구
지도교수님: 이형준 교수님
주제: [멀티모달 생성 AI] 멀티 모달리티 학습 환경에서 누락된 모달리티 데이터 생성 연구

[멀티모달 생성 AI] 멀티 모달리티 학습 환경에서 누락된 모달리티 데이터 생성 연구라는 주제로 1년간 졸업 연구를 진행하게 되었다. 이에 오늘은 우리 주제에 대해 공부해보고자 한다.

✅멀티 모달

🔍멀티모달 개념

인류는 어떠한 개념을 이해하기 위해 시각과 미각, 촉각, 텍스트까지 여러 개념을 통합해서 인식한다. 이러한 인간의 학습 방법을 가지고 등장한 것이 멀티 모달리티이다.

모달리티는 양식, 양상이라는 뜻으로 어떤 형태로 나타나는 현상이나 그것을 받아들이는 방식을 말한다.

멀티 모달은 시각, 청각을 비롯한 여러 인터페이스를 통해서 정보를 주고받는 것을 말하는 개념이며, 다양한 채널의 모달리티를 동시에 받아들여서 학습하고 사고하는 AI를 멀티모달 AI라고 한다.

🔍멀티모달 AI와 기존 AI의 차이점

기존의 AI는 텍스트나 자연어를 이해하는데 중점을 두었기에 실제 그 단어가 의미하는 것이 어떻게 생겼고, 실제 세상에는 어떤 형태로 존재하는지 이해하지 못했다. 즉, 데이터 처리나 통계, 텍스트를 검색해서 보여주는 것은 가능하지만 인간과 유사한 방식의 사고는 할 수가 없다는 문제점이 있는 것이다. 이에 AI가 우리 세상을 제대로 인식할 수 있도록 하기위해 멀티모달 AI가 등장한 것이다.

이처럼 일반적으로 단일 유형의 데이터를 처리하도록 설계된 기존 AI 모델과 달리 멀티모달 AI는 다양한 형태의 데이터 인풋을 결합 및 분석하여 보다 포괄적인 이해를 달성하고 보다 강력한 아웃풋을 생성한다.

🔍멀티모달 AI의 장점

  1. 멀티모달 AI 시스템은 다양한 모달리티를 활용하여 이미지 인식, 언어 번역 및 음성 인식과 같은 작업에서 더 높은 정확도와 성능을 달성할 수 있다.
  2. 다양한 유형의 데이터를 통합하면 더 많은 맥락을 파악하고 모호성을 줄일 수 있다.
  3. 멀티모달 AI 시스템은 잡음 및 누락된 데이터에 대한 복원력이 더욱 뛰어나다. 이에 한 모달리티가 신뢰할 수 없거나 사용할 수 없는 경우 시스템은 성능을 유지하기 위해 다른 모달리티에 의존할 수 있다.

🔍멀티모달 AI의 특징

카네기멜론 대학에서 2022년 발표한 논문은 멀티모달 AI의 세가지 특징인 이질성, 연결성, 상호작용을 설명한다.

이질성

  • 모달리티의 다양한 품질, 구조, 표현을 말한다.
  • 같은 사건을 설명하는 텍스트와 이미지는 각각 고유한 정보 표현 방식을 가진다.

연결성

  • 서로 다른 모달리티는 상호 보완적 정보를 가진다.
  • 이러한 연결은 통계적 유사성 또는 의미론적 대응에 반영될 수 있다.

상호작용

  • 서로 다른 모달리티가 결합되었을 때 상호 작용하는 방식을 나타낸다.

🔍멀티모달 AI의 주요 과제

멀티모달 AI는 단순히 데이터를 결합하는 것이 아니라, 각 모달리티의 장점을 극대화하면서 단점을 보완하는 모델을 개발하는 것이 목표이다.

표현 (Representation)

  • 서로 다른 모달리티를 하나의 공통된 표현 공간으로 변환하는 방법
  • ex) CNN(이미지 분석)과 트랜스포머(텍스트 분석)을 결합하여 특징 추출

정렬 (Alignment)

  • 서로 다른 데이터 간의 연결 관계를 찾는 것
  • ex) 비디오의 특정 장면과 해당 장면을 설명하는 테스트를 매칭하는 기술

추론 (Reasoning)

  • 여러 모달리티의 데이터를 조합하여 의미있는 결론을 도출하는 것
  • ex) 영상 속 사람의 말과 행동을 분석하여 감정 추론

생성 (Generation)

  • 하나의 모달리티로부터 다른 모달리티를 생성하는 것
  • ex) 텍스트에서 이미지 생성, 이미지에서 설명 자동으로 생성

전이학습 (Transfer Learning)

  • 특정 모달리티에서 학습한 정보를 다른 모달리티로 전송
  • ex) 텍스트에서 배운 개념을 이미지 분석에 적용

정량화 (Quantification)

  • 멀티모달 모델의 성능을 평가하는 방법 연구

🔍멀티모달 AI의 기술적 접근 방식

초기 융합 (Early Fusion)

  • 모든 모달리티를 하나의 공통된 표현 공간에서 처리
  • ex) 텍스트와 이미지를 결합하여 하나의 벡터로 변환 후 분석

중기 융합 (Mid Fusion)

  • 각 모달리티를 변도로 처리한 후, 중간 단계에서 결합
  • ex) 텍스트와 이미지를 각각 분석한 후 특징을 결합하여 예측

후기 융합 (Late Fusion)

  • 개별 모달리티를 독립적으로 처리한 후 최종 결과를 조합
  • ex) 얼굴 인식 AI와 음성 인식 AI가 각각 판단한 결과를 합쳐 감정 분석 수행

✅누락 모달리티

🔍누락 모달리티 발생 원인

현실 세계의 멀티모달 시스템은 특정 데이터 모달리티가 누락되거나 불완전한 경우가 많다. 이는 센서 오작동, 하드웨어 제한, 프라이버시 문제, 환경적 간섭, 데이터 전송 문제 등의 다양한 요인으로 인해 발생할 수 있다.

🔍누락 모달리티 발생 사례

  • 감성 컴퓨팅 (Affective Computing) 연구: 얼굴 및 음성 데이터를 수집할 때, 마이크 잡음이나 카메라 장애물로 인해 일부 이미지나 오디오 샘플이 쓸모없게 되는 문제 발생
    -> 오디오-비주얼 모델을 개발하여 누락된 모달리티가 있어도 감정 상태를 인식할 수 있도록 함
  • 의료 AI: 개인 정보 보호 문제, 수술 또는 침습적 자료 중 특정 모달리티 데이터를 수집하는 어려움으로 인해 멀티모달 데이터셋 중 일부 모달리티가 누락되는 경우가 많음
  • 우주 탐사: NASA의 Ingenuity 화성 헬리콥터는 극한의 온도 변화로 인해 경사계가 고장나는 바람에 모달리티가 누락됨
    -> 소프트웨어 패치를 적용하여 탐색 알고리즘의 초기화를 수정하는 방식으로 문제 해결
  • 센서의 구조적(정량적) 이질성: 장비의 버전이나 브랜드에 따라 사용 가능한 모달리티가 달라지는 문제 발생 가능
    -> 입력되는 모달리티 유형이 서로 다르더라도 처리할 수 있는 모델 필요

참고
https://www.samsungsds.com/kr/insights/multi-modal-ai.html
https://www.ibm.com/kr-ko/think/topics/multimodal-ai
Wu, Renjie, et al. "Deep multimodal learning with missing modality: A survey." arXiv preprint arXiv:2409.07825 (2024).

0개의 댓글