Abstract
대규모 멀티모달 모델(Large Multimodal Model)은 최근 visual instruction tuning을 통해 고무적인 발전을 보여주고 있다. 본 논문에서는 LLaVA 프레임워크하의 통제된 환경에서 LMM의 설계 선택지를 조사한 최초의 체계적인 연구를 제시한다. 우리는 LLaVA의 fully-connected vision-language connector가 놀라울 정도로 강력하면서도 데이터 효율적임을 보인다. 구체적으로 CLIP-ViT-L-336px와 MLP 프로젝션을 사용하고, 응답 형식 지정 프롬프트가 포함된 학술 과제 중심의 VQA 데이터를 추가하는 등 LLaVA에 간단한 수정을 적용함으로써, 11개의 벤치마크에서 최고 수준의 성능을 달성하는 더 강력한 베이스라인을 구축한다. 최종 13B 체크포인트는 공개적으로 이용 가능한 데이터 120만 개만을 사용하며, 단일 8-A100 노드에서 약 하루 만에 전체 학습을 완료한다. 또한 고해상도 입력으로의 확장, compositional capabilities, model hallucination 등 LMM의 미해결 문제에 대한 초기 탐색 결과를 제시한다. 본 연구를 통해 최고 수준의 LMM 연구에 더욱 쉽게 접근할 수 있기를 기대한다. 코드와 모델은 공개될 예정이다.
Introduction
대규모 멀티모달 모델(LMM)은 범용 어시스턴트로 나아가기 위한 핵심 구성 요소이기 때문에 연구 커뮤니티에서 점점 더 큰 주목을 받고 있다. 최근 LMM 연구는 visual instruction tuning이라 불리는 핵심 개념으로 수렴하고 있다. 그 결과는 유망하다. 예를 들어 LLaVA와 MiniGPT-4는 자연스러운 지시 수행 능력과 시각적 추론 능력에서 인상적인 결과를 보여준다. LMM의 역량을 더욱 잘 이해하기 위해 여러 벤치마크가 제안되었다. 최근 연구들은 사전학습 데이터, 지시 수행 데이터, 비전 인코더, 또는 언어 모델의 규모를 각각 확장함으로써 성능을 더욱 향상시킬 수 있음을 보여준다. 또한 LLaVA 아키텍처는 region-level 및 pixel-level 이해, 생의학 어시스턴트, 이미지 생성, 적대적 연구를 포함한 다양한 다운스트림 과제와 도메인에 활용되고 있다.
그러나 많은 벤치마크와 발전에도 불구하고, 범용 어시스턴트를 목표로 LMM을 학습하기 위한 최적의 방법이 무엇인지는 여전히 명확하지 않다. 예를 들어 LLaVA는 대화형 시각 추론에 뛰어나며, 이러한 벤치마크에서는 이후에 제안된 InstructBLIP과 같은 방법보다도 우수한 성능을 보인다. 반면 InstructBLIP은 단일 단어나 짧은 답변을 요구하는 전통적인 VQA 벤치마크에서 뛰어난 성능을 보인다. 두 모델은 아키텍처와 학습 데이터 측면에서 상당한 차이가 있으므로, 학습 데이터의 양이나 Qformer와 같은 리샘플러의 사용 등이 원인일 것이라는 추측에도 불구하고, 두 모델의 역량 차이가 발생하는 근본적인 원인은 여전히 명확하지 않다. 이를 해결하기 위해 우리는 통제된 환경에서 LMM의 설계 선택지를 조사하는 최초의 체계적인 연구를 제시한다. 본 연구는 LLaVA에서 출발하며, 입력, 모델, 데이터의 관점에서 효과적인 요소들을 신중하게 적용하여 하나의 로드맵을 구축한다.
먼저, 우리는 LLaVA의 fully-connected vision-language connector가 놀라울 정도로 강력하고 데이터 효율적임을 밝히고, LLaVA 프레임워크를 기반으로 더욱 강력하면서도 실현 가능한 베이스라인을 구축한다. 구체적으로 MLP 기반 크로스모달 커넥터를 사용하고 VQA와 같은 학술 과제 관련 데이터를 추가하는 두 가지 간단한 개선은 LLaVA 프레임워크와 독립적으로 적용할 수 있으며, 이를 LLaVA에 적용하면 멀티모달 이해 능력이 향상된다는 것을 보인다. 수억 개 또는 수십억 개의 이미지-텍스트 쌍을 이용해 특별히 설계된 시각적 리샘플러를 학습하는 InstructBLIP이나 Qwen-VL과 달리, LLaVA는 LMM 중에서도 가장 단순한 아키텍처 설계 중 하나를 사용하며, 단지 60만 개의 이미지-텍스트 쌍으로 간단한 완전 연결 프로젝션 계층만을 학습하면 된다. 최종 모델은 단일 8-A100 장비에서 약 하루 만에 학습을 완료할 수 있으며, 다양한 벤치마크에서 최고 수준의 성능을 달성한다. 또한 학습에 자체 보유 데이터를 포함하는 Qwen-VL과 달리, LLaVA는 공개적으로 이용 가능한 데이터만 사용한다.
다음으로 우리는 대규모 멀티모달 모델의 다른 미해결 문제들을 초기 단계에서 탐구한다. 주요 발견은 다음과 같다.
① 고해상도 이미지 입력으로의 확장
이미지를 단순히 격자 형태로 분할함으로써 LLaVA 아키텍처를 더 높은 해상도로 유연하게 확장할 수 있으며, 동시에 데이터 효율성을 유지할 수 있음을 보인다. 입력 해상도가 증가하면 모델의 세부 정보 인식 능력이 향상되고 환각 현상이 감소한다.
② Compositional capabilities
대규모 멀티모달 모델이 여러 능력을 조합해야 하는 과제에도 일반화할 수 있음을 확인한다. 예를 들어 긴 형식의 언어 추론과 짧은 형식의 시각 추론을 함께 학습하면 멀티모달 질문에 대한 모델의 글쓰기 능력을 향상시킬 수 있다.
③ 데이터 효율성
LLaVA의 혼합 학습 데이터를 무작위로 최대 75%까지 줄이더라도 모델 성능이 크게 감소하지 않음을 보인다. 이는 더욱 정교한 데이터셋 압축 전략을 사용하면 이미 효율적인 LLaVA의 학습 파이프라인을 추가로 개선할 수 있음을 시사한다.
④ 데이터 스케일링
환각과 같은 부작용을 발생시키지 않으면서 모델의 역량을 향상시키기 위해서는 데이터의 세밀도와 모델의 처리 역량을 함께 확장하는 것이 중요하다는 실증적 근거를 제시한다.
요약하면, 우리는 대규모 멀티모달 모델의 학습에 대한 체계적인 연구를 수행하고, LMM의 멀티태스크 학습과 효과적인 스케일링 사이의 균형을 맞추기 위한 간단하면서도 효과적인 방법을 제안한다. 개선된 베이스라인인 LLaVA-1.5는 공개 데이터만을 사용하면서도 광범위한 11개 과제에서 최고 수준의 성능을 달성하며, 기존 방법보다 훨씬 높은 데이터 효율성을 보인다. 기존 접근법을 재검토하고 시각적 지시 튜닝의 미해결 문제를 탐구함으로써, 우리는 더욱 강건하고 뛰어난 LMM 시스템으로 나아갈 수 있는 길을 제시한다. 이러한 개선된 베이스라인은 쉽게 재현할 수 있으므로, 향후 오픈소스 LMM 연구를 위한 참고 기준이 되기를 기대한다.
Related Work
ⓐ Instruction-following LMMs
일반적인 아키텍처는 시각 특징을 인코딩하는 pretrained vision backbone, 사용자의 지시를 이해하고 응답을 생성하는 pretrained LLM, 그리고 vision encoder의 출력을 언어 모델과 정렬하는 vision-language cross-modal connector로 구성된다.

LLaVA는 아마도 LMM을 위한 가장 단순한 아키텍처일 것이다. 선택적으로 Qformer와 같은 비주얼 리샘플러를 사용하여 시각 패치의 수를 줄이기도 한다. Instruction-following LMM의 학습은 일반적으로 두 단계의 절차를 따른다. 첫째, 비전-언어 정렬 사전학습 단계에서는 이미지-텍스트 쌍을 활용하여 시각 특징을 언어 모델의 단어 임베딩 공간과 정렬한다. 초기 연구들은 비교적 적은 수의 이미지-텍스트 쌍, 예를 들어 약 60만 개 또는 약 600만 개를 사용했다. 반면 일부 최근 연구들은 LMM의 성능을 극대화하기 위해 특정 언어 모델용 비전-언어 커넥터를 1억 2,900만 개 또는 14억 개와 같은 대규모 이미지-텍스트 쌍으로 사전학습한다. 둘째, 시각적 지시 튜닝 단계에서는 시각 콘텐츠와 관련된 사용자의 다양한 지시 요청을 모델이 따를 수 있도록 시각적 지시 데이터로 모델을 튜닝한다. 이미지를 격자로 나누어 LMM에서 고해상도를 처리하는 방법은 동시기 연구들에서도 다루어졌다.
ⓑ Multimodal instruction-following data
자연어 처리 분야의 연구들은 지시 수행 데이터의 품질이 최종 지시 수행 모델의 역량에 큰 영향을 미친다는 것을 보여준다. 시각적 지시 튜닝과 관련해 LLaVA는 텍스트만 처리하는 GPT-4를 활용하여 기존 COCO 의 바운딩 박스 및 캡션 데이터셋을 멀티모달 지시 수행 데이터셋으로 확장한 선구적인 연구이다. 이 데이터셋은 대화형 질의응답, 상세 설명, 복잡한 추론이라는 세 종류의 지시 수행 데이터로 구성된다. LLaVA의 파이프라인은 텍스트 이해, 백만 단위 규모의 데이터, 영역 수준 대화로 확장하는 데 활용되었다. InstructBLIP은 모델의 시각적 역량을 더욱 향상하기 위해 학술 과제 중심의 VQA 데이터셋을 포함한다. 반면 이러한 단순한 데이터 병합이 모델을 VQA 데이터셋에 과적합시켜 자연스러운 대화에 제대로 참여하지 못하게 할 수 있음이 지적됐다. 해당 연구의 저자들은 추가로 LLaVA 파이프라인을 활용하여 VQA 데이터셋을 대화형 형식으로 변환하는 방법을 제안한다. 이 방법은 학습에는 효과적이지만, 데이터 규모를 확장할 때 추가적인 복잡성을 발생시킨다. 그러나 자연어 처리 분야의 FLAN 계열 연구는 지시 튜닝에 다수의 학술 언어 과제를 추가하면 일반화 능력을 효과적으로 향상할 수 있음을 보여준다. 이에 따라 본 연구에서는 멀티모달 모델이 자연스러운 대화와 학술 과제 사이의 균형을 맞추지 못하는 근본적인 원인을 조사하고자 한다.
Approach
ⓐ Preliminaries
visual instruction tuning의 선구적인 연구인 LLaVA는 실제 환경의 시각적 지시 수행 과제를 다루는 다양한 벤치마크에서 이후에 제안된 모델들보다도 뛰어난 성능을 보이며, 우수한 시각적 추론 능력을 입증한다. LLaVA는 하나의 선형 계층을 사용하여 시각 특징을 언어 공간으로 프로젝션하며, 시각적 지시 튜닝을 위해 전체 LLM을 최적화한다. 그러나 LLaVA는 일반적으로 단답형 응답, 예를 들어 단일 단어를 요구하는 학술 벤치마크에서는 성능이 부족하다. 또한 학습 데이터 분포에 이러한 데이터가 부족하기 때문에 예/아니요 질문에 대해 ‘예’라고 대답하는 경향을 보인다.
반면 InstructBLIP은 LLaVA-Instruct와 함께 VQA-v2와 같은 학술 과제 중심의 데이터셋을 도입한 선구적인 연구이며, VQA 벤치마크에서 향상된 성능을 보여준다. InstructBLIP은 1억 2,900만 개의 이미지-텍스트 쌍을 사용하여 Qformer를 사전학습하고, 시각적 지시 튜닝 단계에서는 지시를 인식하는 Qformer만을 파인튜닝한다. 그러나 최근 연구에 따르면 InstructBLIP은 실제 환경의 시각적 대화 과제에서는 LLaVA만큼 좋은 성능을 보이지 못한다. 구체적으로 표에 나타난 것처럼, 상세한 응답이 필요한 요청에서도 단답형 응답으로 구성된 VQA 학습 데이터셋에 과적합될 수 있다.

ⓑ Response Format Prompting
자연스러운 응답과 단답형 응답을 모두 포함하는 지시 수행 데이터를 활용하는 InstructBLIP과 같은 접근법이 단답형 VQA와 장문형 VQA 사이에서 균형을 맞추지 못하는 문제는 주로 다음과 같은 이유에서 발생한다는 것을 확인하였다. 첫째, 응답 형식에 관한 프롬프트가 모호하다. 예를 들어 Q: {질문} A: {답변}과 같은 형식이다. 이러한 프롬프트는 원하는 출력 형식을 명확하게 나타내지 않기 때문에, 자연스러운 시각적 대화에서도 LLM이 단답형 응답을 생성하도록 행동적으로 과적합될 수 있다. 둘째, LLM을 파인튜닝하지 않는다. InstructBLIP이 지시 튜닝 과정에서 Qformer만 파인튜닝하기 때문에 첫 번째 문제가 더욱 심해진다. 이 방식에서는 prefix tuning과 마찬가지로 Qformer의 시각 출력 토큰이 LLM 출력의 길이를 장문형 또는 단답형으로 제어해야 한다. 그러나 Qformer는 LLaMA와 같은 LLM에 비해 용량이 제한적이므로 이를 적절히 수행할 능력이 부족할 수 있다.
따라서 InstructBLIP의 문제를 해결하면서 LLaVA가 단답형 응답을 더 잘 처리할 수 있도록, 출력 형식을 명확히 나타내는 response formatting prompt를 사용할 것을 제안한다. 단답형 응답을 유도할 때 VQA 질문의 마지막에 다음 문장을 추가한다. “단일 단어나 구문을 사용하여 질문에 답하시오.” 이러한 프롬프트로 LLM을 파인튜닝하면 LLaVA는 사용자의 지시에 맞춰 출력 형식을 적절하게 조절할 수 있다.

또한 ChatGPT를 사용하여 VQA 답변을 추가로 가공할 필요가 없으므로 , 다양한 데이터 소스로 더욱 쉽게 확장할 수 있다. 학습에 VQAv2를 추가하는 것만으로 LLaVA의 MME 성능은 809.6에서 1323.8로 크게 향상되며, InstructBLIP보다 111점 높은 성능을 달성한다.

ⓒ Scaling the Data and Model
MLP vision-language connector
선형 프로젝션을 MLP로 변경하여 자기지도학습의 성능이 향상된 연구 에서 영감을 받아, 기존의 선형 프로젝션과 비교했을 때 2계층 MLP를 통해 vision-language connector의 표현력을 높이면 LLaVA의 멀티모달 역량을 향상할 수 있음을 확인하였다.

Academic task oriented data
모델의 다양한 역량을 강화하기 위해 VQA, OCR 및 영역 수준 인식을 위한 학술 과제 중심의 VQA 데이터셋을 추가로 포함한다. 먼저 InstructBLIP에서 사용한 데이터셋 중 네 가지를 추가한다. 여기에는 오픈 지식 VQA인 OKVQA와 A-OKVQA, 그리고 OCR 데이터셋인 OCRVQA 와 TextCaps가 포함된다. A-OKVQA는 객관식 질문으로 변환하며, 다음과 같은 특정 응답 형식 지정 프롬프트를 사용한다. “주어진 선택지에서 정답 선택지의 알파벳을 직접 답하시오.” InstructBLIP이 사용하는 데이터셋의 일부만을 활용했음에도 LLaVA는 세 과제 모두에서 이미 InstructBLIP을 능가한다. 이는 LLaVA의 설계가 효과적이라는 것을 보여준다. 또한 영역 수준 VQA 데이터셋인 Visual Genome과 RefCOCO를 추가하면 세밀한 시각적 세부 정보를 위치화하는 모델의 능력이 향상된다는 것을 확인하였다.
Additional scaling
LLM이 이미지의 세부 정보를 명확히 볼 수 있도록 비전 인코더를 CLIP에서 사용할 수 있는 가장 높은 해상도의 모델인 CLIP-ViT-L-336px로 교체하고, 입력 이미지 해상도를 336으로 확장한다. 또한 추가적인 시각 지식의 원천으로 GQA 데이터셋을 추가한다. ShareGPT 데이터도 포함하고, LLM의 규모를 13B로 확장한다. MM-Vet 결과에서는 LLM을 13B로 확장했을 때 가장 큰 성능 향상이 나타난다. 이는 시각적 대화에서 기반 LLM의 역량이 중요하다는 것을 보여준다.
LLaVA-1.5
이러한 수정 사항을 모두 적용한 최종 모델을 LLaVA-1.5라고 명명한다. 이는 표 2의 마지막 두 행에 해당하며, 기존 LLaVA를 크게 능가하는 인상적인 성능을 달성한다.
Computational cost
LLaVA-1.5에서는 기존 LLaVA와 동일한 사전학습 데이터셋을 사용하고, 지시 튜닝의 학습 반복 횟수와 배치 크기도 대략 동일하게 유지한다. 입력 이미지 해상도가 336으로 증가했기 때문에 LLaVA-1.5의 학습 시간은 LLaVA보다 약 2배 길다. A100 GPU 8장을 사용할 때 사전학습에는 약 6시간, 시각적 지시 튜닝에는 약 20시간이 소요된다.
ⓓ Scaling to Higher Resolutions
3.3절에서는 입력 이미지의 해상도를 높이는 것이 모델의 역량을 향상한다는 이점을 확인하였다. 그러나 기존 오픈소스 CLIP 비전 인코더가 지원하는 이미지 해상도는 336으로 제한되어 있다. 따라서 3.3절에서 수행한 것처럼 비전 인코더를 단순히 교체하는 방식으로는 더 높은 해상도의 이미지를 지원할 수 없다. 본 절에서는 LLaVA-1.5의 데이터 효율성을 유지하면서 LMM을 더 높은 해상도로 확장하는 방법을 초기 단계에서 탐구한다.
ViT를 비전 인코더로 사용하는 경우, 기존 방법들은 해상도를 높이기 위해 주로 positional embedding interpolation을 수행하고, 파인튜닝 과정에서 ViT 백본이 새로운 해상도에 적응하도록 한다. 그러나 이러한 방식은 일반적으로 대규모 이미지-텍스트 쌍 데이터셋을 사용하여 모델을 파인튜닝해야 하며, 추론 시 LMM이 입력받을 수 있는 이미지 해상도를 고정된 크기로 제한한다.
대신, 이미지를 비전 인코더가 원래 학습된 해상도와 동일한 크기의 작은 이미지 패치들로 분할하고 각 패치를 독립적으로 인코딩함으로써 이러한 문제를 해결한다. 개별 패치의 특징 맵을 얻은 후, 이를 목표 해상도에 해당하는 하나의 큰 특징 맵으로 결합하고 LLM에 입력한다. 또한 LLM에 이미지의 global context을 제공하고 분할-인코딩-병합split-encode-merge 연산에서 발생하는 아티팩트를 줄이기 위해, 다운샘플링된 이미지의 특징을 병합된 특징 맵에 추가로 연결한다. 이 방법을 통해 입력 이미지를 임의의 해상도로 확장하면서도 LLaVA-1.5의 데이터 효율성을 유지할 수 있다. 이렇게 만들어진 모델을 LLaVA-1.5-HD라고 부른다.
Empirical Evaluation
ⓐ Benchmarks
우리는 학술 과제 중심의 벤치마크와 지시 수행 LMM을 위해 최근에 특별히 제안된 벤치마크를 모두 포함하여, 총 12개의 벤치마크에서 LLaVA-1.5를 평가한다. 학술 과제 중심 벤치마크 중 VQA-v2와 GQA는 개방형 단답 질문을 통해 모델의 시각적 인식 능력을 평가한다. VizWiz는 시각장애인이 제시한 시각적 질문에 대한 모델의 제로샷 일반화 능력을 평가하기 위해 8,000개의 이미지를 포함한다. InstructBLIP을 따라, 객관식 문제로 구성된 ScienceQA의 이미지 하위 집합을 사용하여 과학 질의응답에 대한 제로샷 일반화 능력을 평가한다. TextVQA는 텍스트가 풍부하게 포함된 이미지에 관한 시각적 질의응답 데이터셋이다.
지시 수행 LMM을 위해 최근 제안된 벤치마크 중 POPE는 COCO에서 추출한 세 가지 하위 집합인 random, common, adversarial 집합을 통해 모델의 환각 정도를 평가하며, 세 분할 모두에 대한 F1 점수를 보고한다. 다른 벤치마크들은 서로 다른 응답 형식을 사용하여 광범위한 도메인과 응용 분야에서 모델의 역량을 평가한다. MME-Perception 은 예/아니요 질문을 통해 모델의 시각적 인식 능력을 평가한다. MMBench는 객관식 선택지의 순서를 전반적으로 섞어 모델 응답의 강건성을 평가한다. MMBench-CN은 MMBench를 중국어로 번역한 버전이다. SEED-Bench는 객관식 문제를 통해 이미지와 비디오 모두에 대한 모델의 성능을 평가한다. 비디오의 정확도를 평가할 때는 비디오의 중간 프레임을 샘플링하여 사용한다. LLaVA-Bench-in-the-Wild와 MM-Vet은 다양한 과제에서 모델이 시각적 대화를 수행하는 역량을 평가하며, GPT-4 평가를 통해 응답의 정확성과 유용성을 측정한다.
ⓑ Results
LLaVA-1.5는 다른 방법들보다 사전학습 및 지시 튜닝에 훨씬 적은 데이터를 사용했음에도, 12개 벤치마크에서 가장 우수한 종합 성능을 달성한다. LLaVA-1.5는 지시 수행 LMM을 위한 모든 벤치마크에서 기존 LLaVA보다 상당히 높은 성능을 보인다. 다만 VQA-v2처럼 개방형 단답 응답을 요구하는 학술 데이터셋에서 기존 LLaVA를 평가하는 것은 어렵다는 점에 유의해야 한다.
LLaVA-1.5-HD를 통해 이미지 해상도를 448까지 더욱 높이면 모든 벤치마크에서 전반적인 성능이 추가로 향상된다. 특히 MM-Vet의 OCR이나 LLaVA-Bench-in-the-Wild의 상세 설명과 같이 이미지의 세부 정보를 인식해야 하는 과제에서 뚜렷한 향상이 나타난다. 또한 global context을 추가하면 분할 및 병합 과정에서 발생한 아티팩트로부터 모델의 성능을 효과적으로 회복시키고, 모델이 고해상도 특징에서 관련 영역을 더욱 쉽게 찾도록 유도한다는 것을 확인하였다.
LLaVA-1.5가 가장 단순한 아키텍처, 학술 연구 수준의 컴퓨팅 자원, 공개 데이터셋만으로 최고 성능을 달성했다는 점은 고무적이다. 또한 완전히 재현할 수 있고 비용 부담이 적은 향후 연구용 베이스라인을 제공한다. 이러한 결과는 시각적 지시 튜닝이 LMM의 역량을 향상하는 데 중요한 역할을 한다는 것을 보여준다. 동시에 CLIP, OpenCLIP, EVA-CLIP 등의 비전 인코더가 이미 웹 규모의 이미지-텍스트 쌍으로 사전학습되었음에도, LMM에 대규모 비전-언어 정렬 사전학습이 필요하다는 일반적인 믿음에 의문을 제기한다. LLaVA-1.5는 7B 모델조차 크로스모달 연결을 위해 수십억 개의 학습 가능 파라미터를 사용하는 Flamingo 계열의 80B IDEFICS보다 높은 성능을 달성한다. 이는 멀티모달 지시 수행 역량의 관점에서 비주얼 샘플러의 이점과 추가적인 대규모 사전학습의 필요성을 다시 생각하게 한다.
Global context
고해상도 입력을 처리할 때 이미지를 패딩하고 224 크기의 단일 이미지로 조정한 뒤, 그 특징을 고해상도 특징과 연결하여 전역적 맥락을 제공한다. 7B 모델을 사용한 절제 실험 결과, 전역적 맥락은 세 가지 검증 벤치마크 모두에서 성능을 효과적으로 향상한다.
ⓒ Emerging Properties
Format instruction generalization
LLaVA-1.5는 제한된 수의 형식 지시만으로 학습되었지만, 학습 과정에서 접하지 않은 다른 형식 지시에도 일반화한다. 먼저 VizWiz에서는 주어진 정보가 질문에 답하기에 충분하지 않을 때 모델이 “Unanswerable”이라고 출력해야 한다. 본 연구의 응답 형식 지정 프롬프트는 모델이 이를 효과적으로 수행하도록 지시하며, 답변할 수 없는 질문에 대한 성능을 11.1%에서 67.8%로 향상한다.
Multilingual multimodal capability
LLaVA-1.5는 다국어 멀티모달 지시 수행을 위해 전혀 파인튜닝되지 않았으며, VQA를 포함한 모든 시각적 지시 데이터가 영어로 구성되어 있다. 그런데도 LLaVA-1.5가 다국어 지시를 따를 수 있음을 확인하였다. 이는 부분적으로 ShareGPT에 포함된 다국어 언어 지시 덕분이다. ShareGPT의 지시 데이터에는 이미지가 포함되어 있지 않지만, 모델은 이 데이터셋을 통해 사용자의 요청에 대응하는 언어로 적응적으로 응답하는 행동을 학습한다. 본 연구에서는 이러한 행동이 시각적 대화로도 전이된다는 것을 실험적으로 보인다. 또한 MMBench의 질문을 중국어로 변환한 MMBench-CN에서 모델의 중국어 일반화 능력을 정량적으로 평가한다. 주목할 점은 Qwen-VL-Chat은 중국어 멀티모달 지시로 파인튜닝된 반면 LLaVA-1.5는 그렇지 않음에도, LLaVA-1.5가 Qwen-VL-Chat보다 7.3%p 높은 성능을 달성했다는 것이다(63.6% 대 56.7%).
ⓓ Ablation on LLM Choices
자연어 처리 분야의 연구 결과는 기반 LLM의 역량이 해당 모델을 지시 튜닝한 후속 모델의 역량에 영향을 줄 수 있음을 보여준다. 본 절에서는 두 가지 LLM 계열을 살펴보고, 이들이 최종 모델의 멀티모달 역량에 어떻게 기여하는지 분석한다. 두 계열은 LLaMA 기반 모델인 Vicuna-v1.1과 Vicuna-v1.3, 그리고 LLaMA-2 기반 모델인 Vicuna-v1.5와 LLaMA-2-Chat이다. Vicuna-v1.3과 Vicuna-v1.5는 동일한 약 15만 개의 ShareGPT 데이터를 사용하며, 이는 v1.1에서 사용한 데이터의 약 2배이다. 지도 지시 파인튜닝(supervised instruction finetuning)만으로 학습되는 Vicuna 계열과 달리, LLaMA-2-Chat은 인간 피드백 기반 강화학습(reinforcement learning from human feedback)을 통해 추가로 최적화된다. 이러한 모델 변형들의 상대적 성능을 시각화한다.

첫째, Vicuna-v1.5가 가장 우수한 종합 성능을 달성하며, LLaMA-2 기반 모델들이 일반적으로 LLaMA-1 기반 모델들보다 더 좋은 성능을 보인다는 것을 확인하였다. 이는 기반 언어 모델의 역량이 중요하다는 것을 보여준다. 이러한 사실은 MMBench-CN의 결과에서도 추가로 확인된다. Vicuna-v1.3과 v1.5는 지시 튜닝에 동일한 ShareGPT 데이터를 사용했지만, Vicuna-v1.3의 중국어 일반화 성능은 v1.5보다 상당히 낮다.
둘째, 언어 지시 튜닝은 각 데이터셋에서 요구되는 특정 역량에 중요한 영향을 미친다. 예를 들어 LLaMA-2-Chat과 Vicuna-v1.5는 MMBench에서 거의 동일한 성능을 보이지만, LLaMA-2-Chat의 MMBench-CN 일반화 성능은 Vicuna-v1.5보다 낮다. 이는 부분적으로 LLaMA-2-Chat의 SFT 및 RLHF 데이터 대부분이 영어로 구성되어 있으며, ShareGPT만큼 많은 다국어 데이터를 포함하지 않기 때문이다. 또한 TextVQA에서는 모델이 이미지 속의 글자를 인식하는 능력뿐만 아니라 OCR 엔진이 생성한 잡음이 포함된 출력도 처리할 수 있어야 한다. 이러한 종류의 잡음은 ChatGPT의 실제 일상 사용 과정에서 수집된 ShareGPT 데이터에서 더 자주 관찰될 수 있다.


Conclusion
본 논문에서는 대규모 멀티모달 모델의 설계를 명확히 이해하기 위한 한 걸음을 내딛고, 대규모 멀티모달 모델을 위한 간단하고 효과적이며 데이터 효율적인 베이스라인인 LLaVA-1.5를 제안한다. 또한 시각적 지시 튜닝의 미해결 문제를 탐구하고, LMM을 더 높은 해상도로 확장하며, LMM의 모델 환각과 조합적 능력 측면에서 몇 가지 흥미로운 발견을 제시한다. 이러한 개선되고 쉽게 재현할 수 있는 베이스라인과 새로운 발견이 향후 오픈소스 LMM 연구를 위한 참고 자료가 되기를 기대한다.