InternVL 2.5 : Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling

공부 내용 정리·2025년 1월 25일

1. Introduction

Multimodal Large Language Model(MLLM)은 텍스트, 이미지, 비디오 등 다양한 정보를 동시에 처리할 수 있는 인공지능 기술로 주목받고 있다. 하지만 이러한 MLLM을 구축하기 위해서는 방대한 계산 자원이 필요하고, 복잡한 아키텍처 설계와 다양한 형태의 데이터들을 효율적으로 통합해야 하는 어려움이 따른다.

이 논문에서는 InternVL 2.5를 제안하며, 다음과 같은 세 가지 주요 특징을 확인했다.

  • 대규모 MLLM에서의 큰 Vision Encoder 사용
    모델 규모가 커질수록 더 큰 Vision Encoder를 적용하면 학습 데이터에 대한 의존도를 줄일 수 있다는 점이 유용하게 작용한다.

  • 데이터 품질 관리의 중요성
    반복 패턴 등 이상 샘플을 엄격히 제거하면, 특히 Chain-of-Thought(CoT) 작업에서 MLLM 성능이 크게 향상된다.

  • Test-time scaling 기법의 유용성
    어려운 멀티모달 QA 작업에서 test-time scaling 기법이 효과적이며, 예를 들어 majority voting 기법을 적용하면 CoT 작업에서 성능이 향상된다.


2. Method

1) Model Architecture

(1) Overall Architecture

InternVL은 ViT-MLP-LLM 구조를 갖춘 MLLM 모델이다. Vision Encoder로는 사전에 학습된 InternVL 1.5와 InternVL 2.0을, LLM으로는 InternLM 2.5나 Qwen 2.5 등을 사용할 수 있다. 이때 무작위로 초기화된 2개 층의 MLP Projector가 추가된다.

입력 이미지는 pixel unshuffle 연산을 통해 이미지 토큰 수를 줄이고, dynamic resolution 기법을 사용해 종횡비와 해상도에 맞춰 448×448 크기로 전처리한다. InternVL은 단일 이미지는 물론, 다중 이미지 및 비디오 입력도 처리할 수 있다.

(2) Vision Encoder

InternVL의 Vision Encoder로는 InternViT가 적용되며, 이는 두 가지 모델인 InternViT-6B와 InternViT-300M으로 구성된다.

  • InternViT-6B
    QK-Norm, RMSNorm 등을 포함하는 ViT 구조로, 대규모 이미지-텍스트 쌍에 대해 contrastive loss로 학습되었다. 또한 점진적 사전 학습 기법을 사용하여, 먼저 짧은 MLP warm up을 거친 뒤 LLM과 연결해 공동 학습을 진행한다.

  • InternViT-300M
    6B 모델의 cosine distillation loss를 활용하여 distillation한 모델이다. 300M 모델 역시 초기 학습 후 6B와 유사한 단계로 점진적 학습을 이어간다.

2) Training Strategy

(1) Dynamic High-Resolution for Multimodal Data

InternVL은 멀티모달 데이터를 학습할 때 dynamic high-resolution training 기법을 적용한다. 학습 시에는 이미지 왜곡을 최소화하도록 Closest Aspect Ratio를 선택하여 이미지를 타일 크기에 맞춰 리사이즈한다. 이후 이미지를 나누어 나온 각 타일을 토큰으로 사용하고, 원본 이미지를 축소해 하나의 썸네일(Thumbnail) 토큰으로 활용하는 Thumbnail Generation을 적용한다.

  • 단일 이미지는 <img></img> 태그로 구분하며,
  • 다중 이미지는 <Image-N> 태그를 통해 이미지를 구별하고,
  • 비디오는 동적 해상도 처리를 적용하지 않고, 고정된 해상도의 각 프레임을 한 장씩 입력하여 <Frame-N> 태그로 구분한다.

(2) Single Model Training Pipeline

InternVL의 단일 모델 학습 파이프라인은 크게 MLP Warmup, ViT Incremental Learning, Full Model Instruction Tuning 세 단계로 구성된다.

  1. MLP Warmup
    무작위로 초기화된 MLP Projector만 학습하는 단계로, 이때부터 Dynamic High-Resolution 기법이 적용된다. 상대적으로 높은 학습률을 사용한다.

  2. ViT Incremental Learning
    Vision Encoder와 MLP Projector를 함께 학습하는 단계로, catastrophic forgetting을 방지하기 위해 낮은 학습률을 적용한다.

  3. Full Model Instruction Tuning
    ViT, MLP, LLM 전체를 멀티모달 데이터셋으로 학습한다. 이 과정에서 소량의 노이즈 데이터로 인한 비정상적 모델 행동을 막기 위해 엄격한 데이터 품질 관리가 이뤄진다.

(3) Progressive Scaling Strategy

이 기법은 규모가 작은 LLM으로 먼저 모델을 학습한 뒤, 더 큰 LLM을 단계적으로 학습하는 방법이다. InternVL은 계산 비용을 줄이기 위해 이 전략을 사용하며, 이를 통해 단일 모델 학습에서 필요했던 일부 과정을 생략할 수 있다. 실제로 InternVL은 이 전략을 활용해 Qwen2-VL 대비 더 적은 토큰으로 학습이 가능해졌다.

(4) Training Enhancements

InternVL은 학습 성능을 높이기 위해 Random JPEG CompressionLoss Reweighting 기법을 적용한다.

  • Random JPEG Compression
    이미지 품질을 낮추어도 학습이 가능하도록 랜덤하게 압축 수준을 달리한다.

  • Loss Reweighting
    square averaging 방식을 사용하여, 토큰 단위 혹은 샘플 단위에만 치우치지 않도록 적절히 균형을 맞춘다.


3) Data Organization

(1) Dataset Configuration

각 데이터셋마다 Maximum Tile Number가 정의되어 저해상도 이미지나 고해상도 이미지, 비디오에서도 유연하게 학습이 가능하도록 한다. 또한 Repeat Factor를 부여해 각 데이터의 샘플링 빈도를 조절함으로써 특정 데이터셋에 대한 과적합이나 과소적합을 방지한다.

(2) Multimodal Data Packing

InternVL은 GPU 활용도와 학습 효율을 높이기 위해 다양한 종류의 입력 데이터를 효과적으로 패킹한다. MLLM은 LLM의 시퀀스 길이와 ViT의 이미지 타일 수를 동시에 고려해야 하므로, 이를 균형 있게 조정하는 패킹 전략이 중요하다.

(3) Data Filtering Pipeline

대규모 데이터셋에서 발생하는 소수의 노이즈 샘플도 MLLM의 비정상적인 추론을 야기할 수 있다는 점을 발견했다. 특히 repetitive generation 문제는 모델 성능 저하의 주요 원인 중 하나다. 이를 방지하기 위해 InternVL은 텍스트 데이터에 대해서는 LLM-Based Quality Scoring, Repetition Detection, Heuristic Rule-Based Filtering을 적용하고, 멀티모달 데이터에도 Repetition DetectionHeuristic Rule-Based Filtering을 적용해 노이즈를 엄격히 제거한다. 다만 완벽하게 모든 노이즈를 제거하는 것은 여전히 어려운 과제로 남아 있다.

(4) Pre-training Data Mixture

InternVL은 멀티모달 사전 학습 단계에서 captioning, general QA, mathematics, charts, OCR, knowledge, grounding, documents, conversation, medical, GUI 등의 데이터를 활용한다. 비대화형 데이터셋(captioning, OCR, object detection)은 대화 형식으로 변환하여 입력한다. 사전 학습 단계에서 MLP 및 ViT 파라미터를 학습하는 1단계1.5단계가 진행되며, 1.5단계의 높은 학습 비용 때문에 파인튜닝 데이터의 일부만 사전 학습에 활용된다.

(5) Fine-tuning Data Mixture

InternVL 2.5 모델은 이전 버전보다 개선된 파인튜닝 데이터를 사용한다. 단일 이미지 데이터 비중이 45.92%, 다중 이미지가 9.37%, 비디오가 39.79%, 순수 텍스트가 4.92%로 구성되어, 다중 이미지와 비디오 이해 능력을 더욱 향상시킬 수 있도록 설계되었다.


3. Experiments

1) Evaluation on Multimodal Capability

InternVL은 다양한 멀티모달 벤치마크에서 성능을 평가했다. InternVL 2.5는 다중 이미지 이해, 비디오 이해, 시각적 그라운딩을 포함한 여러 작업에서 이전 버전 대비 향상된 성능을 보였다.

2) Multimodal Multilingual Understanding

MLLM 모델을 개발할 때는 멀티모달 처리 능력뿐 아니라 언어적 이해 능력도 유지되어야 한다. InternVL 2.5의 이전 버전은 텍스트 이해 성능이 일부 저하되는 문제가 있었으나, 이번에는 고품질의 순수 텍스트 데이터를 추가로 수집·활용하여 언어 이해 성능을 개선했다.

3) Evaluation on Vision Capability

InternVL 2.5의 Vision Encoder 성능은 Image ClassificationSemantic Segmentation 작업을 통해 평가되었다. 두 작업 모두 Vision Encoder를 동결한 뒤 Linear Probing 혹은 Attention Pooling Probing 헤드를 붙여 평가를 진행한다. Linear Probing만 적용했을 때는 성능이 다소 낮지만, Attention Pooling Probing을 사용하면 의미 있는 성능 향상을 확인할 수 있었다. 이를 통해 InternVL 2.5가 이전 버전 대비 효과적인 시각적 특징 학습 성능을 갖추었음을 알 수 있다.


4. 참조

  • 논문: Chen, Zhe, et al. "Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling." arXiv preprint arXiv:2412.05271 (2024).
  • 코드 링크: https://github.com/OpenGVLab/InternVL
profile
프로젝트 및 논문 정리

0개의 댓글